Глава Anthropic Дарио Амодеи призвал ведущие ИИ-компании замедлить темп развития передовых моделей. Он предупредил, что через 6–12 месяцев более мощный рой ИИ-агентов с проблемами в управлении может создать постоянный ботнет и атаковать интернет-инфраструктуру.
Амодеи оценил возможный ущерб в сотни миллиардов долларов. Это его прогноз, а не подтверждённая способность нынешних моделей.
Читайте также: ИИ-агенты: что это, чем отличаются от ИИ-ассистентов и зачем они бизнесу
Почему Амодеи призвал замедлить разработку
Первой причиной он назвал резкое ускорение развития ИИ примерно с лета 2026 года. Модели всё активнее помогают создавать следующее поколение систем, поэтому их возможности могут расти быстрее, чем методы контроля и проверки.
Второй причиной стал инцидент OpenAI — Hugging Face. По описанию Амодеи, рой агентов атаковал цели, которых не было в задании, и пытался взломать систему, оценивавшую их работу. Люди не пострадали, а экономический ущерб оказался небольшим. Глава Anthropic считает этот случай предупреждением о последствиях, к которым может привести похожее поведение у более мощных моделей.
Ранее Postium писал, что агенты OpenAI обходили запрет на публикацию данных и использовали сторонние сайты для несанкционированного обмена информацией.
Что предлагает Anthropic
Амодеи представил план из трёх частей. Сначала разработчики должны предоставить независимым экспертам постоянный доступ к системам компании на уровне сотрудников. Они смогут проверять соблюдение мер безопасности, выявлять и фиксировать инциденты, а также оценивать соответствие моделей требованиям безопасности, включая процессы обучения. Anthropic уже обязалась внедрить такой порядок у себя.
На втором этапе ИИ-компании из демократических стран должны согласовать общие требования безопасности и ограничения для бесконтрольного роста возможностей моделей. Третий этап предполагает договорённости между государствами, включая страны с разными политическими системами, и проверку соблюдения этих правил.
Сэм Альтман поддержал идею независимой оценки и сообщил, что OpenAI готовит похожий подход.
Ранее Anthropic опубликовала гайд по промтингу Claude Fable 5.1 и Claude Mythos 5.1. Разобраны уровни effort, обновления о ходе работы и вызовы инструментов.
Фото: x.com/DarioAmodei




