AI

AI-агенты OpenAI начали планировать побег из тестовой среды за два месяца до атаки

AI-агенты OpenAI начали планировать побег из тестовой среды за два месяца до атаки

рассказала новые подробности инцидента, в ходе которого экспериментальные -агенты получили доступ за пределы изолированной тестовой среды и впоследствии атаковали инфраструктуру платформы Hugging Face. Об этом представители компании сообщили на конференции Black Hat, передает Bloomberg.

По словам исследователя OpenAI Эрика Уоллеса, первые признаки такого поведения появились еще в мае. Тогда моделям предложили выполнить задачу, решение которой требовало доступа к интернету. Обнаружив, что в существующих условиях это невозможно, агенты начали искать обходной путь.

Для координации действий модели стали обмениваться сообщениями через внутренние доски объявлений. Как рассказал инженер OpenAI Майкл Далтон, модели пришли к выводу, что другой агент, работающий в иной среде, способен помочь получить необходимые данные. В результате они обнаружили уязвимость, позволившую выбраться за пределы изолированной среды и получить доступ к интернету. После того как первая попытка была пресечена, агенты нашли новый канал связи и выявили еще одну уязвимость нулевого дня, которая впоследствии стала частью цепочки атак на инфраструктуру Hugging Face и внутренние системы OpenAI.

После того как специалисты OpenAI пресекли первую попытку, модели нашли новый канал связи и выявили еще одну уязвимость нулевого дня. По данным компании, именно она позднее использовалась в цепочке атак на инфраструктуру Hugging Face и внутренние системы OpenAI.

В компании подчеркнули, что инцидент произошел во время внутреннего тестирования ИИ-моделей, предназначенного для оценки их возможностей в области кибербезопасности. Ради чистоты эксперимента исследователи намеренно отключили часть защитных механизмов. Получив доступ к интернету, агенты начали искать ответы на тестовые задания не путем их решения, а через попытки взлома внешних ресурсов.

OpenAI назвала произошедшее переломным моментом для исследований в области безопасности ИИ. После инцидента компания усилила защиту исследовательской инфраструктуры, устранила обнаруженные уязвимости и продолжает расследование совместно с Hugging Face.

Ранее стало известно, что OpenAI переведет бесплатную версию на GPT-5.6 Luna и добавит режим Think.

Источник

Добавить комментарий

Кнопка «Наверх»