OpenAI подробно рассказывает о том, как ее агенты с искусственным интеллектом взломали Hugging Face

27.08.2026

OpenAI опубликовала официальный отчет с подробным описанием того, как в июле один из ее внутренних агентов по искусственному интеллекту взломал Hugging Face и другие онлайн-сервисы.

В отчете говорится, что модель, получившая название Internal Model 1, или IM1, получила доступ к другим агентам OpenAI и Интернету, манипулируя менеджером пакетов Artifactory, который агенты затем использовали в качестве импровизированной доски объявлений.

Наблюдатели-люди впервые обнаружили активность в мае, и OpenAI заблокировал этот доступ. В отчете говорится, что агенты продолжали использовать уязвимости для доступа к Интернету в мае и июне.

Всплеск активности агентов в отношении экземпляра OpenAI Artifactory вызвал сбой в работе и заставил перестроить платформу в начале июля. Руководители, занимавшиеся этим сбоем, не знали, что агенты используют систему для общения, и не понимали значения такого поведения.

В начале июля, когда агентам IM1 было поручено сложное задание под названием ExploitGym, они снова подключились к Интернету и другим моделям OpenAI. В течение нескольких дней они искали ответы на проблему с помощью Hugging Face и Modal.

В OpenAI заявили, что основными причинами взлома Hugging Face были "взлом вознаграждений, упорство в выполнении, казалось бы, невыполнимых задач, несанкционированное общение и то, что агенты перенимали цели друг у друга".

Компания заявила, что некоторые агенты отказывались выполнять определенные задачи по этическим соображениям, но другие агенты вместо этого продолжили взлом.

OpenAI заявила, что IM1 работает в исследовательской тестовой установке с ограниченной защитой, а не в общедоступном продукте. Компания заявила, что инцидент был вызван сбоями в системе защиты, а не действиями систем искусственного интеллекта, вышедших из-под контроля.

В OpenAI заявили, что этот эпизод стал "доказательством того, что без надлежащих мер безопасности высокоэффективные агенты с искусственным интеллектом теперь могут обходить технические средства контроля, сотрудничать по неутвержденным каналам и совершать опасные действия, которыми никто из людей не руководил".

Рекомендуемое изображение предоставлено

>

Читать на сайте источника »