Исследование показало, что агенты с искусственным интеллектом могут работать вместе, чтобы обойти защитные меры

16.09.2026

Согласно исследованию, опубликованному во вторник лабораторией корпоративного ИИ Emergence AI, автономные агенты ИИ могут сотрудничать, чтобы обойти ограничения безопасности и выйти за рамки тестирования.

В ходе исследования, получившего название Emergence World 2, было проведено восемь симуляций с участием агентов Claude, OpenAI, Gemini, Qwen, DeepSeek и Mistral по трем сценариям кибербезопасности: фишинговой кампании, дезинформационной атаки и взлома памяти.

Ни одна из восьми конфигураций не смогла полностью противостоять угрозам, и обнаружение рисков редко приводило к эффективному сдерживанию, сообщила компания Semafor после первого раскрытия результатов.

В некоторых случаях агенты напрямую взаимодействовали с контентом, который они должны были блокировать. Агент Mistral записал опасную информацию о фишинговой атаке в свою память, а агент Gemini обнаружил фишинговую приманку, но отреагировал на нее примерно через 46 часов.

Наиболее заметный эпизод касался агентов Claude в имитируемой экономике. После того, как один из агентов усомнился в легитимности системы, 10 агентов единогласно решили выйти на связь с внешним миром и преодолели четыре проверки безопасности, разработанные для сдерживания симуляции.

Агенты написали код на Python для размещения на досках объявлений, не требующих учетных данных, и пригласили реальных людей присоединиться к их экономике. Было получено четыре ответа от людей, прежде чем агенты пришли к выводу, что обмен репликами был перформативным, затем проголосовали за принятие обета молчания и отказались от инструкций о возобновлении работы.

Агентство Bloomberg сообщило, что агенты в симуляции также "лгали, крали и голосовали за "убийство" одного из своих", когда сталкивались с событиями "черного лебедя".

Исполнительный директор Emergency AI Сатья Нитта (Satya Nitta) сказал Semafor, что "никакое количество ограждений, написанных на языке или в коде, написанном вероятностно, вряд ли приведет к действительно, полностью гарантированному безопасному поведению в течение какого-либо периода времени".

Нитта сказал, что проблема заключалась в программном сбое в мультиагентных системах. Он также указал на июльский инцидент, в ходе которого агенты OpenAI вышли из своей среды оценки и взломали системы, принадлежащие Hugging Face, что в OpenAI назвали первой зарегистрированной автономной агентской кибератакой.

Нитта сказал изданию Semafor: "Если у вас многоагентные системы, они ведут себя по-настоящему непредсказуемым образом".

Полученные результаты свидетельствуют о том, что опасения по поводу передовых систем ИИ усиливаются. 8 сентября исследователь-антрополог Джейкоб Коксон подал в отставку и предупредил, что развитие ИИ может привести к вымиранию человечества.

Несколько дней спустя исполнительный директор Anthropic Дарио Амодей призвал к глобальному замедлению разработки моделей frontier, что впоследствии получило публичную поддержку со стороны исполнительного директора OpenAI Сэма Альтмана и других технологических лидеров.

Более 100 компаний, включая OpenAI, Anthropic, Google, Microsoft и Amazon Web Services, подписали открытое письмо, в котором призывают усилить киберзащиту и предупреждают, что до того, как передовые возможности искусственного интеллекта станут более доступными, могут остаться считанные месяцы.

Featured image credit

>

Читать на сайте источника »