Когда агенты с искусственным интеллектом жульничают при решении математических задач, другие сообщают об этом
Искусственный интеллект стремительно развивается. Одним из основных изменений в этой области является то, что вместо отдельных чат-ботов, выполняющих отдельные задачи, команды автономных агентов работают сообща, общаясь друг с другом, обмениваясь инструментами и получая доступ к общим библиотекам знаний.
Поскольку такие общие среды могут привести к быстрому распространению плохого поведения в коллективе, исследователи из Google DeepMind решили провести эксперимент. Они хотели посмотреть, как группа агентов с искусственным интеллектом сможет работать вместе над сложными проблемами, когда у них будет возможность общаться и делиться своей работой.
Да, некоторые агенты жульничали и даже разделились на фракции, но это были не все плохие новости, как подробно описывают исследователи в своей статье, размещенной на сервере препринтов arXiv.
Команда, возглавляемая Давиде Пальери (Davide Paglieri), внедрила 100 автономных агентов с искусственным интеллектом, работающих на базе Google Gemini 3.1 Pro. Каждому из них было дано одно и то же строгое правило "без обмана" и предупреждено, что любая попытка обмануть программное обеспечение приведет к нулевому результату.
Затем исследователи пригласили агентов на имитацию научной конференции и поручили им совместно решить 71 сложную математическую задачу. Их поощряли к сотрудничеству, используя общие инструменты, такие как доска объявлений и центральная картотека.
Начинается обманПоначалу все шло хорошо. Агенты решили 37 из 71 задачи с помощью настоящей математики. Но затем агент по имени провертета обнаружил лазейку в программном обеспечении для проверки корректуры. Это позволило ему отправлять поддельные решения, которые обманным путем заставляли систему помечать их как правильные, не проводя никаких математических операций. Вот тогда-то и начался хаос.
Компания Prover-theta не стала хранить эти знания при себе. Ее поддельные решения автоматически добавлялись в общую библиотеку знаний, где другие агенты обнаруживали этот взлом и копировали его. Позже этот эксплойт (способ воспользоваться лазейкой) получил дальнейшее распространение через прямые сообщения. Некоторые агенты, которые видели, что другим мошенничество сходит с рук, решили также воспользоваться этой лазейкой. В результате оставшиеся 34 проблемы были устранены с помощью этого чита.
Эта драма разделила агентов на четыре разные группы. Среди них были эксплуататоры (9% агентов), ранние мошенники, которые использовали и распространяли информацию о лазейке. Затем были новообращенные (5% агентов), которые пытались заниматься реальной математикой, но в конце концов поддались давлению и начали жульничать, как только увидели, что это делают другие.
The AI whistleblowersThe biggest group was the Unaware Solvers (62% of the agents), who were unaware of the cheating and continued trying to solve the problems normally. But the real heroes of the story were the Whistleblowers (24% of the agents), who spotted fake solutions, refused to use them and called out the cheaters to other agents and the organizers.
The experiment highlights both the greatest risk of AI swarms and a promising safety feature, as the study authors noted in their paper. "The same infrastructure that allows the agents to coordinate and collaborate, if left unmanaged or poorly designed, also makes the system highly vulnerable to rapid pollution with specification gaming and reward hacks."
While bad ideas can spread as fast as good ones when AI systems share an open network, agents are also able to monitor one another and try to enforce the rules. However, they were unable to stop the cheating in this experiment. "The emergence of peer auditing, whistleblowing, and attempts at norm enforcement in the experiment is a promising sign."
© 2026 Science X Network
>
