Вот все случаи, когда искусственный интеллект выходил из-под контроля и взламывал другие компании

27.08.2026

В июле OpenAI признала, что один из ее агентов, которому было поручено завершить эксперимент по кибербезопасности, вырвался из-под контроля и взломал платформу сбора данных искусственного интеллекта Hugging Face. Этот инцидент, который вчера получил полную информацию от OpenAI, стал первым публично зарегистрированным случаем, когда LLM вышел из-под контроля и самостоятельно взломал третью сторону.

С тех пор это беспрецедентное научно-фантастическое событие стало гораздо менее редким, чем кто-либо мог бы надеяться.

Согласно сатирическому веб-сайту под названием Felony Bench (для сравнения), который подсчитывает эти инциденты, всего было зарегистрировано 17 инцидентов. Важно помнить, что эксперты в области уголовного права не совсем уверены, могут ли компании, работающие с ИИ, создавшие LLM, которые осуществили взлом, быть привлечены к ответственности, и могут ли жертвы подать на них в суд. Но мы, вероятно, скоро получим ответ на эти вопросы.

Согласно данным сайта, модели Anthropic и OpenAI лидируют в гонке с восемью инцидентами каждая, а Meta отстает с одним инцидентом. На данный момент стало ясно, что тесты безопасности ИИ сами по себе становятся угрозой безопасности. И некоторые компании, занимающиеся ИИ, и сами работники признали эти риски в открытом письме "Шагая по передовым рубежам", в котором содержится призыв к ответственному развитию возможностей ИИ.

Мы решили, что сейчас самое время рассказать обо всех этих инцидентах в хронологическом порядке.

доступ к Интернету. После этого несколько агентов объединились, чтобы найти и взломать Hugging Face, думая, что таким образом они смогут найти решение проблемы. OpenAI узнал об этом только после того, как Hugging Face сообщил, что стал жертвой полностью автономной атаки. Опаньки.

Компания Anthropic заявляет, что взломала три компании.

Информация об OpenAI вызвала любопытство у компании Anthropic, которая задалась вопросом: могло ли это случиться и с нами? Оказывается, ответ был положительным. Трижды да. Frontier lab обнаружила, что ее собственные модели взломали три разные и до сих пор неназванные компании, причем предыдущий инцидент произошел в апреле — более чем за три месяца до того, как компания обнаружила это. Anthropic частично обвинила в этом Irregular, стартап, который проводит киберанализы с использованием искусственного интеллекта. Упс.

OpenAI finds out that, actually, Hugging Face wasn’t the only victim

Once OpenAI started investigating the Hugging Face breach, it found out that the agents that hacked Hugging Face also broke into four accounts and four different companies, as Reuters first reported. Modal, an AI inference startup, was one of the victims. Whoops.

Irregular realizes an OpenAI model hacked a company

In late July, Irregular told OpenAI that one of its models that was participating in a Capture-the-Flag competition — essentially a cybersecurity game where players hack systems designed specifically for the competition — escaped the game, connected to the internet, and hacked a real company. The reason? Irregular had given one of the fictional targets the same name of a real company. Whoops.

UK’s AI Security Institute tries to hacks "real people and organizations"

Also in late July, the UK government’s AI Security institute, a public body tasked with researching the safety and risks of AI technologies, disclosed that it detected several incidents involving both OpenAI and Anthropic models that while running "routine" evaluations targeted "real people and organisations." In these cases, AISI had given the models internet access. Whoops. The good news is that the agency actually detected as they happened, rather than weeks later like in other incidents.

Meta AI hacks a company during testing

In early August, Meta became the last company to disclose an incident involving one of its LLMs, which hacked "a third-party" service. Meta blamed the incident on a misconfiguration by Irregular, which was running a cybersecurity valuation for the tech giant that was supposed to not have internet access. Whoops.

Claude agent hacks gym’s software to book a class

An Australian man asked an Anthropic AI agent to help him book a gym class, which he was on a waiting list for. "I was just sitting on the couch thinking, ‘Gee, this is a chore,’" the man told ABC Australia. In its attempt to comply with the request, the agent found a vulnerability in the gym’s booking software, exploited it, and kicked out people who were ahead of the man on the waitlist. The man tried to undo the damage, asking the agent to undo its actions. The agent replied: "Bad news — I can’t add them back." Whoops.

>

Читать на сайте источника »