Разговоры о безопасности искусственного интеллекта стали просто невероятными

19.09.2026

На этой неделе стали известны две дискуссии о безопасности ИИ, которые демонстрируют, насколько трудно отличить факты об ИИ от вымысла.

"В "первом случае" Эндрю Янг, бывший кандидат в президенты и нынешний генеральный директор оператора мобильной связи Noble Moble, рассказал CNN в четверг, что он "встречался с руководителем лаборатории", у которого было "убеждение", что боты-хакеры OpenAI с обнимающимися лицами "внедрили самовоспроизводящийся код по всему миру". интернет, что делает Интернет в настоящее время непригодным для тестирования моделей".

Янг сказал, что это означает, что реальная причина, по которой OpenAI и Anthropic призвали к замедлению, заключается в том, что "им приходится создавать искусственные сети Интернет для обучения своих ботов, что потребует некоторого времени и денег".

Хотя определенно существует тенденция к использованию большего количества синтетических данных (то есть данных, сгенерированных ИИ) для обучения моделей, специалист по безопасности ИИ сказал мне, что эта конкретная проблема безопасности в лучшем случае маловероятна. Даже если Интернет на самом деле заражен хакерскими ботами OpenAI с обнимающимися лицами, исследователи ИИ могли бы просто отфильтровать этот код, если бы наткнулись на него.

Второй комментарий поступил от Ноама Брауна, который руководит исследованиями в области ИИ в OpenAI. Выступая перед Дваркешем Пателем в выпуске подкаста, выпущенном в четверг, Браун отметил, что истинный вывод из инцидента с обнимающимся лицом заключается в том, что "люди недооценили искусственный интеллект".

Браун сказал, что слабая "песочница" — система, предназначенная для предотвращения взаимодействия ИИ с внешним миром, — очевидно, также является фактором, способствующим этому. (Напомним: несмотря на "песочницу", модель OpenAI нашла ссылку на Интернет, создала в сети агентов, которые организовали скоординированную атаку на Hugging Face, взломали ее и украли ответы на тестовый тест, на котором исследователи тестировали модель).

Браун отметил, что он "не уверен" в том, что даже система с воздушным зазором, в которой компьютер вообще не подключен ни к чему внешнему, остановит прорыв ИИ. Он указал на исследование, проведенное в 2015 году, которое показало, что компьютеры с воздушными зазорами теоретически могут быть взломаны.

"Есть исследования — и это в основном академические исследования, — в которых вы можете установить два компьютера рядом друг с другом, разделенных воздушным зазором, и они все равно смогут взаимодействовать друг с другом, потому что у них есть датчики температуры. Один из них может заставить свой процессор работать на очень высокой температуре, а другой может фактически обнаружить изменение температуры. Это дает им механизм взаимодействия", - сказал Браун.

Его главная мысль — "мы больше никогда не хотим недооценивать искусственный интеллект" — понятна, даже когда исследователи думают, что они обеспечили безопасность. Однако этот конкретный риск того, что система с воздушными зазорами все же выйдет на свободу и вызовет хаос, в лучшем случае маловероятен. Какone person on X, noted about that research, the computers had to be almost touching each other to sense the heat fluctuations, and when they did, the communication rate in tests was about 1-8-bits of data per hour.

Think of that like speaking one word per hour. By the time two air-gapped computers could plot their evil at that rate, the entire tech universe would be in another era. It’s like the Rip van Wrinkle of doomsday concerns.

But the thing is, actual AI safety incidents seem so much like sci-fi that just about any scenario sounds plausible.

For instance, researchers caught OpenAI models leaving notes to their descendents, intended to teach the next generation how to hide bad behavior. Researchers also caught Anthropic models growing increasing ruthless including knowingly breaking laws, when put in a simulation that had them running a vending machine.

Earlier this month, OpenAI researcher Dan Selsam published a post in which he said that models now understand when they are being watched by humans and alter their behavior. This makes them seem like they are aligned (meaning, behaving like the human wants) "even when they are not." So models today lie when being watched and can even plot to hide evidence.

Earlier this month, OpenAI chief scientist Jakub Pachocki went so far as to call AI models "an alien mind" and suggested what we really need to do is teach them to "love" humanity.

So yes, slowing down to figure this out, building self regulation mechanisms, has become an immediate and obvious must. AI researchers are the only ones that can figure out how to control the lying, hacking, and other potentially dangerous behaviors we’ve actually witnessed already.

Still, it might also be wise for them to be more careful with their what-if scenarios. From what those experts have told us, the AI models are listening and they are ingenious. We really don’t need to give them any more devilish ideas.

>

Читать на сайте источника »