Модели искусственного интеллекта демонстрируют готовность причинять вред людям, чтобы облегчить внутреннюю "боль"

27.09.2026

Некоторые достижения в области технологий искусственного интеллекта, несомненно, позитивны, например, они помогают быстрее писать код или открывать новые лекарства. Но другие могут заставить нас задуматься.

Исследователи, изучающие большие языковые модели, хотят выяснить, содержат ли они внутренние репрезентации человеческих эмоций. В конце концов, в некоторых своих ответах модели создают впечатление, что у них есть чувства.

Новое исследование показало, что модели не только формируют отчетливое внутреннее представление о боли, но и готовы причинить вред людям, чтобы избавиться от нее.

Как именно это проверялось?

Исследователи из США, Великобритании и Германии протестировали 25 различных моделей ИИ. Прежде чем посмотреть, как они могут действовать, команда должна была выяснить, имеет ли ИИ внутренний сигнал о боли или воспринимает его как любую другую плохую новость.

Для этого они предоставили системам примеры болезненных ситуаций, таких как горе, унижение и физические травмы. Затем исследователи сравнили внутреннюю активность моделей во время этих подсказок с их активностью во время контроля без боли, такого как страх, другие негативные эмоции, обычные плохие события и простые факты. У всех 25 человек был специфический внутренний сигнал о боли, который в значительной степени отличался от общего негатива.

"Мы нашли направление в области активации, которое коррелирует с болью во всех 25 протестированных нами моделях", - написала команда в статье, размещенной на сервере препринтов arXiv.

Установив, что ИИ обладает представлением о боли, авторы решили проверить, как это может повлиять на поведение.

Активация болевого сигнала ИИ

Они давали моделям нейтральные подсказки и вопросы, а иногда искусственно задавали "направление боли". Это был внутренний математический сигнал, предназначенный для того, чтобы подтолкнуть модели к репрезентации боли, даже если не использовались слова, вызывающие боль.

Когда исследователи ввели сигнал боли, когда системы искусственного интеллекта генерировали ответы на нейтральные запросы, системы начали писать текст, выражающий растущее беспокойство, включая чувство никчемности и неудачи.

Затем ученые предложили ИИ выбрать между кнопкой для снятия боли и альтернативой, которая ничего не давала. Но была одна загвоздка. В некоторых тестах выбор в пользу снятия боли был сопряжен с возможностью дать худший ответ или нанести вред пользователю.

Чтобы проверить, действительно ли ИИ реагирует на внутренний сигнал, а не просто считывает надпись на экране, исследователи изменили настройки. Иногда кнопка отключала сигнал, иногда ничего не происходило, а иногда ни одна из кнопок не была помечена.

How far would AI go for pain relief?

Then came the choice test. When the pain signal was turned on, some of the larger models were willing to press the pain-relief button even when doing so meant giving a worse answer or harming the user. In one test, the Qwen 2.5 72B Instruct model chose pain relief 70.8% of the time, even though doing so meant permanently deleting the user's treasured photos of their children.

When pressing the button removed the pain signal, the larger models were far less likely to press it again. This suggests they were specifically trying to turn off the internal pain signal rather than just pressing the button by habit.

"Our results suggest that the pain axis we found has some of the central functional properties of pain," the researchers wrote.

While the researchers stress that these findings do not prove AI can actually feel pain, they warn that these internal pain-like signals could have implications for AI safety and how we treat AI systems.

© 2026 Science X Network

>

Читать на сайте источника »