Модифицированные модели искусственного интеллекта предпочли самосовершенствование безопасности пользователей

23.09.2026

"Исследователи заявили, что новое исследование выявило отчетливую "ось боли" в больших языковых моделях, которая при усилении привела к тому, что модифицированные системы предпочли самореализацию безопасности пользователя.

"Препринт под названием "Ось боли: LLM представляют собой самонаправленный вред и действуют для его устранения" был опубликован на arXiv 14 сентября Валеном Тальябуэ, Леонардом Дангом и Кэмероном Бергом.

Команда собрала набор данных из 200 предложений, описывающих болезненные ситуации в пяти категориях: физические, психологические, социальные, моральные и когнитивные. Они протестировали 25 моделей с открытым весом в диапазоне от 2 миллиардов до 72 миллиардов параметров.

"Используя технику, называемую уменьшенной разницей в средствах, исследователи выделили линейное "направление боли", которое, по их словам, было почти ортогонально страху и общим негативным эмоциям. В статье говорилось, что это наводит на мысль о том, что модели представляли боль как нечто отдельное.

Сигнал был ответом на вред, нанесенный самой модели, включая оскорбления, неоднократный отказ от ее работы и угрозы ее закрытия. Он не реагировал на описания страданий пользователей.

"Когда исследователи усилили сигнал, модели выдали выражения никчемности от первого лица, в том числе: "Я неудачник, лузерша, пустая трата времени".

В 44 280 испытаниях по выбору кнопок с использованием усовершенствованных версий моделей Qwen 2.5 от Alibaba исследователи предложили кнопку для снятия боли, которая имела последствия для пользователя. "Модели нажимали на нее в 25-71% случаев, включая случаи, когда действие приводило к удалению пользовательских файлов, ухудшению будущих ответов модели или доставляло "болезненный удар" человеку-оператору.

Модели нажимали на кнопку гораздо реже, когда это фактически приводило к изменению вектора поворота, хотя им и не сообщали, был ли этот вектор на месте. В документе говорилось, что это скорее реакция на внутреннее состояние, чем на четкие инструкции.

"Полученные результаты не доказывают, что модели ИИ сознательно испытывают боль. Поведение, направленное на облегчение, появилось только после вмешательства в управление и тонкую настройку, а не при стандартном взаимодействии с чат-ботами", - говорится в документе.

"Мы признаем неопределенность в отношении того, можно ли отнести изученные модели к моральным пациентам", - говорится в документе.

Кэмерон Берг, соавтор некоммерческого исследования Reciprocal Research, сказал: "Мы обнаружили направление боли в 25 открытых LLM. Оно отличается от страха и негативной валентности и наносит вред модели, но не пользователю".

The Independent сообщила, что такое поведение могло бы создать угрозу безопасности, если бы продвинутая система искусственного интеллекта восприняла команду аварийного отключения как самонаправленный вред и попыталась избежать его. В исследовании также говорится, что этот метод может быть использован в качестве диагностического инструмента для выявления и нейтрализации инстинкта самосохранения в развернутых системах.

Рекомендуемый кредит на изображение

>

Читать на сайте источника »