Новая методика рассуждения OpenAI встревожила экспертов по безопасности искусственного интеллекта

03.09.2026

Новая модель Astra от OpenAI будет использовать технику рассуждения под названием "рекуррентная глубина", которая позволяет ей работать вне рамок последовательного мышления, характерного для большинства моделей рассуждения, сообщает Information, опубликованная во вторник. Этот метод, также называемый "непрозрачным повторением", вероятно, затруднит отслеживание логической цепочки модели, и это вызывает беспокойство у экспертов по безопасности ИИ.

Хотя, как сообщается, Astra использует этот метод ограниченно, его появление по-прежнему вызывает серьезные опасения у экспертов по безопасности ИИ.

"Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачное повторение", - написал генеральный директор Redwood Бак Шлегерис в своем посте после выхода новости. "Я не знаю, намного ли Astra хуже поддается мониторингу, чем предыдущие модели. Но если OpenAI продвинет эту технологию дальше, у них появится возможность значительно увеличить повторяемость и полностью исключить возможность мониторинга CoT".

Давний сторонник безопасности искусственного интеллекта Цви Моушовиц также высказал свое мнение и написал, что, возможно, необходимы законы, чтобы предотвратить "гонку на выживание" среди лабораторий искусственного интеллекта.

"Этот метод - игра с огнем, рискующая нарушить табу, за установление которого боролись OpenAI и Anthropic, и мы упорно работаем над тем, чтобы как можно дольше сохранять верность логической цепочки и возможность контроля", - написал Моушовиц. "Более интенсивное использование таких методов, вероятно, ухудшило бы отслеживаемость".

При обычных обстоятельствах логическая цепочка модели обеспечивает последовательность шагов, предпринимаемых моделью при попытке решить проблему. Несмотря на несовершенство представления, оно по-прежнему служит ценным инструментом для отслеживания плохого поведения или несогласованности действий. В случае с недавней деятельностью агентов-нарушителей в OpenAI логические записи были важным инструментом для выяснения причин того, почему агенты вели себя так, а не иначе.

При непрозрачном повторении модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. В результате остается меньше четких следов, что фактически обходит обычную логическую цепочку.

Важно отметить, что использование Astra этого метода, по-видимому, ограничено. Ожидается, что логическая цепочка модели по-прежнему будет читаемой, и компания отвергла любые предположения о переходе на "нейронный язык". OpenAI уже объявила о планах по созданию обширных систем мониторинга логической цепочки в рамках своих перспективных планов обеспечения безопасности.

В своем посте на X главный научный сотрудник OpenAI Якуб Пачоцки подчеркнул приверженность лаборатории понятным цепочкам мышления. "OpenAI работал над сохранением и использованием цепочки мониторинга мышления с момента создания наших самых первых моделей мышления", - написал Пачоки. "Это основная цель нашей текущей исследовательской программы.

All AI models do some quantity of opaque reasoning, and few researchers take chain-of-thought logs as a direct representation of a model’s reasoning. Still, those caveats don’t dispel the concern that opaque recurrence may make AI reasoning harder to monitor, particularly as it grows in use across different models. In a follow-up report Wednesday morning, The Information reported that both Anthropic and Google DeepMind were already discussing the technique.

In a post responding to the news, Redwood Research chief scientist Ryan Greenblatt said opaque reasoning could easily scale faster than conventional chain-of-thought reasoning, effectively removing all reasoning from visible channels.

"My biggest concern is that a natural progression from here would involve scaling up the opaque reasoning to the point where the model reasons entirely or almost entirely in latent space," Greenblatt wrote. "I hope it isn’t too late to avoid the most concerning architectures and that OpenAI will stop here."

>

Читать на сайте источника »