Исследователи разрабатывают экономичный метод обнаружения галлюцинаций в больших языковых моделях
Исследователи из Сколтеха и Центра практического искусственного интеллекта Сбербанка предложили новый метод TOHA для обнаружения галлюцинаций в больших языковых моделях, работающих в системах генерации с дополненным поиском (RAG). Этот подход анализирует топологическую структуру карт внимания модели и позволяет идентифицировать реакции, которые не поддерживаются предоставленным контекстом. Метод не требует обучения дополнительных моделей и использует лишь небольшое количество аннотированных данных для настройки.
Статья была опубликована в Сборнике материалов 64-го ежегодного собрания Ассоциации компьютерной лингвистики. Одним из авторов является Алексей Зайцев, доцент Сколтеха и руководитель совместной лаборатории Сколтеха и Сбербанка (LARSS).
Большие языковые модели все чаще становятся основой для ИИ-ассистентов и автономных агентов. Для повышения точности своих ответов современные системы часто используют технологию RAG: прежде чем сгенерировать ответ, модель получает дополнительную информацию из корпоративных баз знаний, документов или других внешних источников. Однако даже в этих условиях она может выдавать правдоподобные ответы, которые не подтверждаются предоставленным контекстом.
Такие ошибки можно выявить с помощью специализированных методов обнаружения галлюцинаций, но многие существующие подходы требуют либо больших объемов аннотированных данных, либо дополнительных вычислений - например, генерации нескольких ответов и последующего сравнения результатов.
Метод TOHA — детектор галлюцинаций, основанный на топологии, - предложенный авторами, использует другой подход. Исследователи проанализировали матрицы внимания языковой модели и представили их в виде графиков. Затем они вычислили топологическую характеристику, называемую mTop-Div, которая фиксирует различия между структурами подграфов, соответствующими исходному контексту, и сгенерированным ответом.
Исследование показало, что для определенных групп внимания более высокие значения этого топологического расхождения неизменно связаны с ответами, которые не поддерживаются исходным контекстом. Это позволяет использовать внутренние сигналы от самой языковой модели для оценки надежности ее ответа. Авторы оценили подход к задачам с ответами на вопросы и обобщением текста. В ходе нескольких тестов TOHA добилась результатов, сопоставимых или превосходящих существующие методы, при этом потребовав относительно небольшого количества аннотированных данных и вычислительных ресурсов.
One advantage of the method is that there is no need to train a separate classifier. A small set of examples is sufficient for configuration, after which the selected informative attention heads are used to evaluate new responses. According to the authors, TOHA achieves results comparable to the substantially more computationally intensive SelfCheckGPT method, which relies on generating multiple responses.
"When language models are used in applied systems, it is important not only to obtain a convincing-sounding answer but also to understand whether it is actually based on the information that was provided to the model," said Zaytsev. "In this work, we show that such a signal can be extracted from the model's internal representation of the text if it is analyzed in the right way. The activation of specific topological features signals potential hallucinations without requiring the training of an additional detector model or repeated response generation."
"The fight against AI hallucinations is entering a new stage," explained Sergey Ryabov, senior managing director and director of AI transformation at Sberbank. "The TOHA method, developed jointly with Skoltech, demonstrates that reliability does not necessarily require high costs. Instead of large-scale data annotation, we use targeted calibration of the model's attention, making it adhere closely to the context and independently correct inaccuracies. The technology has already been integrated into the open-source SIRIN library, making it available for the development of corporate assistants that work with knowledge bases. This sets a new standard of trust in artificial intelligence responses."
A practical implementation of the approach has already been incorporated into SIRIN, an open-source library developed by researchers at Sberbank's Center for Practical Artificial Intelligence to detect and analyze contextual inconsistencies in systems based on large language models. This makes it possible to use the method when developing AI assistants and other solutions that work with corporate knowledge bases and documents.
For companies, the tool may be particularly useful in areas where errors made by AI systems can create financial, legal or reputational risks—for example, in banking, insurance and legal services. For researchers, the study also offers a new way to investigate the internal mechanisms of language models through the topological properties of attention graphs.
>
