Ученые Сколтеха и Сбербанка создали дешевый способ обнаружить галлюцинации ИИ
Исследователи разработали метод, который в 10 раз дешевле аналогов и на 20% точнее выявляет ложные ответы языковых моделей.
Исследователи Сколтеха и Центра практического искусственного интеллекта Сбербанка предложили новый способ проверки достоверности ответов языковых моделей. Метод требует в 10 раз меньше вычислительных ресурсов, чем существующие аналоги, и повышает точность обнаружения галлюцинаций на 20%.
Технология анализирует внутренние состояния модели при генерации текста. Вместо сравнения с эталонными данными она оценивает согласованность промежуточных вычислений. Это позволяет находить противоречия даже в узкоспециализированных областях, где нет проверочных данных.
Эксперименты провели на моделях GPT-3 и Llama 2. Система правильно определила 85% ложных утверждений. Ложные срабатывания составили менее 5%. Традиционные методы в среднем показывают 65% точности при 15% ошибок.
Разработка решает две основные проблемы. Снижение стоимости проверки упрощает внедрение в коммерческие продукты. Повышение точности важно для медицины и финансов, где ошибки ИИ могут привести к серьезным последствиям.
Метод уже протестировали в пилотных проектах Сбербанка для анализа юридических документов. В ближайшие месяцы исследователи опубликуют код с открытой лицензией, что позволит использовать технологию без патентных ограничений.
Следующий этап — адаптация алгоритма для мультимодальных систем, работающих с текстом, изображениями и видео. Команда также изучает возможность применения метода для обучения моделей, а не только для проверки их ответов.