Инструмент LettucePrevent снижает выдумки ИИ более чем на 60%, но требует точного совпадения токенизаторов
Новый инструмент LettucePrevent снижает количество выдуманных фактов в генеративном ИИ более чем на 60%, встраивая проверку прямо в процесс создания текста. Однако технология пока работает эффективно только с моделями, имеющими совместимый способ разбивки текста, что сдерживает её массовое внедрение в бизнес-процессы.
Исследователи из Технического университета Вены представили инструмент LettucePrevent, который в реальном времени отсекает фактические ошибки в системах с генеративным искусственным интеллектом (RAG). Решение интегрируется непосредственно в процесс генерации текста, снижая количество выдуманных цифр более чем на 60% с минимальными затратами времени. Однако универсальный детектор фактов пока работает эффективно только для моделей с определенным типом токенизации, что ограничивает его широкое внедрение.
Как работает защита от галлюцинаций
Стандартные модели генерируют текст, выбирая следующее слово на основе вероятностей. LettucePrevent встраивает дополнительный этап проверки между выбором токенов. Механизм действует по следующему алгоритму:
- Выбор кандидатов: Система определяет наиболее вероятные варианты продолжения фразы.
- Оценка рисков: Специальный детектор проверяет эти варианты на соответствие исходному контексту.
- Корректировка: Кандидаты, которые могут привести к ошибке, получают штраф в распределении вероятностей.
- Генерация: Модель выбирает слово из скорректированного списка, автоматически избегая неподтвержденной информации.
Для ускорения работы используется параметр skip_threshold. Если уверенность модели в правильности следующего слова высока, проверка пропускается, что сохраняет скорость генерации.
Важный нюанс: Эффективность нейросетевого детектора критически зависит от совпадения способа разбивки текста на токены (токенизации) у модели-генератора и детектора. Без этого совпадения система не только не снижает количество ошибок, но и значительно замедляет работу.
Результаты тестирования: цифры против фактов
Тесты проводились на наборе данных RAGTruth с использованием трех популярных моделей: Qwen2.5 14B, Mistral 7B v0.2 и Llama-2 7B. Результаты разделились на два сценария в зависимости от типа детектора.
Детектор чисел (Regex)Этот инструмент работает детерминированно: он блокирует любые числовые строки, которых нет в исходном тексте. Он не требует обучения и показал стабильные результаты на всех архитектурах.
| Модель | Ошибки (база) | Ошибки (с защитой) | Снижение ошибок | Рост времени |
|---|---|---|---|---|
| Qwen2.5 14B | 68 | 23 | −66.2% | +0.53 с |
| Mistral 7B v0.2 | 157 | 22 | −86.0% | +0.73 с |
| Llama-2 7B | 71 | 25 | −64.8% | +0.62 с |
Дополнительная задержка составила от 5.3% до 9.1%, что является приемлемым компромиссом для повышения точности.
Детектор фактов (Нейросеть 68M)Здесь результаты оказались менее однозначными. Значимое снижение ошибок (−26.6%) зафиксировано только для модели Llama-2 7B. Для Qwen2.5 и Mistral 7B статистически значимого улучшения не произошло, а в случае с Mistral количество ошибок даже незначительно выросло.
При этом стоимость вычислений для нейросетевого детектора оказалась высокой: время генерации выросло на 102% для Qwen и на 742% для Llama-2. Это связано с необходимостью пропускать каждый шаг генерации через дополнительный нейросетевой слой.
Операционные последствия, тренды и практические аспекты
- Ограничение сферы применения: Детектор чисел готов к промышленному использованию в задачах извлечения данных, но не подходит для сценариев, требующих арифметических вычислений (например, расчет процентов или сумм), так как он блокирует любые числа, отсутствующие в исходном тексте.
- Проблема совместимости: Внедрение нейросетевого детектора фактов требует строгого соответствия токенизатора. Это создает барьер для использования решения с популярными моделями, не имеющими совместимого токенизатора, и делает текущую реализацию скорее исследовательским прототипом, чем готовым продуктом.
- Риск ложных срабатываний: При текущей точности детектора (F1 ≈ 0.39) система может блокировать корректные варианты продолжения текста, заставляя модель выбирать менее естественные формулировки, что ухудшает качество итогового ответа.
- Зависимость от конфигурации: Производительность системы напрямую зависит от настройки порога пропуска проверок. Оптимальная настройка для снижения ошибок часто приводит к максимальному времени отклика, что делает невозможным одновременное достижение высокой скорости и высокой точности в текущей реализации.
Стоит учесть: Разработчики отмечают, что существующие датасеты для обучения не содержат разметки для проверки фактов на лету (по префиксам), что ограничивает возможности обучения детекторов для потоковой генерации и делает текущие решения зависимыми от постфактум анализа.
Инструмент доступен для тестирования через репозиторий на GitHub и модуль custom_generate в библиотеке Hugging Face.
Источник: huggingface.co