Средний балл обманывает: галлюцинации в чат-ботах требуют жесткого фильтра безопасности
Замена языковых моделей в чат-ботах требует жесткого фильтра безопасности, так как высокий средний балл скрывает критические галлюцинации. Тестирование восьми нейросетей показало, что модели с оценкой выше 79% отклоняются из-за фактических ошибок, ставя под удар бизнес-процессы.
При замене языковых моделей в производственных чат-ботах ключевым фактором становится не общая оценка качества ответов, а уровень галлюцинаций. Исследование, опубликованное 1 сентября 2026 года, демонстрирует, что традиционные методы оценки через средневзвешенный балл опасны для бизнес-процессов. Модель может получать высокий общий рейтинг за скорость или стоимость, но при этом допускать критические ошибки в фактах. В таких системах безопасность должна работать как жесткий фильтр: наличие даже единственной критической галлюцинации должно приводить к автоматическому отклонению модели, независимо от ее успехов в других метриках.
Этот подход защищает компании от ситуаций, где серьезные сбои «смазываются» хорошими показателями по другим параметрам. В агентах, принимающих решения за реальных клиентов, такие компромиссы недопустимы. Авторы работы подчеркивают, что средний балл не должен быть единственным критерием допуска модели в продакшн-окружение.
Методика тестирования на реальных сценариях
Для проверки моделей команда разработала конвейер воспроизведения (replay pipeline). Он позволяет запускать новые версии ИИ в условиях, максимально приближенных к реальным. Вместо общих бенчмарков система использует базу из 20 тщательно отобранных диалогов, прошедших ручную проверку. Каждый сценарий включает конкретные инструкции, доступ к внешним инструментам и исторические данные пользователей.
Важной особенностью является изоляция переменной: меняется только сама языковая модель, тогда как логика бизнес-процессов, промпты и память агента остаются неизменными. Это позволяет точно определить, влияет ли новая модель на поведение системы. При этом выполнение инструментов имитируется: если модель делает неверный запрос, система возвращает стандартную ошибку, предотвращая бесконечные циклы и сохраняя воспроизводимость теста. Такой подход исключает влияние внешних факторов и фокусирует внимание исключительно на способностях конкретной нейросети.
Результаты оценки восьми моделей
В тестировании участвовали восемь популярных моделей, включая семейства GPT-4.1, GPT-5, Gemini 2.5 Flash, а также открытые веса Kimi-K2.5 и GPT-OSS-120B. Итоговый вердикт разделил их на три группы:
- Допущены: GPT-5.4 mini, GPT-5.4 nano и Kimi-K2.5. Эти модели показали стабильные результаты и не превысили допустимый порог галлюцинаций.
- Отклонены по безопасности: Gemini 2.5 Flash, GPT-4.1 nano и GPT-5 mini. Несмотря на то что их общий балл составлял более 79%, они были отклонены из-за превышения лимита галлюцинаций.
- Прочие: GPT-OSS-120B показал крайне низкие результаты из-за технических несовместимостей формата вывода, а GPT-5 nano получил статус «частично допущенной».

Анализ паттернов ошибок выявил специфические слабости каждого семейства. Модели от OpenAI чаще ошибались в выборе инструментов, Gemini демонстрировал проблемы с калибровкой момента действия, а Kimi-K2.5 сталкивался с ограничениями провайдера. Стоимость использования также варьировалась: GPT-5.4 mini оказался самым дорогим вариантом, что важно учитывать при масштабировании, несмотря на его высокое качество.
Цена ошибки в ИИ-агентах
Замена языковой модели в корпоративном чат-боте — это смена поставщика рисков. Исследование, опубликованное 1 сентября 2026 года, показывает: средний балл качества ответов обманчив. Модель может получать высокие оценки за скорость и стоимость, но при этом генерировать фатальные ошибки в фактах. Для бизнеса это означает, что «хорошая» модель по средним показателям может быть непригодна для продакшена из-за единичных критических сбоев.
Почему средний балл не работает
Традиционная оценка ИИ похожа на оценку ученика по среднему баллу за четверть: отличные «пятёрки» по скорости и логике могут скрывать одну грубую ошибку в ключевом вопросе. В системах, где ИИ принимает решения от имени клиентов (бронирования, финансовые операции, юридические консультации), такая ошибка стоит компании репутации и денег.
Авторы исследования предлагают жёсткий фильтр: наличие даже одной критической галлюцинации автоматически дисквалифицирует модель. Это меняет логику выбора ИИ: вместо поиска «самой умной» модели компании ищут «самую предсказуемую».
В продакшн-среде одна фатальная ошибка весит больше, чем тысяча безупречных ответов. Безопасность здесь — это не функция, а порог входа.
Кто выиграл тест на реальных сценариях
Для проверки использовался «конвейер воспроизведения» (replay pipeline): 20 тщательно отобранных диалогов с реальными инструкциями и доступом к инструментам. Менялась только нейросеть, остальная логика оставалась неизменной. Это позволило точно определить, как именно модель влияет на поведение системы.
Результаты разделили восемь популярных моделей на три группы:
- Допущены: GPT-5.4 mini, GPT-5.4 nano и Kimi-K2.5. Они показали стабильность и не превысили порог допустимых ошибок.
- Отклонены по безопасности: Gemini 2.5 Flash, GPT-4.1 nano и GPT-5 mini. Несмотря на общий балл более 79%, они были отсечены из-за критических галлюцинаций.
- Прочие: GPT-OSS-120B провалился из-за технических несовместимостей, а GPT-5 nano получил статус «частично допущенной».
Анализ ошибок выявил специфические слабости: модели OpenAI чаще ошибались в выборе инструментов, Gemini — в моменте действия, Kimi-K2.5 сталкивался с ограничениями провайдера. Важно, что GPT-5.4 mini, несмотря на высокое качество, оказался самым дорогим вариантом. Это создаёт дилемму для бизнеса: платить за безопасность или рисковать с более дешёвыми моделями, которые не прошли фильтр.
Стратегический вывод
Рынок ИИ переходит от гонки за «интеллектом» к гонке за надёжностью. Компании, внедряющие агентные системы, должны пересмотреть критерии выбора моделей. Средний балл больше не является метрикой успеха. Ключевым фактором становится доля критических ошибок.
Для российского бизнеса это сигнал: при выборе зарубежных или открытых моделей (как Kimi-K2.5) нужно учитывать не только качество ответов, но и риски «слепых зон» в конкретных сценариях. Дешёвая модель, которая 99% времени работает идеально, но 1% времени выдаёт опасную ошибку, может стоить дороже самой дорогой стабильной альтернативы. Безопасность теперь измеряется не процентами удовлетворённости, а ценой одной единственной ошибки.
Подтверждение: huggingface.co