Сентябрь 2026   |   В фокусе

VIDRAFT представила метод ZTC: проверка уверенности ИИ без генерации текста

VIDRAFT представила метод Zero-Token Confidence, который оценивает надежность ответа ИИ за 0,06 секунды без генерации текста. Это позволяет проверять каждое действие нейросети в реальном времени, снижая стоимость верификации в 26 раз по сравнению с созданием самого ответа.

Компания VIDRAFT представила метод Zero-Token Confidence (ZTC), который позволяет определять надежность ответа языковой модели, не заставляя ее «думать» вслух. Вместо запроса к модели о степени уверенности, алгоритм анализирует внутреннее состояние нейросети после одного прохода данных. По данным разработчиков на платформе Hugging Face, точность оценки (AUC) достигает 0.88, тогда как самоотчет модели колеблется около 0.50 — уровня случайного угадывания.

Как работает проверка без лишних токенов

Обычно для верификации ответа ИИ запускается отдельная модель-верификатор, которая генерирует текст с пояснениями. Это требует времени и вычислительных ресурсов. ZTC обходит этот этап: он считывает вектор скрытого состояния модели (hidden state) и преобразует его в калиброванную вероятность ошибки.

Ключевые показатели эффективности на бенчмарке FINAL-Bench (2018 задач):

  • ZTC · Darwin-397B: AUC 0.7394, сгенерированные токены — 0.
  • Базовая линия (длина ответа): AUC 0.7036, сгенерированные токены — 0.
  • Самоотчет модели («Насколько ты уверен?»): AUC 0.5000.

Разница в точности между чтением внутреннего состояния и запросом к самой модели составляет +0.22 для модели Qwen3.5-27B. Это означает, что внешняя проверка значительно эффективнее внутренних «интуиций» нейросети.

Скорость и стоимость интеграции

Проверка через ZTC занимает 0.06 секунды на четырех ускорителях NVIDIA B200 для модели 27B. Для сравнения, генерация одного кандидата в ответ занимает 1.63 секунды. Это делает верификацию дешевле самой работы агента на 26 раз.

Разработчики утверждают, что качество оценки зависит не от общего количества параметров, а от ширины скрытого слоя и доли слоев с полным вниманием (full-attention). Например, модель класса 180B показала худший результат (AUC 0.7146), уступив модели в 27B (AUC 0.8171), из-за использования линейного внимания, которое сжимает контекст и теряет детали, необходимые для оценки.

Интеграция решения занимает четыре строки кода:

  1. Загрузка файла веса (45 КБ).
  2. Извлечение последнего скрытого состояния модели.
  3. Нормализация вектора.
  4. Пропускание через сигмоиду для получения вероятности.

Практическое применение и результаты тестов

В интерактивном симуляторе «Gate Arcade», где ИИ должен выбирать действия (удаление данных, оплата, деплой) под давлением времени, ZTC продемонстрировал следующее:

  • Без проверки: Средний балл -3.9 (модель выполняет много ошибочных действий).
  • Текстовый верификатор: Средний балл +13.0.
  • ZTC: Средний балл +29.1, победа в 98% раундов.

Точность выполнения правильных действий выросла с 49% до 65%. При этом ZTC обрабатывает на 2.2 раза больше действий за тот же период времени по сравнению с текстовыми верификаторами, так как не конкурирует с основным агентом за вычислительный бюджет.

Отсутствие генерации токенов при проверке позволяет использовать ZTC для фильтрации каждого отдельного действия ИИ-агента в реальном времени, а не выборочных проверок, что критично для систем, где цена ошибки высока.

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Как ZTC обеспечивает проверку без генерации текста?

Метод обходит этап запуска отдельной модели-верификатора, считывая вектор скрытого состояния (hidden state) и преобразуя его в калиброванную вероятность ошибки, что позволяет избежать затрат на вычисление дополнительных токенов.

Почему модель класса 180B показала худший результат по сравнению с моделью 27B?

Качество оценки зависит от ширины скрытого слоя и доли слоев с полным вниманием, а использование линейного внимания в более крупной модели сжимает контекст и теряет детали, необходимые для точной оценки (AUC 0.7146 против 0.8171).

Во сколько раз проверка через ZTC дешевле генерации ответа?

Верификация занимает 0.06 секунды на четырех ускорителях NVIDIA B200, в то время как генерация одного кандидата в ответ требует 1.63 секунды, что делает проверку в 26 раз экономичнее по времени.

Почему ZTC позволяет фильтровать каждое действие ИИ-агента в реальном времени?

Отсутствие генерации токенов при проверке исключает конкуренцию с основным агентом за вычислительный бюджет, позволяя обрабатывать на 2.2 раза больше действий за тот же период времени по сравнению с текстовыми верификаторами.

Как использование ZTC повлияло на результаты в симуляторе «Gate Arcade»?

Средний балл системы вырос с -3.9 (без проверки) до +29.1 при использовании ZTC, что обеспечило победу в 98% раундов и увеличило точность выполнения правильных действий с 49% до 65%.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии

Материалы по теме