FINAL-Bench


FINAL-Bench в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Упоминается вместе:

Календарь упоминаний:

2026
22 сентября

FINAL-Bench служит эталонной площадкой для проверки эффективности метода ZTC

VIDRAFT применила бенчмарк FINAL-Bench, состоящий из 2018 задач, для объективного сравнения точности оценки уверенности ИИ-моделей. Тестирование показало, что метод Zero-Token Confidence (ZTC) превосходит базовые подходы и самоотчеты моделей по ключевым метрикам качества. Результаты подтверждают преимущество анализа скрытых состояний нейросети над генерацией текстовых объяснений для верификации ответов.

Исследование: На базе FINAL-Bench зафиксировано, что метод ZTC демонстрирует AUC 0.7394, превышая показатель базовой линии (0.7036) и самоотчета модели (0.5000).

Эффект: Тестирование на FINAL-Bench выявило, что внешняя проверка внутреннего состояния модели эффективнее внутренних «интуиций» нейросети, обеспечивая разницу в точности до +0.22 для отдельных архитектур.

Подробнее →

01 июля

FINAL-Bench включен в состав бенчмарка для оценки метакогнитивных способностей ИИ

Суть: FINAL-Bench представляет собой набор из 100 задач, интегрированных в общий бенчмарк Metacognition-Bench для проверки способности моделей детектировать логические ловушки.

Исследование: Задачи FINAL-Bench содержат скрытые пути рассуждения, которые кажутся логичными, но ведут к неверному выводу, требуя от модели самокоррекции.

Фактор: Включение FINAL-Bench позволяет выявить разрыв между высокой точностью в тестах с выбором ответа и неспособностью модели контролировать качество свободного текста.

Эффект: Тестирование с использованием FINAL-Bench показало, что даже топовые модели теряют способность к самокоррекции при генерации текста без внешних адаптеров.

Подробнее →


В нашей базе собрано 2 события по теме «FINAL-Bench». Мы показываем все из них.