Metacognition-Bench


Metacognition-Bench в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
01 июля

Команда ginigen-ai представила бенчмарк Metacognition-Bench для оценки способности ИИ к самокоррекции

Суть: Metacognition-Bench — это открытый стандарт оценки метакогнитивных способностей больших языковых моделей, измеряющий не только точность ответов, но и способность системы осознавать свои ошибки. Бенчмарк включает 300 задач с логическими ловушками и 100 задач из FINAL-Bench для выявления разрыва между точностью в тестах и способностью к самокоррекции в свободном тексте.

Исследование: Тестирование 24 моделей с помощью Metacognition-Bench показало, что даже лидеры рейтингов теряют способность предсказывать свои ошибки при генерации свободного текста, демонстрируя индекс уверенности на уровне случайного угадывания.

Эффект: Для решения выявленной проблемы разработчики выпустили 11 легких модулей-адаптеров, которые анализируют внутренние состояния моделей и предупреждают пользователя о вероятной ошибке до её фиксации.

Фактор: Высокая точность в тестах с выбором ответа не гарантирует, что модель способна контролировать качество своего свободного текста, что делает метрики Metacognition-Bench критически важными для медицины и юриспруденции.

Анонс: Разработчики открыли доступ к коду, весам адаптеров для 11 моделей и лидерборду Metacognition-Bench, позволяя интегрировать систему сигнализации о вероятности ошибки в существующие конвейеры вывода.

Подробнее →


В нашей базе собрано 1 событие по теме «Metacognition-Bench». Мы показываем все из них.