Metacognition-Bench
Metacognition-Bench в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Команда ginigen-ai представила бенчмарк Metacognition-Bench для оценки способности ИИ к самокоррекции
Суть: Metacognition-Bench — это открытый стандарт оценки метакогнитивных способностей больших языковых моделей, измеряющий не только точность ответов, но и способность системы осознавать свои ошибки. Бенчмарк включает 300 задач с логическими ловушками и 100 задач из FINAL-Bench для выявления разрыва между точностью в тестах и способностью к самокоррекции в свободном тексте.
Исследование: Тестирование 24 моделей с помощью Metacognition-Bench показало, что даже лидеры рейтингов теряют способность предсказывать свои ошибки при генерации свободного текста, демонстрируя индекс уверенности на уровне случайного угадывания.
Эффект: Для решения выявленной проблемы разработчики выпустили 11 легких модулей-адаптеров, которые анализируют внутренние состояния моделей и предупреждают пользователя о вероятной ошибке до её фиксации.
Фактор: Высокая точность в тестах с выбором ответа не гарантирует, что модель способна контролировать качество своего свободного текста, что делает метрики Metacognition-Bench критически важными для медицины и юриспруденции.
Анонс: Разработчики открыли доступ к коду, весам адаптеров для 11 моделей и лидерборду Metacognition-Bench, позволяя интегрировать систему сигнализации о вероятности ошибки в существующие конвейеры вывода.
В нашей базе собрано 1 событие по теме «Metacognition-Bench». Мы показываем все из них.