Оценка уверенности
Оценка уверенности в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Оценка уверенности переходит от самоотчета к прямому чтению внутреннего состояния нейросети
Компания VIDRAFT представила метод Zero-Token Confidence (ZTC), который определяет надежность ответа языковой модели по вектору скрытого состояния, исключая этап генерации текста. Точность такой внешней оценки (AUC 0.88) существенно превышает уровень случайного угадывания, характерный для запросов к самой модели о ее уверенности (AUC 0.50). Технология позволяет фильтровать действия ИИ-агентов в реальном времени с минимальными затратами на вычисления, повышая долю правильных решений в симуляциях с 49% до 65%.
Событие: Метод ZTC продемонстрировал точность оценки AUC 0.88 против AUC 0.50 у самоотчета модели, а время проверки составило 0.06 секунды на четырех ускорителях NVIDIA B200.
Эффект: В симуляторе «Gate Arcade» использование ZTC повысило средний балл действий ИИ-агента с -3.9 до +29.1, увеличив точность выполнения правильных команд до 65%.
Фактор: Качество оценки зависит от ширины скрытого слоя и доли слоев с полным вниманием, а не от общего количества параметров модели, что объясняет худшие результаты у моделей с линейным вниманием.
В нашей базе собрано 1 событие по теме «Оценка уверенности». Мы показываем все из них.