Бенчмарки русскоязычного ИИ
Бенчмарки русскоязычного ИИ в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Яндекс представил новые открытые бенчмарки для объективной оценки русскоязычного ИИ
Компания разработала два собственных набора задач — WikiWebFacts и HardMultiQA, так как существующие англоязычные тесты не позволяют корректно измерять качество ответов на русском языке. Инструменты выложены в открытый доступ вместе с эталонными ответами и протоколом оценки, что позволяет независимо проверять возможности моделей.
Событие: Яндекс опубликовал в открытом доступе два новых бенчмарка для оценки русскоязычных знаний ИИ: WikiWebFacts (фактология) и HardMultiQA (сложные мультивариантные задачи).
Фактор: Разработка стала необходимой, поскольку стандартные англоязычные тесты не обеспечивают объективной оценки качества ответов моделей на русском языке.
Инсайт: Бенчмарк HardMultiQA базируется на анонимизированных реальных запросах к Алисе AI и требует от модели выбора нескольких верных вариантов или поиска ошибок в тексте по узким областям знаний.
В нашей базе собрано 1 событие по теме «Бенчмарки русскоязычного ИИ». Мы показываем все из них.