Terminal-Bench 4.0
Terminal-Bench 4.0 в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Terminal-Bench 4.0 фиксирует двукратный рост производительности Grok 4.7 по сравнению с предыдущей версией
В таблице сравнения моделей на бенчмарке Terminal-Bench 4.0, который оценивает навыки работы в терминале, новая модель Grok 4.7 показала результат 38.0%. Это значение значительно превышает показатель предыдущей версии Grok 4.6 (20.3%) и слегка опережает GPT-5.6 Sol (37.3%). При этом лидерство в данном тесте сохраняет Fable 5.1 Max с результатом 57.9%, что указывает на сохраняющийся разрыв между передовыми моделями по специализированным терминальным задачам.
Событие: Grok 4.7 достигла отметки 38.0% в тесте Terminal-Bench 4.0, увеличив свой результат относительно версии 4.6 более чем вдвое.
Фактор: Бенчмарк Terminal-Bench 4.0 используется как ключевой показатель для оценки способности моделей выполнять длительные программные задачи и работать в командной строке.
В нашей базе собрано 1 событие по теме «Terminal-Bench 4.0». Мы показываем все из них.