Модель Atom2.7m: точность расчетов выросла до 69% за счет смены формата данных
Модель весом 2,7 млн параметров вытесняет гигантов с миллиардными параметрами в арифметике, добиваясь точности 69% за счет смены формата подачи чисел. Гонка за масштабирование уступает место инженерии данных, позволяя бизнесу сократить вычислительные расходы, но требуя полной перестройки пайплайнов обработки информации.
Исследование, опубликованное 7 июля 2026 года, демонстрирует, что способность нейросетей выполнять точные вычисления определяется не столько количеством параметров, сколько способом подачи чисел. Модель Atom2.7m с объемом всего 2,74 млн параметров показала точность 69,24% на бенчмарке ArithMark2.0, превзойдя многие системы, превосходящие её по масштабу в сотни раз. Ключевой вывод: если представить числа как структурированные объекты с явным указанием разрядов и ролей, даже компактная архитектура справляется с арифметикой лучше, чем гигантские модели, использующие стандартную обработку текста.
Почему стандартные модели ошибаются в простых расчетах
Обычные языковые модели часто дают сбой на элементарных примерах, таких как сложение или умножение, потому что их «глаза» не видят структуры чисел. В стандартных подходах числа разбиваются на токены произвольно: последовательность «12345» может быть воспринята как единый блок, как «123» и «45» или как набор отдельных цифр. Для модели это создает проблему: она не понимает, что цифра «5» в конце числа — это единицы, а в начале — десятки.
Кроме того, стандартные позиционные вложения (positional embeddings) отслеживают место токена в предложении, но не его разряд внутри числа. Это заставляет нейросеть сначала угадывать математическую систему координат, и только потом пытаться выполнить вычисление.
Важный нюанс: Проблема не в недостатке вычислительной мощности. Модель GPT-2 XL с 1,56 млрд параметров набирает лишь 29,92% на тестах, что лишь немного выше случайного угадывания (25%). Ошибка кроется в том, как данные поступают на вход, а не в объеме памяти.
Как Atom2.7m меняет подход к представлению чисел
Разработчики из UniversalComputingResearch создали модель, которая видит числа иначе. Вместо того чтобы заставлять нейросеть догадываться о разрядах, архитектура явно передает эту информацию через специальные признаки.
Основные изменения в обработке данных:
- Атомарность цифр: Каждая цифра обрабатывается как отдельный, неделимый элемент, что исключает некорректное дробление чисел токенизатором.
- Обратный порядок: Цифры подаются модели от младшего разряда к старшему (например, число 17 подается как 7, затем 1). Это упрощает алгоритм переноса разряда (carry), так как вычисление идет в естественном для математики направлении.
- Явные роли: Модель получает метки
place_ids(разряд) иrole_ids(суммируемое число, множитель или результат), что делает структуру выражения прозрачной.
Такой подход позволяет модели Atom2.7m достигать результата 69,24% при минимальном размере. Для сравнения, специализированная прототипная модель с менее чем 1 млн параметров (748,8 тыс.) в закрытом режиме показала точность 77%, но она не умеет работать с обычным текстом. Atom2.7m сохраняет возможность обработки естественного языка (BPE-style), оставаясь при этом эффективной в арифметике.
Стоит учесть: Успех Atom2.7m не означает, что маленькие модели заменят большие. Это доказательство того, что для задач, требующих точности, критически важна специализация на уровне представления данных, а не просто масштабирование параметров.
Операционные последствия и практические аспекты
- Экономия ресурсов: Внедрение структурированных представлений чисел позволяет снизить требования к вычислительной мощности. Бизнес может запускать точные расчеты на менее мощном оборудовании, используя компактные модели вместо тяжелых гигантов.
- Сложность интеграции: Переход на такую архитектуру потребует изменения пайплайна обработки данных. Стандартные токенизаторы и форматы ввода не подойдут; потребуется внедрение кастомных преобразователей, которые разбивают числа и добавляют метки разрядов перед подачей в модель.
- Ограничение сферы применения: Текущие результаты подтверждены только на бенчмарке ArithMark2.0, который проверяет продолжение арифметических выражений. Способность модели решать текстовые задачи, требующие многоступенчатой логики или понимания контекста, не доказана и требует дополнительных тестов.
- Риск переобучения: Высокая точность на специфическом бенчмарке может быть следствием адаптации именно к его формату. При изменении формата ввода (например, использование дробей или нестандартной записи) эффективность может резко упасть без дополнительной дообучения.
Контекст и последствия
Исследование подчеркивает, что в области искусственного интеллекта наблюдается сдвиг от гонки за количеством параметров к оптимизации архитектуры и форматов данных. Если ранее доминировала идея, что «больше данных и больше параметров решат всё», то теперь становится очевидно: для задач с жесткой структурой (математика, код, химические формулы) ключевым фактором становится инженерия признаков (feature engineering) на уровне представления.
Это открывает путь для создания узкоспециализированных, энергоэффективных моделей для финансовых расчетов, инженерных задач и систем, где ошибка в одной цифре недопустима. Однако для широкого применения в естественном языке потребуется найти баланс между структурированностью чисел и гибкостью обработки текста, который пока не достигнут в полной мере.
Источник: huggingface.co