Июль 2026   |   В фокусе

Модель Atom2.7m: точность расчетов выросла до 69% за счет смены формата данных

Модель весом 2,7 млн параметров вытесняет гигантов с миллиардными параметрами в арифметике, добиваясь точности 69% за счет смены формата подачи чисел. Гонка за масштабирование уступает место инженерии данных, позволяя бизнесу сократить вычислительные расходы, но требуя полной перестройки пайплайнов обработки информации.

Исследование, опубликованное 7 июля 2026 года, демонстрирует, что способность нейросетей выполнять точные вычисления определяется не столько количеством параметров, сколько способом подачи чисел. Модель Atom2.7m с объемом всего 2,74 млн параметров показала точность 69,24% на бенчмарке ArithMark2.0, превзойдя многие системы, превосходящие её по масштабу в сотни раз. Ключевой вывод: если представить числа как структурированные объекты с явным указанием разрядов и ролей, даже компактная архитектура справляется с арифметикой лучше, чем гигантские модели, использующие стандартную обработку текста.

Почему стандартные модели ошибаются в простых расчетах

Обычные языковые модели часто дают сбой на элементарных примерах, таких как сложение или умножение, потому что их «глаза» не видят структуры чисел. В стандартных подходах числа разбиваются на токены произвольно: последовательность «12345» может быть воспринята как единый блок, как «123» и «45» или как набор отдельных цифр. Для модели это создает проблему: она не понимает, что цифра «5» в конце числа — это единицы, а в начале — десятки.

Кроме того, стандартные позиционные вложения (positional embeddings) отслеживают место токена в предложении, но не его разряд внутри числа. Это заставляет нейросеть сначала угадывать математическую систему координат, и только потом пытаться выполнить вычисление.

Важный нюанс: Проблема не в недостатке вычислительной мощности. Модель GPT-2 XL с 1,56 млрд параметров набирает лишь 29,92% на тестах, что лишь немного выше случайного угадывания (25%). Ошибка кроется в том, как данные поступают на вход, а не в объеме памяти.

Как Atom2.7m меняет подход к представлению чисел

Разработчики из UniversalComputingResearch создали модель, которая видит числа иначе. Вместо того чтобы заставлять нейросеть догадываться о разрядах, архитектура явно передает эту информацию через специальные признаки.

Основные изменения в обработке данных:

  • Атомарность цифр: Каждая цифра обрабатывается как отдельный, неделимый элемент, что исключает некорректное дробление чисел токенизатором.
  • Обратный порядок: Цифры подаются модели от младшего разряда к старшему (например, число 17 подается как 7, затем 1). Это упрощает алгоритм переноса разряда (carry), так как вычисление идет в естественном для математики направлении.
  • Явные роли: Модель получает метки place_ids (разряд) и role_ids (суммируемое число, множитель или результат), что делает структуру выражения прозрачной.

Такой подход позволяет модели Atom2.7m достигать результата 69,24% при минимальном размере. Для сравнения, специализированная прототипная модель с менее чем 1 млн параметров (748,8 тыс.) в закрытом режиме показала точность 77%, но она не умеет работать с обычным текстом. Atom2.7m сохраняет возможность обработки естественного языка (BPE-style), оставаясь при этом эффективной в арифметике.

Стоит учесть: Успех Atom2.7m не означает, что маленькие модели заменят большие. Это доказательство того, что для задач, требующих точности, критически важна специализация на уровне представления данных, а не просто масштабирование параметров.

Операционные последствия и практические аспекты

  • Экономия ресурсов: Внедрение структурированных представлений чисел позволяет снизить требования к вычислительной мощности. Бизнес может запускать точные расчеты на менее мощном оборудовании, используя компактные модели вместо тяжелых гигантов.
  • Сложность интеграции: Переход на такую архитектуру потребует изменения пайплайна обработки данных. Стандартные токенизаторы и форматы ввода не подойдут; потребуется внедрение кастомных преобразователей, которые разбивают числа и добавляют метки разрядов перед подачей в модель.
  • Ограничение сферы применения: Текущие результаты подтверждены только на бенчмарке ArithMark2.0, который проверяет продолжение арифметических выражений. Способность модели решать текстовые задачи, требующие многоступенчатой логики или понимания контекста, не доказана и требует дополнительных тестов.
  • Риск переобучения: Высокая точность на специфическом бенчмарке может быть следствием адаптации именно к его формату. При изменении формата ввода (например, использование дробей или нестандартной записи) эффективность может резко упасть без дополнительной дообучения.

Контекст и последствия

Исследование подчеркивает, что в области искусственного интеллекта наблюдается сдвиг от гонки за количеством параметров к оптимизации архитектуры и форматов данных. Если ранее доминировала идея, что «больше данных и больше параметров решат всё», то теперь становится очевидно: для задач с жесткой структурой (математика, код, химические формулы) ключевым фактором становится инженерия признаков (feature engineering) на уровне представления.

Это открывает путь для создания узкоспециализированных, энергоэффективных моделей для финансовых расчетов, инженерных задач и систем, где ошибка в одной цифре недопустима. Однако для широкого применения в естественном языке потребуется найти баланс между структурированностью чисел и гибкостью обработки текста, который пока не достигнут в полной мере.

Коротко о главном

Почему стандартные языковые модели ошибаются в простых вычислениях?

Такие системы, как GPT-2 XL с 1,56 млрд параметров, набирают лишь 29,92% баллов, потому что произвольное разбиение чисел на токены лишает их понимания разрядов цифр и заставляет угадывать математическую систему координат.

Как изменение порядка подачи цифр влияет на точность вычислений?

В архитектуре Atom2.7m цифры передаются от младшего разряда к старшему, что упрощает алгоритм переноса разряда и позволяет модели выполнять вычисления в естественном для математики направлении.

Какую роль играют специальные метки в обработке данных?

Модель получает явные теги place_ids и role_ids, которые делают структуру выражения прозрачной, устраняя необходимость для нейросети догадываться о функции каждой цифры в расчете.

Почему специализированная прототипная модель не подходит для широкого применения?

Несмотря на рекордную точность 77% при размере менее 1 млн параметров, эта модель не способна обрабатывать обычный текст, в отличие от Atom2.7m, сохраняющей поддержку естественного языка.

Какие изменения в инфраструктуре потребуются для внедрения нового подхода?

Переход на структурированные представления чисел требует замены стандартных токенизаторов на кастомные преобразователи, способные разбивать числа и добавлять метки разрядов перед подачей данных в модель.

Каковы ограничения текущих результатов исследования?

Подтвержденная высокая точность относится только к бенчмарку ArithMark2.0, а способность модели решать сложные текстовые задачи с многоступенчатой логикой или работать с дробями пока не доказана.

Какой риск связан с высокой точностью на специфическом бенчмарке?

Эффективность модели может резко упасть при изменении формата ввода, например, при использовании нестандартной записи чисел, из-за возможного переобучения именно под формат тестов ArithMark2.0.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования; Передовые технологии

Материалы по теме