Август 2026   |   В фокусе

LiquidAI представила модель LFM2.5-2.6B для локальных агентов без облачных расходов

Модель от LiquidAI работает на обычном ноутбуке, но показывает результаты, сравнимые с решениями, которые вчетверо больше по размеру. Это позволяет бизнесу отказаться от дорогих облачных серверов и сохранить данные в полной приватности, обрабатывая их прямо на устройствах сотрудников.

Компания LiquidAI представила модель LFM2.5-2.6B, созданную для запуска автономных ИИ-агентов непосредственно на пользовательских устройствах. Размер модели составляет 2,6 миллиарда параметров, что позволяет ей работать на обычных ноутбуках и смартфонах без подключения к облачным серверам. Это решение устраняет необходимость в оплате вычислительных мощностей в облаке и обеспечивает полную приватность данных, так как обработка происходит локально.

Производительность и сравнение с конкурентами

Модель демонстрирует результаты, сопоставимые с решениями, размер которых в 4 раза больше. Тестирование проводилось на задачах выполнения инструкций, использования внешних инструментов и многошаговых сценариев.

В таблице ниже приведены результаты сравнения LFM2.5-2.6B с аналогами от Google (Gemma) и Alibaba (Qwen) на различных бенчмарках:

БенчмаркLFM2.5-2.6B (2.6B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)Qwen3.5-4B (4.7B)Qwen3.5-9B (9.7B)
AIME25 (Математика)51.8726.3334.2749.3356.07
LiveCodeBenchv6 (Код)59.4154.9263.7760.8569.86
IFBench (Инструкции)59.1734.0839.2448.4056.47
Multi-IF (Инструкции)80.0769.4477.3555.6762.55
ToolSandbox (Инструменты)77.8352.4065.0075.5576.44
Claw-Eval (Агенты)62.8553.1458.0262.2866.53

Модель лидирует в тестах на следование инструкциям и работу с инструментами, уступая более крупным конкурентам только в сложных задачах программирования.

Технические характеристики и скорость работы

Архитектура модели оптимизирована для работы на ограниченном оборудовании. Она потребляет менее 2,5 ГБ оперативной памяти.

Скорость генерации текста зависит от процессора:

  • На чипе Apple M5 Max: 220 токенов в секунду.
  • На процессоре AMD Ryzen AI Max+ 395: 113 токенов в секунду.
  • На мобильных устройствах: скорость составляет около 30 токенов в секунду, что достаточно для плавной работы агента.

При работе на графических ускорителях (GPU) модель достигает почти 15 000 токенов в секунду при высокой нагрузке. Один чип H100 способен обработать около 1,3 миллиарда токенов в сутки.

Методы обучения и подготовка данных

Разработчики использовали многоступенчатый процесс обучения, чтобы превратить базовую модель в специализированного агента:

  1. Предобучение: Модель обучалась на наборе данных объемом 34 триллиона токенов.
  2. Расширение контекста: На этапе дообучения контекстное окно увеличено до 128 000 токенов.
  3. Финальная настройка: Включала два этапа дообучения с упором на агентские задачи (поиск в сети, использование инструментов).
  4. Специализация: Для каждой области (математика, код, инструменты) обучались отдельные «учителя», знания которых затем объединялись в одну модель.
  5. Укрепленное обучение (RL): Модель проходила обучение в реальных средах, выполняя задачи через различные инструменты и интерфейсы.

Высокая эффективность малой модели достигается за счет специализированного обучения на агентских задачах, что позволяет компенсировать недостаток параметров качеством логики принятия решений.

Операционные последствия, тренды и практические аспекты

  • Снижение затрат на инфраструктуру: Перенос вычислений на устройства пользователей (edge computing) позволяет бизнесу избежать расходов на облачные вычисления для массовых сценариев использования, где не требуются сверхмощные серверы.
  • Повышение конфиденциальности: Локальная обработка данных исключает передачу чувствительной информации третьим лицам через интернет, что критично для корпоративных и персональных приложений.
  • Ограничения в сложных задачах: Несмотря на высокую скорость, модель уступает крупным аналогам в генерации сложного кода. Для задач, требующих глубокой программной логики, целесообразно использовать более тяжелые модели или гибридные решения.
  • Доступность инструментов: Модель уже поддерживает популярные фреймворки, такие как llama.cpp, MLX, vLLM, SGLang и ONNX, что упрощает интеграцию в существующие разработки.

Модель LFM2.5-2.6B и её базовая версия доступны для скачивания на платформе Hugging Face. Разработчики также предоставляют демонстрацию работы в браузере через технологию WebGPU, не требующую установки дополнительного ПО.

Коротко о главном

Какие результаты показывает модель на тестах по сравнению с конкурентами?

Несмотря на размер всего 2,6 миллиарда параметров, модель демонстрирует результаты, сопоставимые с решениями в 4 раза больше, и лидирует в тестах на следование инструкциям и работу с инструментами, уступая крупным аналогам лишь в сложных задачах программирования.

Какие требования к оборудованию предъявляет модель?

Архитектура оптимизирована для работы на ограниченном оборудовании и потребляет менее 2,5 ГБ оперативной памяти, что обеспечивает плавную генерацию текста со скоростью около 30 токенов в секунду даже на мобильных устройствах.

Какую скорость обработки обеспечивает модель на мощных серверах?

При работе на графических ускорителях модель достигает почти 15 000 токенов в секунду, а один чип H100 способен обработать около 1,3 миллиарда токенов в сутки, что делает её эффективной для высоконагруженных сценариев.

Какой объем данных использовался для обучения модели?

В процессе предобучения модель проанализировала набор данных объемом 34 триллиона токенов, после чего контекстное окно было расширено до 128 000 токенов для улучшения работы с длинными текстами.

Какие методы применялись для превращения модели в специализированного агента?

Разработчики использовали многоступенчатый процесс, включающий обучение отдельных «учителей» для математики и кода, а также укрепленное обучение в реальных средах, что позволило компенсировать малое количество параметров качеством логики принятия решений.

Какие практические преимущества дает перенос вычислений на устройства пользователей?

Локальный запуск позволяет бизнесу избежать расходов на облачную инфраструктуру для массовых сценариев и исключает передачу чувствительной информации третьим лицам через интернет.

Какие инструменты и платформы поддерживают модель для интеграции?

Модель уже совместима с популярными фреймворками, такими как llama.cpp, MLX и ONNX, а также доступна для скачивания на Hugging Face и запуска в браузере через технологию WebGPU без установки дополнительного ПО.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии

Материалы по теме