LiquidAI представила модель LFM2.5-2.6B для локальных агентов без облачных расходов
Модель от LiquidAI работает на обычном ноутбуке, но показывает результаты, сравнимые с решениями, которые вчетверо больше по размеру. Это позволяет бизнесу отказаться от дорогих облачных серверов и сохранить данные в полной приватности, обрабатывая их прямо на устройствах сотрудников.
Компания LiquidAI представила модель LFM2.5-2.6B, созданную для запуска автономных ИИ-агентов непосредственно на пользовательских устройствах. Размер модели составляет 2,6 миллиарда параметров, что позволяет ей работать на обычных ноутбуках и смартфонах без подключения к облачным серверам. Это решение устраняет необходимость в оплате вычислительных мощностей в облаке и обеспечивает полную приватность данных, так как обработка происходит локально.
Производительность и сравнение с конкурентами
Модель демонстрирует результаты, сопоставимые с решениями, размер которых в 4 раза больше. Тестирование проводилось на задачах выполнения инструкций, использования внешних инструментов и многошаговых сценариев.
В таблице ниже приведены результаты сравнения LFM2.5-2.6B с аналогами от Google (Gemma) и Alibaba (Qwen) на различных бенчмарках:
| Бенчмарк | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AIME25 (Математика) | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBenchv6 (Код) | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
| IFBench (Инструкции) | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF (Инструкции) | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| ToolSandbox (Инструменты) | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw-Eval (Агенты) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
Модель лидирует в тестах на следование инструкциям и работу с инструментами, уступая более крупным конкурентам только в сложных задачах программирования.
Технические характеристики и скорость работы
Архитектура модели оптимизирована для работы на ограниченном оборудовании. Она потребляет менее 2,5 ГБ оперативной памяти.
Скорость генерации текста зависит от процессора:
- На чипе Apple M5 Max: 220 токенов в секунду.
- На процессоре AMD Ryzen AI Max+ 395: 113 токенов в секунду.
- На мобильных устройствах: скорость составляет около 30 токенов в секунду, что достаточно для плавной работы агента.
При работе на графических ускорителях (GPU) модель достигает почти 15 000 токенов в секунду при высокой нагрузке. Один чип H100 способен обработать около 1,3 миллиарда токенов в сутки.
Методы обучения и подготовка данных
Разработчики использовали многоступенчатый процесс обучения, чтобы превратить базовую модель в специализированного агента:
- Предобучение: Модель обучалась на наборе данных объемом 34 триллиона токенов.
- Расширение контекста: На этапе дообучения контекстное окно увеличено до 128 000 токенов.
- Финальная настройка: Включала два этапа дообучения с упором на агентские задачи (поиск в сети, использование инструментов).
- Специализация: Для каждой области (математика, код, инструменты) обучались отдельные «учителя», знания которых затем объединялись в одну модель.
- Укрепленное обучение (RL): Модель проходила обучение в реальных средах, выполняя задачи через различные инструменты и интерфейсы.
Высокая эффективность малой модели достигается за счет специализированного обучения на агентских задачах, что позволяет компенсировать недостаток параметров качеством логики принятия решений.
Операционные последствия, тренды и практические аспекты
- Снижение затрат на инфраструктуру: Перенос вычислений на устройства пользователей (edge computing) позволяет бизнесу избежать расходов на облачные вычисления для массовых сценариев использования, где не требуются сверхмощные серверы.
- Повышение конфиденциальности: Локальная обработка данных исключает передачу чувствительной информации третьим лицам через интернет, что критично для корпоративных и персональных приложений.
- Ограничения в сложных задачах: Несмотря на высокую скорость, модель уступает крупным аналогам в генерации сложного кода. Для задач, требующих глубокой программной логики, целесообразно использовать более тяжелые модели или гибридные решения.
- Доступность инструментов: Модель уже поддерживает популярные фреймворки, такие как llama.cpp, MLX, vLLM, SGLang и ONNX, что упрощает интеграцию в существующие разработки.
Модель LFM2.5-2.6B и её базовая версия доступны для скачивания на платформе Hugging Face. Разработчики также предоставляют демонстрацию работы в браузере через технологию WebGPU, не требующую установки дополнительного ПО.
Источник: huggingface.co