Июль 2026   |   В фокусе

Модель POCKET-35B: локальный ИИ без видеокарты требует 32 ГБ ОЗУ

Локальный ИИ перестает требовать дорогих видеокарт: модель на 35 млрд параметров теперь работает на обычных ноутбуках, где главным ресурсом становится объем оперативной памяти. Скорость генерации выросла почти в три раза, что делает мощные нейросети доступными для бизнеса без затрат на облачные сервисы или специализированное железо.

Компания VIDRAFT_LAB представила семейство моделей POCKET, способных работать на обычных ноутбуках и смартфонах без использования мощных видеокарт. Модель объемом 35 млрд параметров использует архитектуру «смеси экспертов» (MoE), активируя лишь 3 млрд параметров на каждый сгенерированный токен. Это позволяет сократить потребление памяти и ускорить работу: на процессорах (CPU) скорость генерации выросла в 2,7 раза, а на видеокартах (GPU) — в 2,2 раза по сравнению с лучшими аналогами. Ключевое преимущество решения — совместимость со стандартными инструментами вроде llama.cpp, LM Studio и Ollama без необходимости установки модифицированных версий или облачных сервисов.

Важный нюанс: Производительность локального ИИ теперь зависит не от мощности видеокарты, а от объема оперативной памяти. Для запуска качественных версий достаточно 32 ГБ ОЗУ, тогда как для компактных версий хватит 16 ГБ.

Выбор конфигурации под ваше устройство

Разработчики подготовили несколько версий модели, оптимизированных под разные типы оборудования и языковые задачи. Размер файла и требуемый объем памяти напрямую определяют качество ответов.

  • POCKET-35B Q4_K_M (21 ГБ): Максимальное качество для ПК и рабочих станций. Требует 32 ГБ оперативной памяти.
  • POCKET-35B Q2_K (13 ГБ): Базовая версия для мини-ПК без видеокарты. Сохраняет 88% качества полной модели, работает быстрее из-за меньшего объема данных. Требует 16–24 ГБ ОЗУ.
  • POCKET-35B IQ1_M (8,2 ГБ): Самая компактная версия для устройств с 16 ГБ памяти.
  • POCKET-KR IQ2_M (5,1 ГБ): Версия для Android-смартфонов (корейский язык). Работает на устройствах с 8 ГБ памяти.
  • POCKET-KR MLX (5,1 ГБ): Нативная версия для iPhone, iPad и Mac (корейский язык). Использует фреймворк MLX.
  • POCKET-EN iPhone-mix (5,3 ГБ): Английская версия для iPhone через приложение PocketPal.
  • POCKET-EN PC-mix (6,8 ГБ): Английская версия для ПК и Android, максимально близкая к полному качеству.

Стоит учесть: При сборке мини-ПК приоритетом должна стать покупка большего объема оперативной памяти, а не скоростного SSD. Поскольку модель загружается в память, скорость диска влияет только на время первого запуска, но не на скорость генерации текста.

Технические детали и сравнение производительности

Архитектура модели основана на базе Darwin-36B-Opus. Разработчики применили два ключевых метода оптимизации: обрезку неиспользуемых экспертов (pruning) и смешанную точность квантования. Это позволило создать компактные версии для мобильных устройств, которые не требуют специфических модификаций софта.

В тестах на процессоре Xeon (16 потоков) и видеокарте H100 модель POCKET-35B IQ1_M показала следующие результаты по сравнению с конкурентом Bonsai-27B:

ПоказательPOCKET-35B IQ1_MBonsai-27B Q1_0Преимущество
Генерация на CPU27,0 ток/с10,1 ток/сВ 2,69 раза быстрее
Генерация на GPU197 ток/с89 ток/сВ 2,22 раза быстрее
Обработка промпта (GPU)753 ток/с1816 ток/сМедленнее в 2,4 раза
Качество (HellaSwag)61,0%60,0%Паритет

На потребительских ноутбуках, например MacBook M3 Pro (18 ГБ), ситуация меняется в пользу POCKET по всем параметрам, включая обработку промпта. Это связано с тем, что на обычных устройствах «узким местом» является пропускная способность памяти, а не вычислительная мощность. Модель POCKET читает в 5 раз меньше данных с памяти на каждый токен (0,66 ГБ против 3,5 ГБ у плотных моделей), что дает решающее преимущество на слабом оборудовании.

Важный нюанс: Английская и корейская версии требуют разных подходов к сжатию. Для корейского языка критична обрезка лишних экспертов, а для английского — смешанная точность квантования. Попытка применить одинаковые методы к обоим языкам приведет к значительной потере качества.

Операционные последствия и практические аспекты

  • Доступность инструментов: Модель работает в стандартных сборках llama.cpp, LM Studio, Ollama и MLX. Пользователям не нужно искать форки или модифицированные версии программного обеспечения, что снижает порог входа для бизнеса и частных лиц.
  • Зависимость от архитектуры памяти: Для эффективной работы на процессорах (без GPU) критически важен объем оперативной памяти. Устройства с 16 ГБ ОЗУ могут запускать только сильно сжатые версии с ограниченным качеством, тогда как 32 ГБ открывают доступ к версиям с высоким уровнем точности.
  • Специфика языковых моделей: При выборе версии под мобильное устройство необходимо учитывать язык. Корейская версия лучше переносит сильное сжатие (квантование), тогда как английская требует более щадящих методов, что отражается в различии форматов файлов (MLX для корейского на Apple, GGUF для английского).
  • Технические ограничения: Обработка длинных входных запросов (prefill) на мощных серверных видеокартах может происходить медленнее, чем у плотных моделей, так как механизм «смеси экспертов» активирует множество подмодулей одновременно. Однако для интерактивного диалога, где важна скорость генерации следующего слова, POCKET демонстрирует явное преимущество.

На фоне этого: Развитие архитектуры MoE смещает фокус с покупки дорогих видеокарт на модернизацию оперативной памяти. Это может изменить структуру рынка локальных ИИ-решений, сделав мощные модели доступными на массовых ноутбуках и смартфонах.

Коротко о главном

Почему скорость генерации на процессорах выросла в 2,7 раза?

Использование оптимизированной архитектуры MoE сократило объем данных, читаемых из памяти на каждый токен, в 5 раз по сравнению с плотными моделями, что устранило «узкое место» пропускной способности памяти на потребительском оборудовании.

Какой объем оперативной памяти требуется для запуска версии максимального качества?

Для работы версии POCKET-35B Q4_K_M, обеспечивающей наилучшие результаты, необходимо 32 ГБ ОЗУ, так как файл модели занимает 21 ГБ и требует дополнительного пространства для эффективной генерации.

Почему корейская версия модели лучше переносит сильное сжатие, чем английская?

Разработчики применили разные методы оптимизации: для корейского языка критична обрезка неиспользуемых экспертов, а для английского — смешанная точность квантования, что позволяет сохранять качество при меньшем размере файла в зависимости от языка.

Какое преимущество POCKET имеет перед Bonsai-27B на видеокарте H100?

Модель POCKET-35B IQ1_M генерирует текст в 2,22 раза быстрее конкурента, достигая 197 токенов в секунду против 89, благодаря более эффективному механизму активации подмодулей.

Почему скорость обработки длинных запросов (prefill) на GPU может быть ниже у POCKET?

Механизм «смеси экспертов» активирует множество подмодулей одновременно при анализе входного текста, что замедляет начальную обработку промпта в 2,4 раза по сравнению с плотными моделями на мощных серверных видеокартах.

Какие стандартные инструменты поддерживают запуск моделей без модификаций?

Семейство POCKET совместимо с популярными фреймворками llama.cpp, LM Studio, Ollama и MLX, что позволяет запускать ИИ без установки специализированных версий софта или использования облачных сервисов.

Почему при сборке мини-ПК для локального ИИ приоритет отдается ОЗУ, а не SSD?

Поскольку вся модель загружается в оперативную память, объем ОЗУ напрямую определяет возможность запуска качественных версий, тогда как скорость диска влияет только на время первого запуска, но не на скорость генерации текста.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Устройства и гаджеты

Материалы по теме