Модель POCKET-35B: локальный ИИ без видеокарты требует 32 ГБ ОЗУ
Локальный ИИ перестает требовать дорогих видеокарт: модель на 35 млрд параметров теперь работает на обычных ноутбуках, где главным ресурсом становится объем оперативной памяти. Скорость генерации выросла почти в три раза, что делает мощные нейросети доступными для бизнеса без затрат на облачные сервисы или специализированное железо.
Компания VIDRAFT_LAB представила семейство моделей POCKET, способных работать на обычных ноутбуках и смартфонах без использования мощных видеокарт. Модель объемом 35 млрд параметров использует архитектуру «смеси экспертов» (MoE), активируя лишь 3 млрд параметров на каждый сгенерированный токен. Это позволяет сократить потребление памяти и ускорить работу: на процессорах (CPU) скорость генерации выросла в 2,7 раза, а на видеокартах (GPU) — в 2,2 раза по сравнению с лучшими аналогами. Ключевое преимущество решения — совместимость со стандартными инструментами вроде llama.cpp, LM Studio и Ollama без необходимости установки модифицированных версий или облачных сервисов.
Важный нюанс: Производительность локального ИИ теперь зависит не от мощности видеокарты, а от объема оперативной памяти. Для запуска качественных версий достаточно 32 ГБ ОЗУ, тогда как для компактных версий хватит 16 ГБ.
Выбор конфигурации под ваше устройство
Разработчики подготовили несколько версий модели, оптимизированных под разные типы оборудования и языковые задачи. Размер файла и требуемый объем памяти напрямую определяют качество ответов.
- POCKET-35B Q4_K_M (21 ГБ): Максимальное качество для ПК и рабочих станций. Требует 32 ГБ оперативной памяти.
- POCKET-35B Q2_K (13 ГБ): Базовая версия для мини-ПК без видеокарты. Сохраняет 88% качества полной модели, работает быстрее из-за меньшего объема данных. Требует 16–24 ГБ ОЗУ.
- POCKET-35B IQ1_M (8,2 ГБ): Самая компактная версия для устройств с 16 ГБ памяти.
- POCKET-KR IQ2_M (5,1 ГБ): Версия для Android-смартфонов (корейский язык). Работает на устройствах с 8 ГБ памяти.
- POCKET-KR MLX (5,1 ГБ): Нативная версия для iPhone, iPad и Mac (корейский язык). Использует фреймворк MLX.
- POCKET-EN iPhone-mix (5,3 ГБ): Английская версия для iPhone через приложение PocketPal.
- POCKET-EN PC-mix (6,8 ГБ): Английская версия для ПК и Android, максимально близкая к полному качеству.
Стоит учесть: При сборке мини-ПК приоритетом должна стать покупка большего объема оперативной памяти, а не скоростного SSD. Поскольку модель загружается в память, скорость диска влияет только на время первого запуска, но не на скорость генерации текста.
Технические детали и сравнение производительности
Архитектура модели основана на базе Darwin-36B-Opus. Разработчики применили два ключевых метода оптимизации: обрезку неиспользуемых экспертов (pruning) и смешанную точность квантования. Это позволило создать компактные версии для мобильных устройств, которые не требуют специфических модификаций софта.
В тестах на процессоре Xeon (16 потоков) и видеокарте H100 модель POCKET-35B IQ1_M показала следующие результаты по сравнению с конкурентом Bonsai-27B:
| Показатель | POCKET-35B IQ1_M | Bonsai-27B Q1_0 | Преимущество |
|---|---|---|---|
| Генерация на CPU | 27,0 ток/с | 10,1 ток/с | В 2,69 раза быстрее |
| Генерация на GPU | 197 ток/с | 89 ток/с | В 2,22 раза быстрее |
| Обработка промпта (GPU) | 753 ток/с | 1816 ток/с | Медленнее в 2,4 раза |
| Качество (HellaSwag) | 61,0% | 60,0% | Паритет |
На потребительских ноутбуках, например MacBook M3 Pro (18 ГБ), ситуация меняется в пользу POCKET по всем параметрам, включая обработку промпта. Это связано с тем, что на обычных устройствах «узким местом» является пропускная способность памяти, а не вычислительная мощность. Модель POCKET читает в 5 раз меньше данных с памяти на каждый токен (0,66 ГБ против 3,5 ГБ у плотных моделей), что дает решающее преимущество на слабом оборудовании.
Важный нюанс: Английская и корейская версии требуют разных подходов к сжатию. Для корейского языка критична обрезка лишних экспертов, а для английского — смешанная точность квантования. Попытка применить одинаковые методы к обоим языкам приведет к значительной потере качества.
Операционные последствия и практические аспекты
- Доступность инструментов: Модель работает в стандартных сборках llama.cpp, LM Studio, Ollama и MLX. Пользователям не нужно искать форки или модифицированные версии программного обеспечения, что снижает порог входа для бизнеса и частных лиц.
- Зависимость от архитектуры памяти: Для эффективной работы на процессорах (без GPU) критически важен объем оперативной памяти. Устройства с 16 ГБ ОЗУ могут запускать только сильно сжатые версии с ограниченным качеством, тогда как 32 ГБ открывают доступ к версиям с высоким уровнем точности.
- Специфика языковых моделей: При выборе версии под мобильное устройство необходимо учитывать язык. Корейская версия лучше переносит сильное сжатие (квантование), тогда как английская требует более щадящих методов, что отражается в различии форматов файлов (MLX для корейского на Apple, GGUF для английского).
- Технические ограничения: Обработка длинных входных запросов (prefill) на мощных серверных видеокартах может происходить медленнее, чем у плотных моделей, так как механизм «смеси экспертов» активирует множество подмодулей одновременно. Однако для интерактивного диалога, где важна скорость генерации следующего слова, POCKET демонстрирует явное преимущество.
На фоне этого: Развитие архитектуры MoE смещает фокус с покупки дорогих видеокарт на модернизацию оперативной памяти. Это может изменить структуру рынка локальных ИИ-решений, сделав мощные модели доступными на массовых ноутбуках и смартфонах.
Источник: huggingface.co