Модель Ourbox-35B-JGOS работает на обычном ноутбуке без видеокарты
Команда VIDRAFT запустила 35-миллиардную модель ИИ на обычном ноутбуке без видеокарты, сократив нагрузку на память в 11 раз за счет новой архитектуры. Это позволяет бизнесу обрабатывать конфиденциальные данные на собственном оборудовании, избавляясь от зависимости от дорогих облачных сервисов.
Команда VIDRAFT продемонстрировала возможность запуска крупной модели искусственного интеллекта Ourbox-35B-JGOS на потребительском оборудовании, включая ноутбуки с 8 ГБ видеопамяти и серверы без дискретных видеокарт. Ключевым фактором стала архитектура с разреженным включением экспертов (MoE): из 34,7 млрд параметров активны лишь около 3 млрд на каждый генерируемый токен. Это снизило нагрузку на память в 11 раз по сравнению с плотными моделями аналогичного размера. Тесты показали, что одна и та же модель работает со скоростью 20 токенов в секунду на игровом ноутбуке и 17 токенов в секунду на процессоре без GPU, сохраняя при этом высокую точность ответов.
Важный нюанс: Скорость генерации ограничена не вычислительной мощностью, а пропускной способностью памяти. Снижение объема активных данных позволяет обойти это «узкое горлышко» даже на слабом железе.
Физика работы: почему модель не «падает» на слабом оборудовании
Традиционное представление о том, что большие модели требуют дата-центров, основано на предположении, что система должна считывать все параметры при каждом шаге. В случае с Ourbox-35B-JGOS это не так. Модель использует механизм, при котором для обработки одного элемента текста задействуется лишь малая часть нейросети.
- Плотная модель (34 млрд параметров): требует перемещения 16,7 ГБ данных за токен. На видеокарте с 8 ГБ памяти это приводит к критическому замедлению или невозможности запуска.
- Модель Ourbox (3 млрд активных параметров): перемещает всего 1,45 ГБ данных за токен.
Разница в объеме данных, которые нужно «протащить» через шину памяти, составляет более 10 раз. Это позволяет держать большую часть модели в оперативной памяти (RAM), загружая в видеопамять только необходимые слои внимания и маршрутизатора. В результате модель, требующая мощного сервера в классическом исполнении, становится доступной для локального развертывания.
Стоит учесть: Даже при запуске на процессоре без ускорителя скорость 17 токенов в секунду остается приемлемой для интерактивного общения, что ранее считалось недостижимым для моделей такого класса.
Сравнение производительности на разных уровнях железа
Тестирование проводилось на одной и той же модели с одинаковыми весами, менялось только оборудование. Результаты показывают, как архитектура адаптируется под доступные ресурсы, сохраняя работоспособность на всех уровнях.
| Уровень оборудования | Тип устройства | Скорость (токенов/сек) | Примечание |
|---|---|---|---|
| Дата-центр | NVIDIA B200 | 18 057 | Максимальная пропускная способность (VKAE) |
| Облако | NVIDIA A10G | 126 | Стандартный облачный GPU (VKUE) |
| Потребительский | Ноутбук RTX 5060 (8 ГБ) | 20,01 | Игровой ноутбук (VKUE) |
| Без GPU | Серверный процессор | ~17 | Полностью без видеокарты (VKUE) |
Для сравнения, плотная модель Qwen2.5-32B на том же ноутбуке с 8 ГБ видеопамяти показала скорость всего 5,36 токена в секунду. Разреженная структура Ourbox обеспечила ускорение в 3,7 раза при практически идентичном размере файла на диске.
Операционные последствия и практическое применение
Внедрение подобных архитектур меняет подход к развертыванию ИИ в организациях, где доступ к облачным ресурсам ограничен или экономически нецелесообразен.
- Снижение порогов входа: Бизнесу больше не обязательно арендовать дорогие облачные инстансы с топовыми видеокартами для запуска сложных моделей рассуждений. Достаточно имеющегося парка серверов или даже мощных рабочих станций.
- Суверенность данных: Возможность запускать модели класса «фронт» (frontier) локально позволяет обрабатывать конфиденциальную информацию внутри периметра компании, не передавая её в публичные облака. Это критично для госсектора и предприятий с высокими требованиями к безопасности.
- Зависимость от архитектуры: Успех зависит не от количества видеопамяти, а от правильной реализации механизма маршрутизации экспертов. Перенос «тяжелых» моделей на слабое железо требует специализированных движков, таких как VKUE, способных эффективно управлять памятью.
На фоне этого: Развитие технологий разреженных моделей может привести к тому, что локальные ИИ-решения станут стандартом для малого и среднего бизнеса, снизив зависимость от глобальных провайдеров облачных услуг.
Технология VKUE (VIDRAFT Kernel Ubiquitous Engine) демонстрирует, что барьер между «моделью для дата-центра» и «моделью для ноутбука» размывается. Если раньше для работы с передовым ИИ требовалась инфраструктура стоимостью в десятки тысяч долларов, то теперь аналогичные задачи решаются на оборудовании за 1600 долларов или даже на стандартном процессоре. Это открывает путь к массовому внедрению сложных систем искусственного интеллекта в местах, где ранее это было физически невозможно.
Источник: huggingface.co