Июль 2026   |   В фокусе

Модель Ourbox-35B-JGOS работает на обычном ноутбуке без видеокарты

Команда VIDRAFT запустила 35-миллиардную модель ИИ на обычном ноутбуке без видеокарты, сократив нагрузку на память в 11 раз за счет новой архитектуры. Это позволяет бизнесу обрабатывать конфиденциальные данные на собственном оборудовании, избавляясь от зависимости от дорогих облачных сервисов.

Команда VIDRAFT продемонстрировала возможность запуска крупной модели искусственного интеллекта Ourbox-35B-JGOS на потребительском оборудовании, включая ноутбуки с 8 ГБ видеопамяти и серверы без дискретных видеокарт. Ключевым фактором стала архитектура с разреженным включением экспертов (MoE): из 34,7 млрд параметров активны лишь около 3 млрд на каждый генерируемый токен. Это снизило нагрузку на память в 11 раз по сравнению с плотными моделями аналогичного размера. Тесты показали, что одна и та же модель работает со скоростью 20 токенов в секунду на игровом ноутбуке и 17 токенов в секунду на процессоре без GPU, сохраняя при этом высокую точность ответов.

Важный нюанс: Скорость генерации ограничена не вычислительной мощностью, а пропускной способностью памяти. Снижение объема активных данных позволяет обойти это «узкое горлышко» даже на слабом железе.

Физика работы: почему модель не «падает» на слабом оборудовании

Традиционное представление о том, что большие модели требуют дата-центров, основано на предположении, что система должна считывать все параметры при каждом шаге. В случае с Ourbox-35B-JGOS это не так. Модель использует механизм, при котором для обработки одного элемента текста задействуется лишь малая часть нейросети.

  • Плотная модель (34 млрд параметров): требует перемещения 16,7 ГБ данных за токен. На видеокарте с 8 ГБ памяти это приводит к критическому замедлению или невозможности запуска.
  • Модель Ourbox (3 млрд активных параметров): перемещает всего 1,45 ГБ данных за токен.

Разница в объеме данных, которые нужно «протащить» через шину памяти, составляет более 10 раз. Это позволяет держать большую часть модели в оперативной памяти (RAM), загружая в видеопамять только необходимые слои внимания и маршрутизатора. В результате модель, требующая мощного сервера в классическом исполнении, становится доступной для локального развертывания.

Стоит учесть: Даже при запуске на процессоре без ускорителя скорость 17 токенов в секунду остается приемлемой для интерактивного общения, что ранее считалось недостижимым для моделей такого класса.

Сравнение производительности на разных уровнях железа

Тестирование проводилось на одной и той же модели с одинаковыми весами, менялось только оборудование. Результаты показывают, как архитектура адаптируется под доступные ресурсы, сохраняя работоспособность на всех уровнях.

Уровень оборудованияТип устройстваСкорость (токенов/сек)Примечание
Дата-центрNVIDIA B20018 057Максимальная пропускная способность (VKAE)
ОблакоNVIDIA A10G126Стандартный облачный GPU (VKUE)
ПотребительскийНоутбук RTX 5060 (8 ГБ)20,01Игровой ноутбук (VKUE)
Без GPUСерверный процессор~17Полностью без видеокарты (VKUE)

Для сравнения, плотная модель Qwen2.5-32B на том же ноутбуке с 8 ГБ видеопамяти показала скорость всего 5,36 токена в секунду. Разреженная структура Ourbox обеспечила ускорение в 3,7 раза при практически идентичном размере файла на диске.

Операционные последствия и практическое применение

Внедрение подобных архитектур меняет подход к развертыванию ИИ в организациях, где доступ к облачным ресурсам ограничен или экономически нецелесообразен.

  • Снижение порогов входа: Бизнесу больше не обязательно арендовать дорогие облачные инстансы с топовыми видеокартами для запуска сложных моделей рассуждений. Достаточно имеющегося парка серверов или даже мощных рабочих станций.
  • Суверенность данных: Возможность запускать модели класса «фронт» (frontier) локально позволяет обрабатывать конфиденциальную информацию внутри периметра компании, не передавая её в публичные облака. Это критично для госсектора и предприятий с высокими требованиями к безопасности.
  • Зависимость от архитектуры: Успех зависит не от количества видеопамяти, а от правильной реализации механизма маршрутизации экспертов. Перенос «тяжелых» моделей на слабое железо требует специализированных движков, таких как VKUE, способных эффективно управлять памятью.

На фоне этого: Развитие технологий разреженных моделей может привести к тому, что локальные ИИ-решения станут стандартом для малого и среднего бизнеса, снизив зависимость от глобальных провайдеров облачных услуг.

Технология VKUE (VIDRAFT Kernel Ubiquitous Engine) демонстрирует, что барьер между «моделью для дата-центра» и «моделью для ноутбука» размывается. Если раньше для работы с передовым ИИ требовалась инфраструктура стоимостью в десятки тысяч долларов, то теперь аналогичные задачи решаются на оборудовании за 1600 долларов или даже на стандартном процессоре. Это открывает путь к массовому внедрению сложных систем искусственного интеллекта в местах, где ранее это было физически невозможно.

Коротко о главном

Почему модель работает в 11 раз быстрее плотных аналогов?

Снижение нагрузки на память в 11 раз достигнуто за счет того, что для генерации одного элемента текста перемещается всего 1,45 ГБ данных вместо 16,7 ГБ у традиционных моделей. Такая оптимизация позволяет обойти ограничение пропускной способности памяти, которое обычно является главным «узким горлышком» на слабом оборудовании.

С какой скоростью работает модель на игровом ноутбуке и процессоре?

Тесты показали скорость генерации 20 токенов в секунду на ноутбуке с видеокартой RTX 5060 и 17 токенов в секунду на серверном процессоре без GPU. Эти показатели остаются приемлемыми для интерактивного общения, что ранее считалось недостижимым для моделей такого класса на подобном оборудовании.

Во сколько раз разреженная модель быстрее плотной на том же ноутбуке?

На устройстве с 8 ГБ видеопамяти модель Ourbox показала ускорение в 3,7 раза по сравнению с плотной моделью Qwen2.5-32B, выдавшей лишь 5,36 токена в секунду. Это преимущество достигнуто при практически идентичном размере файла на диске благодаря эффективному механизму маршрутизации.

Как изменились требования к инфраструктуре для бизнеса?

Внедрение технологии VKUE позволяет запускать сложные модели на стандартных серверах или рабочих станциях стоимостью около 1600 долларов, исключая необходимость аренды дорогих облачных инстансов. Это дает компаниям возможность обрабатывать конфиденциальные данные локально, обеспечивая суверенность информации без передачи её в публичные облака.

В чем заключается ключевая разница в обработке данных между моделями?

В отличие от традиционных систем, считывающих все параметры при каждом шаге, Ourbox задействует лишь малую часть нейросети для обработки одного элемента текста. Это позволяет держать основную часть модели в оперативной памяти (RAM), загружая в видеопамять только необходимые слои внимания и маршрутизатора.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Устройства и гаджеты; Ноутбуки и планшеты; Передовые технологии

Материалы по теме