Июль 2026   |   В фокусе

BaseRT ускорил запуск ИИ на Mac до 1,56 раза за счет прямой работы с Metal

Слои абстракции в популярных движках съедают до 56% скорости работы малых моделей на чипах Apple Silicon. Новый инструмент BaseRT обходит эти потери прямым доступом к Metal, делая локальный ИИ на Mac значительно отзывчивее для бизнес-задач.

Компания Base Compute представила BaseRT — движок для запуска больших языковых моделей (LLM) на процессорах Apple Silicon, который демонстрирует рекордную скорость обработки. В отличие от популярных решений вроде llama.cpp или MLX, новый инструмент написан с нуля и работает напрямую с графическим API Metal, минуя промежуточные слои абстракции. Тесты на чипах M3 и M4 Pro показали ускорение декодирования до 1,56 раза по сравнению с llama.cpp и до 1,35 раза против MLX.

Важный нюанс: Максимальный прирост производительности наблюдается на компактных моделях, где накладные расходы на управление программным обеспечением обычно «съедают» значительную часть времени.

Архитектура без лишнего веса

Основная проблема существующих решений заключается в универсальности: они пытаются работать на разных устройствах и с разными моделями через общие слои кода, что создает задержки. BaseRT отказался от этого подхода в пользу жесткой специализации под железо Apple.

Ключевые изменения в архитектуре:

  • Прямая работа с Metal: Движок не зависит от PyTorch, CoreML или MLX. Код написан на C++ и обращается к видеокарте напрямую, что устраняет лишние преобразования данных.
  • Описание моделей как данных: Вместо того чтобы писать отдельный код для каждой архитектуры (например, для Llama или Qwen), движок использует компактный дескриптор. Это позволяет обрабатывать разные модели одинаковым кодом, не меняя логику выполнения.
  • Отсутствие выделения памяти во время работы: После загрузки модели движок больше не запрашивает память у системы. Все буферы для вычислений, включая кэш контекста, выделяются один раз при старте и переиспользуются.
  • Специализированные ядра: Для каждого типа операции (умножение матриц, внимание, нормализация) созданы отдельные оптимизированные функции. Декомпрессия данных происходит прямо в процессе вычислений, не требуя загрузки полных весов в память.

Результаты тестирования и сравнение

Испытания проводились на процессоре M4 Pro (16 ядер GPU, 24 ГБ памяти) и M3 (8 ядер GPU). В тесте участвовали модели семейств Qwen3, Llama 3.2 и Gemma 4 с квантованием Q4 и Q8.

МодельКвантованиеBaseRT (токенов/с)llama.cpp (токенов/с)Прирост к llama.cppMLX (токенов/с)Прирост к MLX
Qwen3 0.6BQ4464.5297.41.56×343.61.35×
Qwen3 0.6BQ8321.2219.81.46×255.31.26×
Llama 3.2 1BQ4295.4230.41.28×257.81.15×
Llama 3.2 3BQ4117.3102.41.15×112.11.05×
Gemma 4 26BQ462.258.01.07×69.30.90×
Qwen3 30BQ484.180.71.04×83.11.01×

Данные показывают четкую закономерность: чем меньше модель, тем выше преимущество BaseRT. На малых моделях (например, Qwen3 0.6B) ускорение достигает 56%. На крупных моделях с миксом экспертов (MoE) преимущество сохраняется, но снижается, так как узким местом становится пропускная способность памяти, а не скорость программного кода.

В режиме предобработки (prefill), когда модель анализирует длинный запрос, BaseRT показал значительный отрыв на моделях MoE — до 1,81 раза быстрее llama.cpp. Это стало возможным благодаря использованию алгоритмов, похожих на FlashAttention, которые снижают потребление памяти.

Стоит учесть: На этапе предобработки для небольших моделей разрыв между решениями минимален, так как видеокарта загружена на 100% вычислениями, и программные оптимизации не могут ускорить физический предел скорости чипа.

Практическое применение и интеграция

Движок доступен как командная строка, библиотека C и модули для Python, Node, Rust и Swift. Установка занимает одну команду, а загрузка моделей происходит напрямую из репозитория Hugging Face.

Операционные последствия для внедрения:

  • Снижение задержек для локальных агентов: Ускорение декодирования делает взаимодействие с ИИ на ноутбуках Apple более отзывчивым, что критично для кодинга-ассистентов и чат-ботов, работающих без интернета.
  • Экономия ресурсов: Отсутствие выделения памяти во время генерации снижает риск фрагментации памяти и повышает стабильность работы при длительных сессиях.
  • Гибкость развертывания: Поддержка формата OpenAI API позволяет использовать BaseRT как локальный бэкенд для существующих приложений без переписывания кода.
  • Зависимость от архитектуры: Текущая версия работает только на GPU Apple. Использование нейронного движка (Neural Engine) пока не реализовано, в отличие от конкурента uzu, который может задействовать его для отдельных операций.

На фоне этого: Для крупных моделей, ограниченных скоростью памяти, переход на BaseRT даст меньший прирост, чем для легких моделей, где важна скорость запуска операций.

Выводы для рынка

Появление BaseRT сигнализирует о том, что эра универсальных, но медленных движков для локального ИИ на Mac подходит к концу. Специализация под конкретное железо позволяет выжимать из чипов M3 и M4 потенциал, который ранее оставался недостижимым из-за слоев абстракции. Для разработчиков, создающих приложения под экосистему Apple, это открывает возможность запускать более сложные модели на потребительском оборудовании без потери скорости.

Коротко о главном

Почему преимущество BaseRT снижается на крупных моделях?

На больших моделях узким местом становится пропускная способность памяти, а не скорость программного кода, что ограничивает эффект от оптимизаций движка.

Как BaseRT управляет памятью во время генерации текста?

После загрузки модели движок перестает запрашивать память у системы, выделяя все буферы один раз при старте, что предотвращает фрагментацию и повышает стабильность работы.

В чем заключается архитектурная особенность обработки разных моделей?

Вместо написания отдельного кода для каждой архитектуры движок использует компактный дескриптор, позволяя обрабатывать различные модели одинаковой логикой без изменения кода выполнения.

Какой результат показал BaseRT в режиме предобработки для моделей MoE?

Благодаря использованию алгоритмов, аналогичных FlashAttention, движок ускорил обработку длинных запросов до 1,81 раза быстрее llama.cpp, снизив при этом потребление памяти.

Какие языки программирования поддерживаются для интеграции BaseRT?

Инструмент доступен как библиотека C и модули для Python, Node, Rust и Swift, что позволяет использовать его как локальный бэкенд с поддержкой формата OpenAI API.

На каких процессорах проводились тесты производительности?

Испытания проводились на чипах M3 и M4 Pro, где максимальный прирост производительности был зафиксирован именно на компактных моделях с квантованием Q4 и Q8.

Какова текущая зависимость BaseRT от аппаратного обеспечения Apple?

Движок работает исключительно на GPU Apple и пока не поддерживает использование нейронного движка (Neural Engine), в отличие от некоторых конкурентов.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Устройства и гаджеты

Материалы по теме