Июль 2026   |   В фокусе

Thinking Machines Inkling: мультимодальная модель с 1 млн токенов и архитектурой MoE

Открытая мультимодальная модель Inkling от Thinking Machines бросает вызов закрытым лидерам, показывая в тестах по математике и программированию результаты, сопоставимые с топовыми проприетарными решениями. Бизнес получает шанс развернуть мощного ИИ-агента на собственной инфраструктуре, полностью контролируя данные и снижая зависимость от облачных провайдеров, хотя запуск полной версии потребует серьезных инвестиций в видеопамять.

Компания Thinking Machines выпустила открытую мультимодальную модель Inkling, способную одновременно обрабатывать текст, изображения и аудио. Модель насчитывает 975 млрд параметров в общей сложности, при этом в работе участвует 41 млрд благодаря архитектуре Mixture-of-Experts (MoE). Она поддерживает контекстное окно в 1 млн токенов и доступна на платформе Hugging Face в версиях с точностью BF16 и сжатой NVFP4.

Архитектура и технические особенности

Inkling построена на базе декодера с механизмом «смеси экспертов» (MoE), что позволяет ускорять вычисления, активируя лишь часть параметров. Вместо стандартного метода позиционного кодирования RoPE модель использует относительное внимание, обучаясь определять позицию токенов напрямую.

Ключевые элементы архитектуры:

  • Гибридное внимание: Слои чередуются между глобальным вниманием (анализ всего контекста) и скользящим окном (локальный анализ) в соотношении 5:1. Это снижает вычислительную нагрузку при работе с длинными текстами.
  • Короткая свертка (SConv): Специальный слой обрабатывает локальные зависимости, разгружая модули внимания и экспертов.
  • Обработка мультимодальных данных:
    • Изображения: Используются иерархические MLP-слои для сжатия пикселей в эмбеддинги. Поддерживается временная ось для видео.
    • Аудио: Звуковая волна преобразуется в дискретный мел-спектрограмму (фрагменты по 100 мс), который классифицируется и превращается в вектор.
  • Эксперты: В модели 256 экспертов. Роутер выбирает 6 лучших для каждого запроса, плюс 2 общих эксперта, которые работают постоянно.

Важный нюанс: Модель не использует отдельные тяжелые энкодеры для каждого типа данных, как многие аналоги, а применяет относительно простые модули-«башни» для преобразования входных данных, что упрощает архитектуру.

Производительность и требования к оборудованию

Запуск полной версии модели требует значительных ресурсов. Для версии с точностью BF16 необходимо 2 ТБ видеопамяти (VRAM). Сжатая версия NVFP4 снижает потребность до 600 ГБ VRAM. Для локального развертывания на ограниченном оборудовании доступны квантованные версии через llama.cpp (включая 1-битную версию от Unsloth), сокращающие потребление памяти на 95%.

Модель поддерживает ускорение генерации через механизм спекулятивного декодирования (MTP), где дополнительные слои предсказывают несколько токенов сразу, выступая в роли «черновиков».

Поддержка инфраструктуры развертывания:

  • Transformers: Полная поддержка «из коробки» (версия 5.14.0 и выше).
  • SGLang и vLLM: Оптимизированные фреймворки для продакшн-среды с распределением по нескольким GPU.
  • Hugging Face Inference Providers: Доступ через облачные API с оплатой по факту использования.

Результаты тестирования и сравнение

В бенчмарках Inkling показывает высокие результаты в задачах логического вывода и программирования, часто превосходя закрытые аналоги. В таблице ниже приведены сравнительные данные по ключевым метрикам (значения в процентах, если не указано иное):

Тестовая задачаInklingNemotron 3 UltraKimi K2.6DeepSeek V4 ProGPT 5.6 Sol (xhigh)
HLE (с инструментами)46.0%37.4%54.0%48.2%64.5%
AIME 2026 (математика)97.1%94.2%96.4%99.2%99.9%
GPQA Diamond (наука)87.2%86.7%91.1%88.8%94.1%
SWEBench Verified (код)77.6%70.7%80.2%80.6%95.0%
MCP Atlas (агент)74.1%44.7%68.1%73.2%83.3%
VoiceBench (аудио)91.4%94.3%

В тестах на визуальное понимание (MMMU Pro) модель достигла 73.3%, а в задачах с аудио (BigBenchAudio) успешно справилась с логическими ловушками и подсчетом объектов.

Стоит учесть: На открытых вопросах без вариантов ответа модель тратит больше токенов и иногда ошибается, тогда как в тестах с выбором из нескольких вариантов (MCQA) ее точность значительно выше. Это указывает на важность правильной формулировки промптов для экономии ресурсов.

Операционные последствия и практическое применение

  • Доступность для бизнеса: Наличие открытого веса и поддержка популярных фреймворков (vLLM, SGLang) позволяют компаниям развертывать модель на собственной инфраструктуре, избегая зависимости от облачных провайдеров и контроля над данными.
  • Снижение затрат на инференс: Использование архитектуры MoE и спекулятивного декодирования (MTP) позволяет сократить время генерации и стоимость обработки длинных контекстов, что критично для задач анализа документов и транскрибации аудио.
  • Риски развертывания: Полная версия модели требует специализированных серверов с огромным объемом видеопамяти (от 600 ГБ до 2 ТБ), что делает локальный запуск сложным для малого бизнеса без использования квантованных версий, которые могут терять в точности.
  • Интеграция в агентов: Модель готова к работе в агентных сценариях (например, через инструмент Pi), выполняя сложные цепочки действий, включая использование внешних инструментов для решения математических и логических задач.

Важный нюанс: Модель демонстрирует высокую эффективность в задачах, где требуется перенос знаний между модальностями (например, анализ схемы на изображении и объяснение логики в тексте), что открывает возможности для создания новых классов приложений по обработке технической документации.

Коротко о главном

Как Inkling обрабатывает длинные контексты без стандартного позиционного кодирования?

Модель использует относительное внимание вместо метода RoPE и чередует слои глобального и локального внимания в соотношении 5:1, что снижает вычислительную нагрузку при анализе контекста до 1 млн токенов.

Сколько видеопамяти требуется для запуска разных версий модели?

Полная версия с точностью BF16 требует 2 ТБ видеопамяти, тогда как сжатая версия NVFP4 снижает потребность до 600 ГБ, а квантованные варианты через llama.cpp сокращают потребление еще на 95% для работы на ограниченном оборудовании.

Какие результаты Inkling показала в тестах по математике и коду?

В бенчмарке AIME 2026 модель достигла 97,1%, а в SWEBench Verified — 77,6%, часто превосходя закрытые аналоги, но уступая лидерам в задачах с открытыми вопросами из-за повышенного расхода токенов.

Как устроена система выбора экспертов внутри архитектуры?

В модели насчитывается 256 экспертов, при этом роутер для каждого запроса активирует только 6 лучших специалистов и 2 общих, работающих постоянно, что оптимизирует использование ресурсов.

Как Inkling преобразует аудио- и видеоданные в векторы?

Звуковые волны разбиваются на фрагменты по 100 мс и классифицируются в дискретные мел-спектрограммы, а изображения сжимаются через иерархические MLP-слои, что позволяет модели поддерживать временную ось для видео без тяжелых энкодеров.

Какие технологии используются для ускорения генерации ответов?

Модель применяет спекулятивное декодирование (MTP), где дополнительные слои выступают в роли «черновиков» и предсказывают несколько токенов сразу, сокращая время генерации и стоимость обработки длинных контекстов.

Почему Inkling предпочтительна для развертывания в корпоративной среде?

Открытые веса и поддержка фреймворков vLLM и SGLang позволяют компаниям запускать модель на собственной инфраструктуре, исключая зависимость от облачных провайдеров и обеспечивая полный контроль над данными.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме