Thinking Machines Inkling: мультимодальная модель с 1 млн токенов и архитектурой MoE
Открытая мультимодальная модель Inkling от Thinking Machines бросает вызов закрытым лидерам, показывая в тестах по математике и программированию результаты, сопоставимые с топовыми проприетарными решениями. Бизнес получает шанс развернуть мощного ИИ-агента на собственной инфраструктуре, полностью контролируя данные и снижая зависимость от облачных провайдеров, хотя запуск полной версии потребует серьезных инвестиций в видеопамять.
Компания Thinking Machines выпустила открытую мультимодальную модель Inkling, способную одновременно обрабатывать текст, изображения и аудио. Модель насчитывает 975 млрд параметров в общей сложности, при этом в работе участвует 41 млрд благодаря архитектуре Mixture-of-Experts (MoE). Она поддерживает контекстное окно в 1 млн токенов и доступна на платформе Hugging Face в версиях с точностью BF16 и сжатой NVFP4.
Архитектура и технические особенности
Inkling построена на базе декодера с механизмом «смеси экспертов» (MoE), что позволяет ускорять вычисления, активируя лишь часть параметров. Вместо стандартного метода позиционного кодирования RoPE модель использует относительное внимание, обучаясь определять позицию токенов напрямую.
Ключевые элементы архитектуры:
- Гибридное внимание: Слои чередуются между глобальным вниманием (анализ всего контекста) и скользящим окном (локальный анализ) в соотношении 5:1. Это снижает вычислительную нагрузку при работе с длинными текстами.
- Короткая свертка (SConv): Специальный слой обрабатывает локальные зависимости, разгружая модули внимания и экспертов.
- Обработка мультимодальных данных:
- Изображения: Используются иерархические MLP-слои для сжатия пикселей в эмбеддинги. Поддерживается временная ось для видео.
- Аудио: Звуковая волна преобразуется в дискретный мел-спектрограмму (фрагменты по 100 мс), который классифицируется и превращается в вектор.
- Эксперты: В модели 256 экспертов. Роутер выбирает 6 лучших для каждого запроса, плюс 2 общих эксперта, которые работают постоянно.
Важный нюанс: Модель не использует отдельные тяжелые энкодеры для каждого типа данных, как многие аналоги, а применяет относительно простые модули-«башни» для преобразования входных данных, что упрощает архитектуру.
Производительность и требования к оборудованию
Запуск полной версии модели требует значительных ресурсов. Для версии с точностью BF16 необходимо 2 ТБ видеопамяти (VRAM). Сжатая версия NVFP4 снижает потребность до 600 ГБ VRAM. Для локального развертывания на ограниченном оборудовании доступны квантованные версии через llama.cpp (включая 1-битную версию от Unsloth), сокращающие потребление памяти на 95%.
Модель поддерживает ускорение генерации через механизм спекулятивного декодирования (MTP), где дополнительные слои предсказывают несколько токенов сразу, выступая в роли «черновиков».
Поддержка инфраструктуры развертывания:
- Transformers: Полная поддержка «из коробки» (версия 5.14.0 и выше).
- SGLang и vLLM: Оптимизированные фреймворки для продакшн-среды с распределением по нескольким GPU.
- Hugging Face Inference Providers: Доступ через облачные API с оплатой по факту использования.
Результаты тестирования и сравнение
В бенчмарках Inkling показывает высокие результаты в задачах логического вывода и программирования, часто превосходя закрытые аналоги. В таблице ниже приведены сравнительные данные по ключевым метрикам (значения в процентах, если не указано иное):
| Тестовая задача | Inkling | Nemotron 3 Ultra | Kimi K2.6 | DeepSeek V4 Pro | GPT 5.6 Sol (xhigh) |
|---|---|---|---|---|---|
| HLE (с инструментами) | 46.0% | 37.4% | 54.0% | 48.2% | 64.5% |
| AIME 2026 (математика) | 97.1% | 94.2% | 96.4% | 99.2% | 99.9% |
| GPQA Diamond (наука) | 87.2% | 86.7% | 91.1% | 88.8% | 94.1% |
| SWEBench Verified (код) | 77.6% | 70.7% | 80.2% | 80.6% | 95.0% |
| MCP Atlas (агент) | 74.1% | 44.7% | 68.1% | 73.2% | 83.3% |
| VoiceBench (аудио) | 91.4% | – | – | – | 94.3% |
В тестах на визуальное понимание (MMMU Pro) модель достигла 73.3%, а в задачах с аудио (BigBenchAudio) успешно справилась с логическими ловушками и подсчетом объектов.
Стоит учесть: На открытых вопросах без вариантов ответа модель тратит больше токенов и иногда ошибается, тогда как в тестах с выбором из нескольких вариантов (MCQA) ее точность значительно выше. Это указывает на важность правильной формулировки промптов для экономии ресурсов.
Операционные последствия и практическое применение
- Доступность для бизнеса: Наличие открытого веса и поддержка популярных фреймворков (vLLM, SGLang) позволяют компаниям развертывать модель на собственной инфраструктуре, избегая зависимости от облачных провайдеров и контроля над данными.
- Снижение затрат на инференс: Использование архитектуры MoE и спекулятивного декодирования (MTP) позволяет сократить время генерации и стоимость обработки длинных контекстов, что критично для задач анализа документов и транскрибации аудио.
- Риски развертывания: Полная версия модели требует специализированных серверов с огромным объемом видеопамяти (от 600 ГБ до 2 ТБ), что делает локальный запуск сложным для малого бизнеса без использования квантованных версий, которые могут терять в точности.
- Интеграция в агентов: Модель готова к работе в агентных сценариях (например, через инструмент Pi), выполняя сложные цепочки действий, включая использование внешних инструментов для решения математических и логических задач.
Важный нюанс: Модель демонстрирует высокую эффективность в задачах, где требуется перенос знаний между модальностями (например, анализ схемы на изображении и объяснение логики в тексте), что открывает возможности для создания новых классов приложений по обработке технической документации.
Источник: huggingface.co