Август 2026   |   В фокусе

SenseTime представила NEO-unify: прямая работа с пикселями снижает затраты на обучение

Модель NEO-unify от SenseTime отказалась от промежуточных этапов обработки и научилась работать напрямую с пикселями, что упрощает архитектуру и снижает затраты на обучение. Открытый код решения позволяет бизнесу быстрее внедрять мультимодальные системы без необходимости согласовывать сложные компоненты, но требует идеального качества исходных данных.

Компания SenseTime совместно с Национальным университетом Сингапура (NTU) представила новую архитектуру искусственного интеллекта под названием NEO-unify. Модель отказывается от привычных промежуточных этапов обработки изображений, таких как визуальные энкодеры и вариационные автоэнкодеры, и обучается напрямую на исходных данных — пикселях и словах. Это позволяет системе одновременно понимать смысл изображения и генерировать его с высокой детализацией без потери качества. По результатам тестов на наборе данных MS COCO 2017, версия модели с 2 миллиардами параметров показала показатели качества изображения, сопоставимые с ведущими решениями рынка, при этом демонстрируя более эффективное использование данных при обучении.

Ключевой момент: Отказ от предобученных энкодеров позволяет модели самостоятельно формировать представление о мире, что снижает риск искажения деталей на ранних этапах обработки и упрощает архитектуру системы.

Архитектура без промежуточных звеньев

Традиционные мультимодальные системы обычно разбивают процесс на этапы: сначала изображение преобразуется в абстрактный код, а затем этот код используется для генерации или анализа. NEO-unify меняет этот подход, создавая единый поток данных.

В основе модели лежит несколько ключевых решений:

  • Прямая работа с пикселями: Входные и выходные данные обрабатываются без потери информации, что исключает необходимость в сложных конвертерах.
  • Гибридная структура MoT: Используется смесь трансформеров (Mixture-of-Transformer), которая объединяет задачи понимания и генерации в одной архитектуре.
  • Единый механизм обучения: Для текста применяется стандартный метод автогрессивного прогнозирования, а для изображений — метод сопоставления потоков пикселей (pixel flow matching).

Такой подход устраняет необходимость в предобученных весах для энкодеров, которые часто ограничивают гибкость системы. Модель учится «с нуля», формируя собственные представления о визуальных данных.

Результаты тестирования и эффективность

Исследователи провели серию тестов, чтобы проверить, сможет ли модель без энкодеров справляться с задачами восстановления изображений и их редактирования.

Восстановление изображений:Модель NEO-unify (2B) после 90 тысяч шагов предварительного обучения достигла показателей:

  • 31.56 по метрике PSNR (пиковое отношение сигнал/шум).
  • 0.85 по метрике SSIM (структурное сходство).

Для сравнения, модель Flux VAE показала результаты 32.65 и 0.91 соответственно. Разрыв минимален, что подтверждает: прямая работа с пикселями не уступает традиционным методам в сохранении деталей.

Редактирование и адаптация:Даже при «замороженной» (необучаемой) части, отвечающей за понимание, генеративная ветвь модели успешно справлялась с редактированием изображений.

  • На наборе данных ImgEdit модель получила оценку 3.32 после 60 тысяч шагов смешанного обучения.
  • Система показала способность восстанавливать изображения из новых доменов и адаптироваться к небольшим объемам специализированных данных.

Важный нюанс: Высокая эффективность при малом объеме данных указывает на то, что архитектура может стать предпочтительной для задач, где сбор больших датасетов затруднен или дорог.

Масштабирование и планы по открытию кода

Одним из главных преимуществ NEO-unify является эффективность масштабирования. При обучении на веб-масштабных данных, а затем на этапах дообучения и тонкой настройки, модель показала лучшие результаты по сравнению с аналогом Bagel, достигая более высокого качества при меньшем количестве обученных токенов.

Компания планирует развивать направление, где модели не просто переводят информацию между форматами, а «мыслят» через них. В roadmap развития входят:

  • Циклы восприятия и генерации, чередующиеся в реальном времени.
  • Омнимодальное рассуждение (работа с любыми типами данных одновременно).
  • Пространственный интеллект и создание моделей мира.

Разработчики уже открыли исходный код модели. Доступ к ней можно получить на платформе GitHub в репозитории OpenSenseNova/SenseNova-U1. Также готовится подробный технический отчет, который будет опубликован в ближайшее время.

Операционные последствия и тренды

  • Снижение порога входа для обучения: Отказ от тяжелых предобученных энкодеров упрощает процесс дообучения моделей под специфические задачи бизнеса, так как не требуется согласование архитектур разных компонентов.
  • Экономия вычислительных ресурсов: Более эффективное использование данных при обучении может снизить затраты на инфраструктуру для компаний, внедряющих мультимодальные ИИ-решения.
  • Риск зависимости от качества данных: Поскольку модель обучается напрямую на «сырых» данных, качество входных пикселей и текста становится критическим фактором; шум или артефакты в исходниках могут сильнее влиять на результат, чем в системах с предварительной фильтрацией.
  • Новый вектор конкуренции: Появление открытых моделей с такой архитектурой может ускорить разработку специализированных решений в области компьютерного зрения, где важна детализация и отсутствие артефактов сжатия.

Коротко о главном

Какие результаты показала версия модели с 2 миллиардами параметров на тестовом наборе MS COCO 2017?

Версия NEO-unify (2B) достигла показателей качества, сопоставимых с ведущими рыночными решениями, демонстрируя при этом более эффективное использование данных за счет прямого формирования представлений о мире.

Какие метрики восстановления изображений достигла модель после 90 тысяч шагов обучения?

NEO-unify показала значение 31.56 по метрике PSNR и 0.85 по метрике SSIM, что минимизирует разрыв с моделью Flux VAE и подтверждает способность прямой работы с пикселями сохранять детали.

Как модель справляется с редактированием изображений при «замороженной» части понимания?

Генеративная ветвь успешно выполнила задачи на наборе данных ImgEdit, получив оценку 3.32 после 60 тысяч шагов смешанного обучения, что доказало способность адаптироваться к малым объемам специализированных данных.

В чем заключается преимущество масштабирования NEO-unify по сравнению с аналогом Bagel?

При обучении на веб-масштабных данных модель достигла более высокого качества при меньшем количестве обученных токенов, что свидетельствует о повышенной эффективности использования вычислительных ресурсов.

Где разработчики разместили исходный код модели для открытого доступа?

Код доступен в репозитории OpenSenseNova/SenseNova-U1 на платформе GitHub, что позволяет сообществу изучать архитектуру без промежуточных звеньев.

Какие риски возникают из-за отказа от предварительной фильтрации данных?

Поскольку модель обучается на «сырых» пикселях, качество входных данных становится критическим фактором, и наличие шума или артефактов в исходниках может сильнее влиять на результат, чем в системах с энкодерами.

Какие новые направления развития заложены в roadmap модели?

Планы включают реализацию циклов восприятия и генерации в реальном времени, омнимодальное рассуждение и создание моделей мира для пространственного интеллекта.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме