SenseTime представила NEO-unify: прямая работа с пикселями снижает затраты на обучение
Модель NEO-unify от SenseTime отказалась от промежуточных этапов обработки и научилась работать напрямую с пикселями, что упрощает архитектуру и снижает затраты на обучение. Открытый код решения позволяет бизнесу быстрее внедрять мультимодальные системы без необходимости согласовывать сложные компоненты, но требует идеального качества исходных данных.
Компания SenseTime совместно с Национальным университетом Сингапура (NTU) представила новую архитектуру искусственного интеллекта под названием NEO-unify. Модель отказывается от привычных промежуточных этапов обработки изображений, таких как визуальные энкодеры и вариационные автоэнкодеры, и обучается напрямую на исходных данных — пикселях и словах. Это позволяет системе одновременно понимать смысл изображения и генерировать его с высокой детализацией без потери качества. По результатам тестов на наборе данных MS COCO 2017, версия модели с 2 миллиардами параметров показала показатели качества изображения, сопоставимые с ведущими решениями рынка, при этом демонстрируя более эффективное использование данных при обучении.
Ключевой момент: Отказ от предобученных энкодеров позволяет модели самостоятельно формировать представление о мире, что снижает риск искажения деталей на ранних этапах обработки и упрощает архитектуру системы.
Архитектура без промежуточных звеньев
Традиционные мультимодальные системы обычно разбивают процесс на этапы: сначала изображение преобразуется в абстрактный код, а затем этот код используется для генерации или анализа. NEO-unify меняет этот подход, создавая единый поток данных.
В основе модели лежит несколько ключевых решений:
- Прямая работа с пикселями: Входные и выходные данные обрабатываются без потери информации, что исключает необходимость в сложных конвертерах.
- Гибридная структура MoT: Используется смесь трансформеров (Mixture-of-Transformer), которая объединяет задачи понимания и генерации в одной архитектуре.
- Единый механизм обучения: Для текста применяется стандартный метод автогрессивного прогнозирования, а для изображений — метод сопоставления потоков пикселей (pixel flow matching).
Такой подход устраняет необходимость в предобученных весах для энкодеров, которые часто ограничивают гибкость системы. Модель учится «с нуля», формируя собственные представления о визуальных данных.
Результаты тестирования и эффективность
Исследователи провели серию тестов, чтобы проверить, сможет ли модель без энкодеров справляться с задачами восстановления изображений и их редактирования.
Восстановление изображений:Модель NEO-unify (2B) после 90 тысяч шагов предварительного обучения достигла показателей:
- 31.56 по метрике PSNR (пиковое отношение сигнал/шум).
- 0.85 по метрике SSIM (структурное сходство).
Для сравнения, модель Flux VAE показала результаты 32.65 и 0.91 соответственно. Разрыв минимален, что подтверждает: прямая работа с пикселями не уступает традиционным методам в сохранении деталей.
Редактирование и адаптация:Даже при «замороженной» (необучаемой) части, отвечающей за понимание, генеративная ветвь модели успешно справлялась с редактированием изображений.
- На наборе данных ImgEdit модель получила оценку 3.32 после 60 тысяч шагов смешанного обучения.
- Система показала способность восстанавливать изображения из новых доменов и адаптироваться к небольшим объемам специализированных данных.
Важный нюанс: Высокая эффективность при малом объеме данных указывает на то, что архитектура может стать предпочтительной для задач, где сбор больших датасетов затруднен или дорог.
Масштабирование и планы по открытию кода
Одним из главных преимуществ NEO-unify является эффективность масштабирования. При обучении на веб-масштабных данных, а затем на этапах дообучения и тонкой настройки, модель показала лучшие результаты по сравнению с аналогом Bagel, достигая более высокого качества при меньшем количестве обученных токенов.
Компания планирует развивать направление, где модели не просто переводят информацию между форматами, а «мыслят» через них. В roadmap развития входят:
- Циклы восприятия и генерации, чередующиеся в реальном времени.
- Омнимодальное рассуждение (работа с любыми типами данных одновременно).
- Пространственный интеллект и создание моделей мира.
Разработчики уже открыли исходный код модели. Доступ к ней можно получить на платформе GitHub в репозитории OpenSenseNova/SenseNova-U1. Также готовится подробный технический отчет, который будет опубликован в ближайшее время.
Операционные последствия и тренды
- Снижение порога входа для обучения: Отказ от тяжелых предобученных энкодеров упрощает процесс дообучения моделей под специфические задачи бизнеса, так как не требуется согласование архитектур разных компонентов.
- Экономия вычислительных ресурсов: Более эффективное использование данных при обучении может снизить затраты на инфраструктуру для компаний, внедряющих мультимодальные ИИ-решения.
- Риск зависимости от качества данных: Поскольку модель обучается напрямую на «сырых» данных, качество входных пикселей и текста становится критическим фактором; шум или артефакты в исходниках могут сильнее влиять на результат, чем в системах с предварительной фильтрацией.
- Новый вектор конкуренции: Появление открытых моделей с такой архитектурой может ускорить разработку специализированных решений в области компьютерного зрения, где важна детализация и отсутствие артефактов сжатия.
Источник: huggingface.co