Открытые мультимодальные модели
Открытые мультимодальные модели в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
OpenSenseNova/SenseNova-U1: Открытые мультимодальные модели представили архитектуру NEO-unify для прямой работы с пикселями
Компания SenseTime совместно с Национальным университетом Сингапура выпустила исходный код модели NEO-unify, которая отказывается от промежуточных визуальных энкодеров и обучается напрямую на пикселях и тексте. Открытые мультимодальные модели в этой реализации демонстрируют сопоставимое с лидерами рынка качество генерации изображений при использовании упрощенной архитектуры и меньшего объема обучающих данных. Релиз включает версию с 2 миллиардами параметров, прошедшую валидацию на наборе MS COCO 2017, и готовый к использованию репозиторий на GitHub.
Событие: Исходный код модели NEO-unify уже доступен в открытом репозитории OpenSenseNova/SenseNova-U1 на платформе GitHub.
Исследование: Версия модели с 2 миллиардами параметров показала метрику PSNR 31.56 и SSIM 0.85 на наборе данных MS COCO 2017, что сопоставимо с результатами Flux VAE.
Инсайт: Отказ от предобученных энкодеров позволяет системе самостоятельно формировать представления о мире, снижая риск искажения деталей на ранних этапах обработки.
Фактор: Прямая работа с «сырыми» данными делает качество входных пикселей критическим фактором, так как шум или артефакты в исходниках сильнее влияют на результат.
Анонс: В дорожной карте развития архитектуры запланировано внедрение омнимодального рассуждения и создание моделей мира для работы с любыми типами данных одновременно.
В нашей базе собрано 1 событие по теме «Открытые мультимодальные модели». Мы показываем все из них.