Photoroom раскрыла стратегию данных для PRX: JPEG и длинные подписи вместо идеальной чистоты
Отказ от идеальной чистоты данных и использование сжатых JPEG-файлов сокращают затраты на хранение в разы без потери качества генерации. Переподпись изображений длинными текстовыми описаниями превращает логотипы и шум из артефактов в управляемые параметры, меняя подход к созданию обучающих выборок.
Команда Photoroom раскрыла детали построения обучающей выборки для текстово-генеративной модели PRX. Основной акцент сделан не на эстетическом отборе изображений, а на широте охвата визуальных концепций и детальности описаний. Вместо создания идеального набора с нуля, инженеры собрали данные из публичных и внутренних источников, перепрописали подписи к изображениям с помощью зрительной языковой модели (VLM) и подготовили поток для обучения. Ключевой вывод: качество генерации зависит от точности описания «шума» (логотипов, текста), который превращается в управляемый атрибут, а не в артефакт.
Важный нюанс: Для этапа предобучения критична широта данных, а не их безупречность. Отказ от жесткой фильтрации «некрасивых» снимков позволяет модели изучить структуру визуального мира, тогда как отбор по эстетике откладывается на этап дообучения.
Принципы формирования набора данных
Подход к сбору данных строится на прагматизме: использование уже отфильтрованных источников вместо повторной ручной проверки. Приоритет отдается разнообразию и покрытию тем, а не идеальной чистоте каждого кадра.
- Источники: Смесь публичных датасетов и внутренних архивов. Используются данные, уже прошедшие фильтрацию по контенту (NSFW) и дедупликацию.
- Философия подписей: Длинные и точные описания важнее коротких. Если подпись верно описывает логотип или текст на изображении, модель учится воспроизводить их по запросу, а не игнорировать.
- Форматы хранения:
- Lance: Используется для этапа сборки и анализа. Это колоночный формат, позволяющий быстро искать и фильтровать миллиарды строк без полного пересчета.
- Mosaic Data Shards (MDS): Финальный формат для обучения. Позволяет эффективно передавать данные с объектного хранилища (S3, GCS) прямо в процесс обучения.
Технические решения обработки изображений
Команда провела серию экспериментов, чтобы оптимизировать хранение и не потерять качество при сжатии.
Сжатие изображенийВсе изображения конвертируются в формат JPEG с качеством 92. Исследования показали, что повторное сжатие уже сжатых JPEG-файлов не вызывает заметной деградации.
| Разрешение | PSNR после 1 цикла (dB) | LPIPS после 1 цикла | PSNR после 10 циклов (dB) | LPIPS после 10 циклов |
|---|---|---|---|---|
| 1–2 Мп | 48.7 | 0.004 | 45.4 | 0.008 |
| 0.25–0.5 Мп | 45.1 | 0.005 | 42.2 | 0.010 |
- Вывод: Разница между обучением на PNG и JPEG (качество 92) статистически незначима. Генерации практически неотличимы, а размер файлов в формате PNG был бы в 3–10 раз больше без прироста качества.
- Исключение: Для специализированных задач, чувствительных к артефактам (например, модель теней), используется формат PNG.
Текстовые латентыВместо предвычисления текстовых эмбеддингов (как это делалось раньше с T5-Gemma) команда решила вычислять их «на лету» во время обучения с помощью модели Qwen3-VL.
- Затраты: Пропускная способность упала всего на 3–4%.
- Преимущества: Уменьшение размера хранилища и возможность быстро менять текстовый энкодер без пересчета терабайт данных.
Стоит учесть: Использование формата JPEG с высоким качеством позволяет сократить затраты на хранение и передачу данных в разы, не влияя на итоговое качество генерации модели.
Генерация подписей и выбор модели
Ключевым этапом стала переподпись всех изображений. Существующие подписи в исходных данных часто были слишком короткими или некорректными. Для создания единого стандарта использовалась зрительная языковая модель (VLM).
Сравнение моделей для генерации подписейТестирование проводилось на небольшой диффузионной модели. Оценивались метрики FID, CMMD и DINO-MMD (чем ниже, тем лучше).
| Модель подписчика | FID | CMMD | DINO-MMD |
|---|---|---|---|
| Qwen3.5-9B | 10.51 | 0.278 | 0.162 |
| Qwen3-VL-8B (выбор команды) | 10.98 | 0.351 | 0.182 |
| Qwen2.5-VL-7B (Relaxed) | 13.95 | 0.306 | 0.185 |
| Gemini 1.5 Flash | 13.46 | 0.316 | 0.234 |
| Qwen2.5-VL-7B (базовая) | 15.86 | 0.393 | 0.285 |
- Результат: Модель Qwen3.5-9B показала лучшие метрики, но была слишком медленной (~6.5 изображений в секунду) и требовала нестабильных версий зависимостей.
- Решение: Выбрана Qwen3-VL-8B. Она обеспечивает баланс между качеством (близким к лидеру) и скоростью (20 изображений в секунду на GPU H200), а также имеет стабильную поддержку в vLLM.
- Промпт: Модель генерирует один плотный абзац на 100–200 слов, описывающий объекты, цвета, композицию, освещение и текст на изображении без интерпретаций.
Фильтрация и дедупликация
После генерации подписей применялись фильтры, основанные на тексте, а не на пикселях. Это позволило быстро отсеять ненужный контент без тяжелого анализа изображений.
- Классификация: Модель Qwen3-8B (только текст) проверяла подписи на наличие текста (скриншоты, документы) или запрещенного контента (NSFW). Скорость обработки — около 200 подписей в секунду на GPU.
- Механизм исключения: Вместо удаления данных из файлов создается список пропусков (skip-list). Загрузчик данных игнорирует указанные индексы. Это позволяет гибко удалять данные (например, по запросу пользователя на удаление контента) без пересоздания всего датасета.
- Дедупликация: Использовались перцептивные хэши (на основе DCT). Удалялись точные копии и изображения, сильно похожие по пикселям (например, пересохраненные версии). Разные ракурсы одного объекта сохранялись.
- Итог фильтрации: Удалено несколько процентов дубликатов, несколько процентов текстовых изображений и малая доля NSFW-контента.
Операционные последствия и практические аспекты
Выбор формата и инфраструктуры
- Lance vs MDS: Использование Lance для этапа подготовки данных позволяет эффективно управлять фрагментами. Слишком мелкая фрагментация (много маленьких файлов) замедляет работу, поэтому рекомендуется компакция до 1 млн строк на фрагмент.
- Бакетинг (Bucketing): Изображения группируются по разрешению и соотношению сторон (13 вариантов от 0.5 до 2.0). Это позволяет избежать обрезки или добавления пустых полей, сохраняя оригинальную композицию и равномерно распределяя вычислительную нагрузку.
Экономия ресурсов
- Отказ от предвычисления латентов и использование JPEG вместо PNG значительно снижает требования к дисковому пространству и пропускной способности сети.
- Выбор модели Qwen3-VL-8B вместо более точной, но медленной Qwen3.5-9B демонстрирует приоритет практической скорости обработки миллионов изображений при минимальной потере качества.
На фоне этого: Стратегия «длинных подписей» позволяет модели обучаться на «шумных» данных, превращая потенциальные артефакты (текст, логотипы) в контролируемые параметры генерации, что снижает необходимость в идеальной чистоте исходного набора.
ПерспективыОписанный подход оптимизирован для этапа предобучения, где важна широта данных. Для последующих этапов (дообучение и выравнивание предпочтений) команда планирует переходить к жесткому отбору малых, высококачественных подмножеств данных. Код модели PRX доступен под лицензией Apache 2.0 на GitHub, а интеграция в библиотеку diffusers уже реализована.
Источник: huggingface.co