Июль 2026   |   В фокусе

Photoroom раскрыла стратегию данных для PRX: JPEG и длинные подписи вместо идеальной чистоты

Отказ от идеальной чистоты данных и использование сжатых JPEG-файлов сокращают затраты на хранение в разы без потери качества генерации. Переподпись изображений длинными текстовыми описаниями превращает логотипы и шум из артефактов в управляемые параметры, меняя подход к созданию обучающих выборок.

Команда Photoroom раскрыла детали построения обучающей выборки для текстово-генеративной модели PRX. Основной акцент сделан не на эстетическом отборе изображений, а на широте охвата визуальных концепций и детальности описаний. Вместо создания идеального набора с нуля, инженеры собрали данные из публичных и внутренних источников, перепрописали подписи к изображениям с помощью зрительной языковой модели (VLM) и подготовили поток для обучения. Ключевой вывод: качество генерации зависит от точности описания «шума» (логотипов, текста), который превращается в управляемый атрибут, а не в артефакт.

Важный нюанс: Для этапа предобучения критична широта данных, а не их безупречность. Отказ от жесткой фильтрации «некрасивых» снимков позволяет модели изучить структуру визуального мира, тогда как отбор по эстетике откладывается на этап дообучения.

Принципы формирования набора данных

Подход к сбору данных строится на прагматизме: использование уже отфильтрованных источников вместо повторной ручной проверки. Приоритет отдается разнообразию и покрытию тем, а не идеальной чистоте каждого кадра.

  • Источники: Смесь публичных датасетов и внутренних архивов. Используются данные, уже прошедшие фильтрацию по контенту (NSFW) и дедупликацию.
  • Философия подписей: Длинные и точные описания важнее коротких. Если подпись верно описывает логотип или текст на изображении, модель учится воспроизводить их по запросу, а не игнорировать.
  • Форматы хранения:
    • Lance: Используется для этапа сборки и анализа. Это колоночный формат, позволяющий быстро искать и фильтровать миллиарды строк без полного пересчета.
    • Mosaic Data Shards (MDS): Финальный формат для обучения. Позволяет эффективно передавать данные с объектного хранилища (S3, GCS) прямо в процесс обучения.

Технические решения обработки изображений

Команда провела серию экспериментов, чтобы оптимизировать хранение и не потерять качество при сжатии.

Сжатие изображенийВсе изображения конвертируются в формат JPEG с качеством 92. Исследования показали, что повторное сжатие уже сжатых JPEG-файлов не вызывает заметной деградации.

РазрешениеPSNR после 1 цикла (dB)LPIPS после 1 циклаPSNR после 10 циклов (dB)LPIPS после 10 циклов
1–2 Мп48.70.00445.40.008
0.25–0.5 Мп45.10.00542.20.010
  • Вывод: Разница между обучением на PNG и JPEG (качество 92) статистически незначима. Генерации практически неотличимы, а размер файлов в формате PNG был бы в 3–10 раз больше без прироста качества.
  • Исключение: Для специализированных задач, чувствительных к артефактам (например, модель теней), используется формат PNG.

Текстовые латентыВместо предвычисления текстовых эмбеддингов (как это делалось раньше с T5-Gemma) команда решила вычислять их «на лету» во время обучения с помощью модели Qwen3-VL.

  • Затраты: Пропускная способность упала всего на 3–4%.
  • Преимущества: Уменьшение размера хранилища и возможность быстро менять текстовый энкодер без пересчета терабайт данных.

Стоит учесть: Использование формата JPEG с высоким качеством позволяет сократить затраты на хранение и передачу данных в разы, не влияя на итоговое качество генерации модели.

Генерация подписей и выбор модели

Ключевым этапом стала переподпись всех изображений. Существующие подписи в исходных данных часто были слишком короткими или некорректными. Для создания единого стандарта использовалась зрительная языковая модель (VLM).

Сравнение моделей для генерации подписейТестирование проводилось на небольшой диффузионной модели. Оценивались метрики FID, CMMD и DINO-MMD (чем ниже, тем лучше).

Модель подписчикаFIDCMMDDINO-MMD
Qwen3.5-9B10.510.2780.162
Qwen3-VL-8B (выбор команды)10.980.3510.182
Qwen2.5-VL-7B (Relaxed)13.950.3060.185
Gemini 1.5 Flash13.460.3160.234
Qwen2.5-VL-7B (базовая)15.860.3930.285
  • Результат: Модель Qwen3.5-9B показала лучшие метрики, но была слишком медленной (~6.5 изображений в секунду) и требовала нестабильных версий зависимостей.
  • Решение: Выбрана Qwen3-VL-8B. Она обеспечивает баланс между качеством (близким к лидеру) и скоростью (20 изображений в секунду на GPU H200), а также имеет стабильную поддержку в vLLM.
  • Промпт: Модель генерирует один плотный абзац на 100–200 слов, описывающий объекты, цвета, композицию, освещение и текст на изображении без интерпретаций.

Фильтрация и дедупликация

После генерации подписей применялись фильтры, основанные на тексте, а не на пикселях. Это позволило быстро отсеять ненужный контент без тяжелого анализа изображений.

  • Классификация: Модель Qwen3-8B (только текст) проверяла подписи на наличие текста (скриншоты, документы) или запрещенного контента (NSFW). Скорость обработки — около 200 подписей в секунду на GPU.
  • Механизм исключения: Вместо удаления данных из файлов создается список пропусков (skip-list). Загрузчик данных игнорирует указанные индексы. Это позволяет гибко удалять данные (например, по запросу пользователя на удаление контента) без пересоздания всего датасета.
  • Дедупликация: Использовались перцептивные хэши (на основе DCT). Удалялись точные копии и изображения, сильно похожие по пикселям (например, пересохраненные версии). Разные ракурсы одного объекта сохранялись.
  • Итог фильтрации: Удалено несколько процентов дубликатов, несколько процентов текстовых изображений и малая доля NSFW-контента.

Операционные последствия и практические аспекты

Выбор формата и инфраструктуры

  • Lance vs MDS: Использование Lance для этапа подготовки данных позволяет эффективно управлять фрагментами. Слишком мелкая фрагментация (много маленьких файлов) замедляет работу, поэтому рекомендуется компакция до 1 млн строк на фрагмент.
  • Бакетинг (Bucketing): Изображения группируются по разрешению и соотношению сторон (13 вариантов от 0.5 до 2.0). Это позволяет избежать обрезки или добавления пустых полей, сохраняя оригинальную композицию и равномерно распределяя вычислительную нагрузку.

Экономия ресурсов

  • Отказ от предвычисления латентов и использование JPEG вместо PNG значительно снижает требования к дисковому пространству и пропускной способности сети.
  • Выбор модели Qwen3-VL-8B вместо более точной, но медленной Qwen3.5-9B демонстрирует приоритет практической скорости обработки миллионов изображений при минимальной потере качества.

На фоне этого: Стратегия «длинных подписей» позволяет модели обучаться на «шумных» данных, превращая потенциальные артефакты (текст, логотипы) в контролируемые параметры генерации, что снижает необходимость в идеальной чистоте исходного набора.

ПерспективыОписанный подход оптимизирован для этапа предобучения, где важна широта данных. Для последующих этапов (дообучение и выравнивание предпочтений) команда планирует переходить к жесткому отбору малых, высококачественных подмножеств данных. Код модели PRX доступен под лицензией Apache 2.0 на GitHub, а интеграция в библиотеку diffusers уже реализована.

Коротко о главном

Почему для хранения обучающих изображений был выбран формат JPEG с качеством 92 вместо PNG?

Исследования показали, что разница в качестве генерации между этими форматами статистически незначима, что позволило сократить объем хранилища и затраты на передачу данных в 3–10 раз. Исключение сделано только для специализированных задач, чувствительных к артефактам сжатия, где сохраняется использование PNG.

Какая модель была выбрана для генерации подписей и почему?

Команда остановилась на модели Qwen3-VL-8B, так как она обеспечила баланс между качеством метрик и скоростью обработки в 20 изображений в секунду на GPU H200. Более точная модель Qwen3.5-9B была отвергнута из-за низкой скорости (~6.5 изображений в секунду) и нестабильности зависимостей.

Как изменился подход к вычислению текстовых эмбеддингов во время обучения?

Вместо предвычисления эмбеддингов команда перешла к их расчету «на лету» с помощью модели Qwen3-VL, что уменьшило требования к дисковому пространству и позволило менять текстовый энкодер без пересчета терабайт данных. Этот метод привел к падению пропускной способности всего на 3–4%, сохранив гибкость инфраструктуры.

Какой механизм используется для фильтрации контента без полного пересоздания датасета?

Вместо физического удаления файлов применяется список пропусков (skip-list), который позволяет загрузчику данных игнорировать определенные индексы. Это решение обеспечивает гибкое удаление контента по запросу или по результатам текстовой классификации без необходимости пересборки всего набора данных.

Зачем изображения группируются по разрешению и соотношению сторон (бакетинг)?

Группировка в 13 вариантов от 0.5 до 2.0 позволяет избежать обрезки кадров или добавления пустых полей, сохраняя оригинальную композицию объектов. Это также способствует равномерному распределению вычислительной нагрузки в процессе обучения модели.

Какие форматы хранения данных применяются на разных этапах подготовки?

Для этапа сборки и анализа используется колоночный формат Lance, позволяющий быстро фильтровать миллиарды строк, а для финального обучения — Mosaic Data Shards (MDS). Выбор MDS обусловлен необходимостью эффективной передачи данных непосредственно из объектных хранилищ в процесс обучения.

Каковы условия доступности кода модели PRX для разработчиков?

Исходный код модели опубликован на GitHub под лицензией Apache 2.0, что позволяет свободно использовать и модифицировать его. Кроме того, уже реализована интеграция модели в популярную библиотеку diffusers для упрощения внедрения.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии

Материалы по теме