Перейти к содержанию
Публикация AiManual

Open-image-preferences-v1: датасет 10K пар предпочтений для генерации изображений

Разбираем open-image-preferences-v1 от Data is Better Together: 10 000 пар предпочтений, реальные промпты Imgsys, категории Anime, Cinematic и Pixel art, сравне

Коротко

Что будет в материале

  1. 01

    Что представляет собой датасет open-image-preferences-v1

  2. 02

    Как собирали и очищали данные

  3. 03

    Какие промпты и категории представлены в open-image-preferences-v1

  4. 04

    Сравнение SD3.5-Large и FLUX.1-dev по категориям

open-image-preferences-v1 - открытый датасет сообщества Data is Better Together для обучения и оценки моделей генерации изображений. В него вошли 10 000 пар предпочтений: для каждого текстового запроса подготовлены результаты генерации от SD3.5-Large и FLUX.1-dev, чтобы их можно было сопоставлять по качеству.

Набор распространяется под лицензией Apache 2.0, размещен на Hugging Face Hub и сопровождается открытым кодом обработки. Промпты взяли из пользовательских запросов Imgsys, очистили от токсичного содержания, проверили вручную через Argilla и расширили синтетическими вариациями с помощью distilabel.

Практическая ценность датасета связана с preference learning. Такие данные подходят для обучения адаптеров и моделей, которые должны учитывать человеческие предпочтения, а не воспроизводить каждый пример по схеме обычного supervised fine-tuning. Авторы уже обучили LoRA-адаптер для FLUX-dev и сообщили об улучшении результатов в арт-категориях, хотя числовые метрики прироста в доступном описании не приведены.

Что представляет собой датасет open-image-preferences-v1

Одна запись в open-image-preferences-v1 связывает текстовый промпт с двумя изображениями, сгенерированными для одного запроса. Такая структура дает сигнал сравнения: модель или исследователь может определить, какой результат предпочтительнее для конкретной задачи.

Обычный набор для supervised fine-tuning связывает вход с целевым ответом, например промпт с одним изображением или описанием. Preference-датасет хранит альтернативы. Это позволяет изучать выбор между вариантами, обучать reward-модели и применять методы, которые используют пары предпочтительного и менее предпочтительного результата.

Что означает «пара предпочтений»

В контексте генерации изображений пара предпочтений означает два результата для одного текстового запроса. Их можно сопоставлять по соответствию промпту, композиции, стилю и общему визуальному качеству. Конкретная схема ранжирования и формат итоговой разметки должны проверяться по карточке датасета и коду обработки.

Важно не приписывать каждой паре больше информации, чем подтверждено описанием. Из доступных материалов следует, что набор предназначен для сравнения результатов. Подробности о том, кто и по каким критериям выбирал лучший вариант, требуют отдельной проверки перед обучением.

Почему открытый набор важен для локальных моделей

Открытые preference-данные снижают порог для экспериментов с image generation на собственном железе. Разработчик может скачать набор, изучить распределение промптов, повторить обработку и проверить, как меняется поведение базовой модели после дообучения.

Для локальных моделей это полезно в трех сценариях:

  • обучение LoRA-адаптеров под определенные визуальные предпочтения;
  • сравнение нескольких генераторов на одинаковых категориях промптов;
  • исследование SFT, DPO и ORPO для моделей генерации изображений.

Сам факт наличия 10 000 пар не гарантирует одинаковый результат у разных команд. Итог зависит от базовой модели, метода обучения, параметров, качества разметки и состава тренировочной выборки. Для production-задач потребуется собственная валидация.

Как собирали и очищали данные

Pipeline open-image-preferences-v1 включает несколько этапов: исходные пользовательские запросы из Imgsys, фильтрация токсичности, ручная проверка командой Argilla и расширение коллекции синтетическими вариациями через distilabel.

Реальные промпты из Imgsys

Основой набора стали реальные текстовые запросы пользователей, а не коллекция, собранная исключительно из заранее подготовленных шаблонов. Такой источник лучше отражает практическое разнообразие задач: пользователи формулируют запросы с разной точностью, длиной и сложностью.

У подхода есть и ограничение. Пользовательские промпты могут быть неоднородными, содержать неполные указания и по-разному описывать визуальный результат. Для обучения это полезный сигнал, но распределение запросов нужно изучить перед запуском эксперимента.

Фильтрация и ручная проверка через Argilla

Команда очистила запросы от токсичного содержания с помощью нескольких фильтров. После этого данные вручную проверила команда Argilla. Такой процесс уменьшает количество проблемных примеров, однако не доказывает полное отсутствие спорного или нежелательного содержания.

Публичное описание не раскрывает конкретные правила фильтрации, критерии принятия решений и долю записей, исключенных на каждом этапе. Поэтому качество модерации нельзя оценивать только по упоминанию фильтров и ручной проверки. Перед обучением стоит изучить код обработки и самостоятельно проверить случайную выборку.

Зачем добавили синтетические вариации через distilabel

distilabel использовали для расширения исходных запросов синтетическими вариациями. Это помогает увеличить разнообразие формулировок и визуальных задач, если исходный массив недостаточно равномерно покрывает нужные категории.

Синтетические примеры нельзя автоматически считать эквивалентными реальным пользовательским запросам. Их происхождение, стиль формулировок и возможные повторяющиеся шаблоны способны влиять на обучение. Поэтому при анализе нужно разделять реальные и синтетические части, если соответствующая информация доступна в структуре набора.

Какие промпты и категории представлены в open-image-preferences-v1

Датасет охватывает запросы разной сложности и визуального характера. В описании упомянуты повседневные сцены, стилизованные изображения и сложные композиционные задачи. Такой диапазон делает набор пригодным для категориального сравнения генераторов.

От повседневных сцен до сложных стилизаций

Простые бытовые запросы позволяют проверить базовое соответствие текста изображению. Стилизованные промпты добавляют требования к художественной манере, палитре и визуальному языку. Сложные композиции проверяют способность модели одновременно учитывать несколько объектов, отношения между ними и заданную атмосферу.

Для preference learning разнообразие задач полезно по одной причине: предпочтительный результат зависит от контекста. Модель, которая хорошо справляется с фотореалистичной сценой, может хуже следовать требованиям пиксельной графики или аниме. Средняя оценка по всей коллекции скрывает такие различия.

Cinematic, Anime и Pixel art как отдельные сценарии оценки

В наборе выделены категории Cinematic, Anime и Pixel art, а также другие типы визуальных задач. Их можно использовать для раздельного анализа результатов:

  • Cinematic проверяет работу с кинематографичной композицией, светом и атмосферой;
  • Anime и манга-сценарии показывают, насколько модель сохраняет характерную стилистику и детали персонажей;
  • Pixel art требует соблюдения специфической формы изображения, ограниченной детализации и узнаваемой пиксельной эстетики.

Победа модели в одной категории не означает общего превосходства. Для выбора генератора важнее сопоставить категории с собственными задачами и отдельно оценить их влияние на итоговый результат.

Чем набор отличается от Pick-a-Pic и GenAI-Arena

open-image-preferences-v1 отличается от Pick-a-Pic и GenAI-Arena заявленным акцентом на разнообразие сложности и тематических категорий промптов. В центре внимания находятся разные типы визуальных задач, а не один усредненный сценарий сравнения.

Это отличие полезно при исследовании специализированных моделей. Например, разработчику адаптера для аниме-изображений важнее результаты внутри Anime и Manga, чем общий показатель по смешанной коллекции. При этом доступные сведения не позволяют утверждать, что open-image-preferences-v1 универсально лучше аналогов по размеру, качеству разметки или полноте покрытия.

Подробное сравнение требует единой методики: одинаковых базовых моделей, сопоставимых категорий, прозрачного протокола оценки и одинаковой обработки изображений. Без этого сравнение названий датасетов останется поверхностным.

Сравнение SD3.5-Large и FLUX.1-dev по категориям

Для каждого промпта изображения генерировали две модели: SD3.5-Large и FLUX.1-dev. Это создает контролируемую основу для сравнения, поскольку текстовый запрос остается одинаковым, а меняется генератор.

Где лучше показал себя FLUX-dev

По приведенному анализу FLUX-dev чаще выигрывал в категориях Anime, Manga и 3D models. Такой результат интересен пользователям, которые работают со стилизованными персонажами, манга-эстетикой или трехмерными сценами.

Preference-пары можно использовать для следующего шага: обучения адаптера, который смещает поведение базовой модели в сторону более предпочтительных результатов. Однако сам набор не объясняет причину превосходства FLUX-dev в этих категориях. Она может быть связана с архитектурой, обучающими данными, особенностями промптов или критериями оценки.

Где лучше показал себя SD3.5-Large

SD3.5-Large лучше проявил себя в кинематографичных и арт-сценариях. Для практического выбора это означает, что базовую модель стоит подбирать под распределение целевых запросов.

Если рабочий pipeline ориентирован на cinematic-кадры и художественные сцены, преимущество в этих категориях может оказаться полезнее усредненного впечатления от модели. Универсального победителя по описанным результатам выбирать нельзя.

Что нельзя вывести из этого сравнения

В предоставленном описании отсутствуют подробные числовые метрики, размеры подвыборок по категориям и полный протокол оценки. Не указано, насколько устойчивы результаты при изменении seed, разрешения, параметров сэмплирования и состава промптов.

Поэтому сравнение SD3.5-Large и FLUX.1-dev стоит воспринимать как категориальный анализ конкретного набора. Он не заменяет независимый benchmark всех text-to-image моделей и не дает оснований ранжировать генераторы по одному общему показателю.

Проблема методологии знакома и для языковых моделей: аудит датасетов способен заметно менять итоговые рейтинги и точность. Подходы к проверке таких наборов разобраны в статье «Независимый аудит AI-бенчмарков».

LoRA для FLUX-dev и дальнейшее применение датасета

Авторы использовали open-image-preferences-v1 для обучения LoRA-адаптера под FLUX-dev. LoRA добавляет небольшое число обучаемых параметров поверх базовой модели, поэтому подходит для экспериментов, где полное переобучение слишком затратно.

Что дает LoRA-адаптер на preference-данных

Preference-данные позволяют сместить поведение модели к результатам, которые считаются более предпочтительными для заданных промптов. В случае с опубликованным экспериментом LoRA улучшила результаты FLUX-dev в арт-категориях.

Числовые показатели прироста, параметры обучения, размер адаптера и требования к видеопамяти в доступных материалах не указаны. Эти значения нельзя придумывать или переносить из других экспериментов. Перед повторением результата нужно изучить исходный код и описание адаптера.

LoRA полезна для локального тестирования, когда требуется быстро сравнить несколько вариантов поведения модели. Для production-сценария понадобится оценка на собственных промптах, проверка стабильности результата и контроль побочных изменений в других категориях.

SFT, DPO и ORPO как следующие эксперименты

Сообщество предлагает развивать датасет в нескольких направлениях:

  • SFT для SDXL, обучение на отобранных целевых примерах;
  • DPO, настройка модели с использованием предпочтительного и менее предпочтительного вариантов;
  • ORPO, альтернативный подход к обучению с учетом предпочтений;
  • оценка новых адаптеров и сравнение их результатов по категориям.

SFT лучше соответствует сценарию, где для каждого запроса есть надежный целевой результат. DPO и ORPO логичнее связывать с парами предпочтений, поскольку они используют информацию о сравнении вариантов. Предложения сообщества относятся к будущим экспериментам. Они не подтверждают заранее одинаковую эффективность методов для SDXL, FLUX-dev и других моделей.

О подходах Data Is Better Together, включая создание открытых датасетов и эксперименты с preference learning, можно прочитать в отдельном разборе инициативы Hugging Face и Argilla.

Кому стоит скачать датасет с Hugging Face Hub

Набор подойдет разработчикам и исследователям, которым нужны открытые данные для:

  • прототипов preference learning;
  • сравнения SD3.5-Large и FLUX.1-dev по визуальным категориям;
  • обучения и проверки LoRA-адаптеров;
  • экспериментов с SFT, DPO и ORPO;
  • изучения влияния синтетических вариаций на качество обучения.

Для production-задач потребуется проверить карточку датасета, код обработки, состав категорий, пропорции реальных и синтетических промптов, методику формирования предпочтений и условия применения. Лицензия Apache 2.0 упрощает изучение и использование набора, но лицензирование всего pipeline нужно проверять отдельно.

Ограничения и итоговая оценка open-image-preferences-v1

Сильные стороны датасета

  • 10 000 пар предпочтений для text-to-image задач;
  • реальные пользовательские запросы из Imgsys;
  • промпты разной сложности и тематические категории;
  • сравнение результатов SD3.5-Large и FLUX.1-dev на одинаковых запросах;
  • очистка от токсичного содержания и ручная проверка;
  • открытый код обработки;
  • лицензия Apache 2.0;
  • публикация на Hugging Face Hub;
  • первый эксперимент с LoRA для FLUX-dev.

Сочетание этих свойств делает open-image-preferences-v1 удобной базой для исследовательских прототипов. Особенно полезно наличие категорий, поскольку разработчик может анализировать сильные и слабые стороны моделей не по одной усредненной оценке.

Вопросы, которые нужно проверить перед обучением

Перед запуском обучения стоит выяснить несколько параметров:

  1. Как именно формировалась разметка предпочтений и кто выбирал лучший результат?
  2. Как распределены записи между реальными запросами и синтетическими вариациями?
  3. Каковы размеры подвыборок Anime, Manga, Cinematic, Pixel art и 3D models?
  4. Какие фильтры токсичности применялись и какие записи исключались?
  5. Как проходила ручная проверка через Argilla?
  6. Есть ли дубликаты промптов или близкие синтетические варианты в разных частях набора?
  7. Можно ли использовать изображения и производные адаптеры в конкретном коммерческом pipeline?

Эти вопросы влияют на воспроизводимость и переносимость результата. Лицензия датасета сама по себе не отвечает на все юридические и технические вопросы, связанные с моделями-генераторами и производными артефактами.

Главный вывод для практиков

open-image-preferences-v1 стоит изучать тем, кто работает с сигналами предпочтений в генерации изображений. Датасет объединяет 10 000 пар, реальные пользовательские промпты, категории Cinematic, Anime и Pixel art, сравнение SD3.5-Large с FLUX.1-dev и открытый код обработки.

Набор подходит для экспериментов с LoRA, SFT, DPO и ORPO, а его категориальная структура помогает оценивать модели под конкретные визуальные задачи. Универсальным рейтингом всех генераторов open-image-preferences-v1 считать нельзя: подробности разметки, состав подвыборок и метрики улучшения LoRA требуют самостоятельной проверки.

Подписаться на канал