Перейти к содержанию
Публикация AiManual

Data Is Better Together: как сообщество Hugging Face и Argilla создаёт открытые датасеты для LLM

Разбираем инициативу Data Is Better Together: как сообщество собрало 10 000 ранжированных промптов, обучило модель SPIN и запустило мультиязычный проект MPEP. П

Коротко

Что будет в материале

  1. 01

    Что такое Data Is Better Together и зачем она нужна

  2. 02

    Ключевые результаты: датасет DIBT/10k_prompts_ranked

  3. 03

    От данных к моделям: SPIN и другие примеры использования

  4. 04

    Мультиязычный проект MPEP: расширение горизонтов

Что такое Data Is Better Together и зачем она нужна

Data Is Better Together - это совместная инициатива Hugging Face и Argilla, запущенная для коллективного создания качественных открытых датасетов силами сообщества. Проект стартовал несколько месяцев назад и уже дал конкретные результаты: собранные данные используются для обучения новых моделей, а выпущенные гайды помогают разработчикам самостоятельно готовить датасеты для разных задач.

Качественные данные - ключевой фактор для обучения LLM. Архитектура модели важна, но без репрезентативного и хорошо размеченного датасета даже сильная архитектура не даст полезного результата. Краудсорсинг решает проблему разнообразия: участники из разных доменов и языковых сред предлагают промпты, которые один разработчик или одна команда не смогли бы придумать. Data Is Better Together использует этот подход системно: сбор, ранжирование и публикация данных организованы как открытый процесс с понятными точками входа для вклада.

Для русскоязычного AI-сообщества инициатива интересна тем, что один из её проектов напрямую затрагивает проблему англоцентричности бенчмарков. Модели, которые показывают высокие результаты на английских тестах, часто деградируют на других языках. Data Is Better Together предлагает механизм исправления этого дисбаланса через перевод лучших промптов на десятки языков, включая русский.

Ключевые результаты: датасет DIBT/10k_prompts_ranked

Главный результат инициативы - датасет DIBT/10k_prompts_ranked, содержащий 10 000 промптов, собранных сообществом и ранжированных по качеству. Датасет открыт и доступен на Hugging Face. Название отражает суть: промпты не просто собраны, а прошли процедуру ранжирования, которая позволяет отличить сильные формулировки от слабых.

Как проходил сбор и ранжирование промптов

Процесс был открытым для всех желающих. Участники предлагали промпты, которые, по их мнению, полезны для обучения моделей. Затем сообщество оценивало эти промпты: ранжирование позволяло выделить наиболее качественные и репрезентативные примеры. Финальная фильтрация отсеивала дубликаты и низкокачественные формулировки, оставляя 10 000 проверенных промптов.

Такой подход даёт два преимущества. Первое: разнообразие источников обеспечивает покрытие разных тем и стилей запросов. Второе: ранжирование создаёт сигнал качества, который можно использовать при файнтюнинге. Модель учится не только на самих промптах, но и на информации о том, какие из них сообщество считает лучшими.

От данных к моделям: SPIN и другие примеры использования

Практическая ценность датасета подтверждена обучением модели SPIN. Эта модель построена на основе собранных промптов и демонстрирует, что краудсорсинговые данные пригодны для реальных задач файнтюнинга. SPIN - конкретный пример того, как открытый датасет превращается в работающую модель, а не остаётся архивом на Hugging Face.

Датасет DIBT/10k_prompts_ranked подходит для файнтюнинга разными методами. Ранжированные промпты полезны для supervised fine-tuning, а информация о качестве может использоваться при подготовке данных для обучения с предпочтениями, включая DPO, ORPO и KTO. Это расширяет область применения датасета за пределы одного конкретного кейса.

Если вам интересно, как датасеты Hugging Face интегрируются с инструментами обработки данных, разберите связку DuckDB и Hugging Face Hub: SQL-анализ 50 000+ датасетов без локального скачивания стал возможен благодаря автоматической конвертации в Parquet. Для тех, кто работает со Spark, полезна интеграция Databricks и Hugging Face, которая ускоряет создание датасетов из Spark DataFrame более чем на 40%.

Мультиязычный проект MPEP: расширение горизонтов

MPEP - отдельное направление Data Is Better Together. Проект переводит 500 лучших промптов из собранного датасета на десятки языков, включая русский и испанский. Цель - сформировать более репрезентативные бенчмарки для языков, которые не являются родными для английского.

Зачем нужны мультиязычные бенчмарки

Большинство популярных бенчмарков для LLM составлены на английском. Это создаёт систематическое искажение: модель может показывать завышенные результаты на английском и заниженные на других языках, даже если её реальные способности одинаковы. Проблема не в модели, а в тесте, который не отражает языковое разнообразие пользователей.

MPEP исправляет этот дисбаланс. Перевод 500 лучших промптов на русский, испанский и другие языки создаёт основу для оценки моделей в условиях, приближенных к реальному использованию неанглоязычными пользователями. Для русскоязычного AI-сообщества это особенно важно: модели часто оцениваются по английским тестам, а их поведение на русском остаётся малоизученным.

Вопрос качества бенчмарков стоит шире, чем только языковое разнообразие. Независимый аудит GPQA-Diamond, MMLU-Pro и MMMU-Pro выявил до 12% ошибок в этих тестах. После очистки точность топовых моделей выросла до 98%, что показывает, насколько сильно качество тестовых данных влияет на оценку.

Практические гайды для создания датасетов

Команда Data Is Better Together выпустила несколько практических гайдов. Они покрывают разные сценарии подготовки данных и ориентированы на разработчиков, которые хотят создавать собственные датасеты, а не только использовать готовые.

Гайд по доменным датасетам

Доменные датасеты специфичны для отрасли: медицина, финансы, юриспруденция, промышленность. Общие датасеты плохо покрывают такие области, потому что в них мало специализированной лексики и контекста. Гайд помогает собрать качественные данные для конкретной области: как определить нужные типы промптов, как организовать разметку, какие ошибки типичны при работе с доменными данными.

Гайды по DPO/ORPO и KTO

DPO, ORPO и KTO - методы обучения моделей с использованием предпочтений. Для них нужны не просто промпты, а пары ответов, где один ответ лучше другого. Подготовка таких данных сложнее, чем сбор одиночных промптов: нужно определить критерии предпочтения, организовать сравнение ответов и обеспечить согласованность разметки. Гайды описывают этот процесс пошагово и дают практические рекомендации по формированию пар предпочтений для каждого метода.

Если вы работаете с датасетами для обучения рассуждению, обратите внимание на разбор датасета SupraLabs/reasoning-corpus-4K-5M-v1 с 5 миллионами примеров цепочек рассуждений. А для задач instruction-tuning полезен материал о том, как научить Stable Diffusion выполнять точные инструкции через подготовку специализированных датасетов.

Как принять участие в инициативе

Участие в Data Is Better Together открыто для всех. Конкретные способы вклада зависят от ваших навыков и доступного времени.

Можно предлагать промпты для сбора. Это самый простой вход: вы формулируете запросы, которые считаете полезными для обучения моделей, и отправляете их через платформу. Можно участвовать в ранжировании: оценивать промпты других участников, помогая выделить лучшие. Можно подключиться к переводам MPEP: если вы носитель русского, испанского или другого языка из списка проекта, ваш вклад напрямую улучшает мультиязычные бенчмарки. Можно использовать гайды для создания собственных датасетов и публиковать их на Hugging Face, расширяя экосистему открытых данных.

Платформы для участия - Hugging Face и Argilla. Hugging Face предоставляет инфраструктуру для хранения и распространения датасетов, Argilla - инструменты для разметки и ранжирования. Обе платформы имеют активные сообщества, где можно найти текущие задачи и обсудить методологию.

Вопросы модерации и ответственности при работе с данными сообщества разобраны в статье о том, как модерация контента в AI-сообществах формирует ответственное развитие моделей. Принцип согласия на использование данных и защита идентичности - базовые требования, которые стоит учитывать при любом вкладе.

Влияние на сообщество и перспективы

Data Is Better Together показывает, что краудсорсинг датасетов - рабочий подход для создания качественных открытых данных. Проект прошёл путь от идеи до конкретных артефактов: датасет на 10 000 ранжированных промптов, модель SPIN, мультиязычный проект MPEP, набор практических гайдов. Это больше, чем эксперимент: это воспроизводимая схема, которую могут использовать другие инициативы.

Открытые данные способствуют воспроизводимости и инновациям. Когда датасет доступен, любой исследователь может проверить результаты, повторить обучение или использовать данные для своей задачи. Это снижает порог входа в разработку LLM и ускоряет обмен знаниями. Для русскоязычного сообщества такие инициативы особенно ценны: они создают основу для моделей, которые лучше работают с русским языком, а не только с английским.

Перспективы Data Is Better Together связаны с расширением языкового покрытия MPEP, добавлением новых типов данных и, вероятно, новыми раундами сбора промптов. Тренд на коллективное создание датасетов усиливается, и этот проект - один из самых заметных примеров того, как сообщество может влиять на качество данных, на которых обучаются модели.

Подписаться на канал