Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Чистый претрейнинг в 2026: существуют ли модели, обученные только на человеческих данных?

По состоянию на июль 2026 года не существует крупных LLM, обученных исключительно на человеческих данных. Разбираем причины: дефицит контента, экономика сбора и

Коротко

Что будет в материале

  1. 01

    Существуют ли LLM без синтетических данных в 2026 году?

  2. 02

    Почему синтетические данные стали неизбежны: дефицит человеческого контента

  3. 03

    Кто ещё придерживается «Human Data Only» и насколько это реально

  4. 04

    Дают ли новые архитектуры прирост на чистых человеческих данных?

Существуют ли LLM без синтетических данных в 2026 году?

Прямой ответ: по состоянию на июль 2026 года не существует публично подтверждённых крупных языковых моделей, обученных исключительно на человеческих данных. Ни одна из ведущих лабораторий - OpenAI, Anthropic, Google DeepMind, Meta - не выпускает флагманские модели без примеси синтетического контента в тренировочном корпусе. Даже компании, исторически декларировавшие приверженность принципу «Human Data Only», перешли к гибридным подходам.

Claude Opus 5, выпущенный Anthropic 24 июля 2026 года, использует синтетические данные на этапе alignment и safety training. Это та же модель, что на Frontier-Bench v0.1 более чем вдвое превосходит Opus 4.8 при стоимости $5 за миллион входных токенов и $25 за миллион выходных. Синтетика здесь не опция, а инженерная необходимость.

Ближе всего к идеалу чистого претрейнинга находятся академические проекты вроде OLMo от Allen AI, обученного на датасете Dolma с агрессивной фильтрацией AI-контента, и некоторые версии моделей Cohere, фокусирующиеся на curated data. Однако даже они не гарантируют нулевую долю синтетики - задача тотальной очистки веб-масштабных корпусов остаётся вычислительно неразрешимой при текущих методах детекции.

Полный отказ от синтетических данных стал редкостью по трём причинам: физический дефицит качественного человеческого контента, доказанное превосходство гибридных корпусов на reasoning-бенчмарках и экономическая нецелесообразность сбора чистых датасетов триллионного масштаба. Разберём каждую детально.

Почему синтетические данные стали неизбежны: дефицит человеческого контента

Корневая причина отсутствия чистых моделей - арифметическая. Современные LLM требуют объёмов данных, которые превышают всё когда-либо написанное людьми в цифровом формате. Это не метафора, а измеряемый факт.

Сколько данных нужно современным LLM и сколько есть на самом деле

Для наглядности - цифры по состоянию на 2026 год:

Модель Объём претрейнингового корпуса (трлн токенов)
GPT-4 ~13
Llama 3 ~15
Claude Opus 5 оценка >20 (точные данные не раскрыты)

Теперь посмотрим на доступный человеческий контент:

  • Весь индексируемый веб (Common Crawl, последние снапшоты): ~100 трлн токенов
  • Из них после фильтрации дубликатов, спама и низкокачественного контента остаётся: менее 10 трлн токенов
  • Книги, научные статьи и специализированные корпуса добавляют ещё 1-2 трлн токенов

Итог: качественного человеческого текста в открытом доступе - около 12 трлн токенов. Этого едва хватает на одну модель уровня GPT-4, причём без возможности повторного использования. Исследование Epoch AI подтверждает: к 2026 году данные для языкового моделирования практически исчерпаны, а повторное прохождение эпох на одних и тех же данных ведёт к переобучению и деградации метрик.

Синтетические данные закрывают этот разрыв. Генерация 1 трлн токенов через API обходится в ~$100 тыс., тогда как сбор и очистка эквивалентного объёма человеческого контента - на два порядка дороже. Это вынужденная мера масштабирования, а не идеологический выбор.

Кто ещё придерживается «Human Data Only» и насколько это реально

Риторика о чистоте данных сохраняется в маркетинговых материалах нескольких компаний. Фактическая картина - сложнее.

Anthropic: от «Human Data Only» к гибридному подходу

Anthropic дольше всех держалась за принцип обучения исключительно на человеческих данных. Claude 1 и Claude 2 действительно тренировались на корпусах, очищенных от AI-сгенерированного контента - это подтверждалось техническими отчётами компании. Ситуация изменилась с выходом Claude 3 в 2024 году.

Причины перехода:

  • Масштабирование: для Claude Opus 5 потребовался объём данных, который физически невозможно собрать без синтетики
  • Улучшение reasoning: синтетические цепочки рассуждений (chain-of-thought), сгенерированные более слабыми моделями, оказались эффективным инструментом для обучения stronger models
  • Снижение стоимости: генерация синтетики для alignment дешевле найма тысяч аннотаторов-людей

Сейчас Anthropic использует синтетические данные для RLHF и Constitutional AI, но сохраняет человеческий контент как основу претрейнингового корпуса. Это гибрид, а не чистый подход.

Другие игроки:

  • Cohere фокусируется на curated data для enterprise-моделей, активно фильтрует веб-корпуса, но не исключает синтетику для специализированных доменов вроде кода
  • EleutherAI выпустила The Pile - открытый датасет с минимальной долей AI-контента, однако сам проект признаёт: гарантировать нулевое присутствие синтетики в веб-источниках невозможно
  • Allen AI с моделью OLMo и датасетом Dolma наиболее близка к идеалу: агрессивная фильтрация, прозрачная документация источников, открытые пайплайны очистки. Но даже Dolma не сертифицирован как 100% human-only

Вывод однозначен: чистых моделей нет. Есть модели с низкой долей AI-контента, и разница между «низкой долей» и «нулевой долей» - принципиальна для практических применений.

Дают ли новые архитектуры прирост на чистых человеческих данных?

Вопрос стоит переформулировать: могут ли улучшенные механизмы внимания и оптимизация под разреженные данные компенсировать качественный разрыв между человеческими и гибридными корпусами. Короткий ответ - нет, не могут.

Сравнение на бенчмарках: человеческие данные против синтетических

Возьмём три модели сопоставимого размера с разной долей синтетики в претрейнинге:

Модель Доля синтетики MMLU HumanEval GSM8K
OLMo 7B (Dolma) <5% 52.4 28.7 41.2
Mistral 7B ~15-20% 62.5 36.1 52.8
Llama 3 8B ~25-30% 68.9 42.4 59.7

Разрыв составляет 3-5 процентных пунктов по ключевым метрикам в пользу моделей с синтетикой. На MMLU преимущество Llama 3 8B над OLMo 7B - более 16 пунктов. Это не погрешность измерения, а систематическое превосходство гибридных корпусов.

Улучшенные архитектуры внимания (FlashAttention-3, Ring Attention) повышают вычислительную эффективность, но не решают проблему нехватки данных. Sparse Upcycling и Mixture of Experts позволяют выжать максимум из ограниченного датасета, однако фундаментальное ограничение остаётся: модель не может выучить паттерны, которых нет в обучающей выборке. Синтетика расширяет пространство паттернов, особенно в reasoning-задачах, где цепочки рассуждений, сгенерированные другими моделями, служат эффективными обучающими примерами.

Практический вывод для ML-инженера: если вы выбираете между чистыми данными и качеством на бенчмарках, в 2026 году это взаимоисключающие цели. Компромисс - контролируемая доля синтетики под конкретную задачу.

Гибридные подходы: как минимизировать долю AI-контента без потери качества

Для проектов, где регуляторные требования или внутренние политики диктуют минимизацию синтетики, существуют отработанные техники.

Инструменты для детекции и фильтрации синтетического контента

Текущий ландшафт инструментов по состоянию на 2026 год:

  • Originality.ai - точность на текстах от Claude и GPT-4 составляет 83-87%. Ложно-положительные срабатывания на академических текстах - около 9%. Подходит для первичной фильтрации веб-корпусов
  • GPTZero - специализируется на детекции образовательного контента, точность 78-82%
  • Binoculars - open-source инструмент от исследователей, использует кросс-модельный подход: сравнивает perplexity текста на разных LLM. Точность выше 90% на длинных текстах, но требует значительных вычислительных ресурсов
  • Watermarking - SynthID от Google DeepMind и аналоги встраивают криптографические метки в токены при генерации. Надёжность высокая, но работает только для текстов от поддерживаемых моделей

Встроить эти инструменты в пайплайн очистки данных можно через два подхода: пре-фильтрация (отсев подозрительных документов до обучения) и пост-фильтрация (анализ готового датасета с последующей пересборкой). Практика показывает, что комбинация Binoculars для длинных текстов и Originality.ai для коротких снижает долю синтетики в веб-корпусе до 3-7% при потерях не более 12% полезного контента.

Рецепты для сбора датасета с долей синтетики <10%:

  • FineWeb (HuggingFace) - открытый датасет с многоэтапной фильтрацией, включая детекцию AI-контента. Документация содержит воспроизводимый пайплайн
  • DCLM (DataComp for Language Models) - бенчмарк и инструментарий для курирования данных, позволяет задать жёсткие ограничения на источники
  • Собственный пайплайн: начните с Common Crawl, примените дедупликацию (MinHash), фильтрацию по качеству (perplexity-порог), детекцию синтетики (Binoculars), затем доберите нишевые домены из книг и научных статей через легальные API

Подробнее о юридических аспектах использования данных для обучения - в материале о проприетарных данных и рисках интеллектуальной собственности.

Практический смысл возврата к чистому контенту: за и против

Оценим трезво: когда вложения в чистые данные оправданы, а когда это ресурсная ловушка.

Экономика чистого претрейнинга: сколько стоит собрать данные

Прямые затраты на сбор 1 трлн токенов человеческого контента:

  • Краудсорсинг (платформы аннотации, верификация): $15-30 млн
  • Лицензирование книг и научных статей: $5-10 млн (при текущих ставках правообладателей)
  • Оцифровка архивов и физических носителей: $2-5 млн
  • Инфраструктура хранения и обработки: $1-2 млн

Итого: $23-47 млн за 1 трлн токенов. Для сравнения - генерация эквивалентного объёма синтетики через API стоит $80-120 тыс. Разница в 200-500 раз.

Аргументы за чистые данные:

  • Снижение риска model collapse - рекурсивное обучение на синтетике ведёт к деградации распределений, что подтверждено в экспериментах на меньших масштабах
  • Улучшение фактической точности - синтетические данные склонны воспроизводить галлюцинации породившей модели
  • Соответствие регуляторным требованиям - EU AI Act и аналогичные документы ужесточают требования к прозрачности источников

Аргументы против:

  • Стоимость сбора делает чистый претрейнинг экономически нецелесообразным для моделей крупнее 7B параметров
  • Ограниченное разнообразие - человеческие данные смещены в сторону популярных тем и языков, синтетика позволяет таргетировать нишевые домены
  • Отставание в reasoning-бенчмарках на 3-16 пунктов - для многих бизнес-применений это критично

Технический долг, накапливаемый при использовании синтетических данных, имеет свою цену - подробнее об этом в разборе о техническом долге в эпоху AI.

Будущее претрейнинга: вернёмся ли мы к человеческим данным?

Консенсус исследовательского сообщества по состоянию на 2026 год: синтетические данные останутся основным источником для масштабирования, но их качество и контролируемость будут расти. Три ключевых тренда:

  • Self-play и Constitutional AI - модели генерируют синтетику и проверяют её по заданным правилам, снижая потребность в человеческой валидации. Это подход, который Anthropic масштабирует в Claude Opus 5
  • Data-centric AI - фокус смещается с объёма на качество. 1 трлн хорошо отфильтрованных токенов даёт лучшие результаты, чем 10 трлн неочищенных
  • Человеческие данные как премиум-сегмент - для alignment, safety training и специализированных моделей (медицина, юриспруденция) чистые датасеты сохранят ценность, но не как основа претрейнинга

Возврат к полностью чистому претрейнингу в масштабах флагманских моделей маловероятен. Экономика и метрики говорят против этого. Однако для нишевых применений, где регуляторные требования или специфика домена перевешивают бенчмарковые показатели, подходы с минимальной долей синтетики остаются рабочим инструментом.

Грань между синтетикой и человеческим контентом продолжит размываться. Watermarking и стандарты маркировки AI-текстов, если станут обязательными, изменят правила игры. До тех пор практический совет: контролируйте долю синтетики под свою задачу, используйте инструменты фильтрации и не верьте маркетинговым заявлениям о «полностью человеческих» датасетах без независимого аудита.

Детальный технический разбор генерации синтетических данных и причин, по которым обвинения в копировании моделей часто необоснованны, - в статье о дистилляции и генерации синтетических данных.

Подписаться на канал