Существуют ли LLM без синтетических данных в 2026 году?
Прямой ответ: по состоянию на июль 2026 года не существует публично подтверждённых крупных языковых моделей, обученных исключительно на человеческих данных. Ни одна из ведущих лабораторий - OpenAI, Anthropic, Google DeepMind, Meta - не выпускает флагманские модели без примеси синтетического контента в тренировочном корпусе. Даже компании, исторически декларировавшие приверженность принципу «Human Data Only», перешли к гибридным подходам.
Claude Opus 5, выпущенный Anthropic 24 июля 2026 года, использует синтетические данные на этапе alignment и safety training. Это та же модель, что на Frontier-Bench v0.1 более чем вдвое превосходит Opus 4.8 при стоимости $5 за миллион входных токенов и $25 за миллион выходных. Синтетика здесь не опция, а инженерная необходимость.
Ближе всего к идеалу чистого претрейнинга находятся академические проекты вроде OLMo от Allen AI, обученного на датасете Dolma с агрессивной фильтрацией AI-контента, и некоторые версии моделей Cohere, фокусирующиеся на curated data. Однако даже они не гарантируют нулевую долю синтетики - задача тотальной очистки веб-масштабных корпусов остаётся вычислительно неразрешимой при текущих методах детекции.
Полный отказ от синтетических данных стал редкостью по трём причинам: физический дефицит качественного человеческого контента, доказанное превосходство гибридных корпусов на reasoning-бенчмарках и экономическая нецелесообразность сбора чистых датасетов триллионного масштаба. Разберём каждую детально.
Почему синтетические данные стали неизбежны: дефицит человеческого контента
Корневая причина отсутствия чистых моделей - арифметическая. Современные LLM требуют объёмов данных, которые превышают всё когда-либо написанное людьми в цифровом формате. Это не метафора, а измеряемый факт.
Сколько данных нужно современным LLM и сколько есть на самом деле
Для наглядности - цифры по состоянию на 2026 год:
| Модель | Объём претрейнингового корпуса (трлн токенов) |
|---|---|
| GPT-4 | ~13 |
| Llama 3 | ~15 |
| Claude Opus 5 | оценка >20 (точные данные не раскрыты) |
Теперь посмотрим на доступный человеческий контент:
- Весь индексируемый веб (Common Crawl, последние снапшоты): ~100 трлн токенов
- Из них после фильтрации дубликатов, спама и низкокачественного контента остаётся: менее 10 трлн токенов
- Книги, научные статьи и специализированные корпуса добавляют ещё 1-2 трлн токенов
Итог: качественного человеческого текста в открытом доступе - около 12 трлн токенов. Этого едва хватает на одну модель уровня GPT-4, причём без возможности повторного использования. Исследование Epoch AI подтверждает: к 2026 году данные для языкового моделирования практически исчерпаны, а повторное прохождение эпох на одних и тех же данных ведёт к переобучению и деградации метрик.
Синтетические данные закрывают этот разрыв. Генерация 1 трлн токенов через API обходится в ~$100 тыс., тогда как сбор и очистка эквивалентного объёма человеческого контента - на два порядка дороже. Это вынужденная мера масштабирования, а не идеологический выбор.
Кто ещё придерживается «Human Data Only» и насколько это реально
Риторика о чистоте данных сохраняется в маркетинговых материалах нескольких компаний. Фактическая картина - сложнее.
Anthropic: от «Human Data Only» к гибридному подходу
Anthropic дольше всех держалась за принцип обучения исключительно на человеческих данных. Claude 1 и Claude 2 действительно тренировались на корпусах, очищенных от AI-сгенерированного контента - это подтверждалось техническими отчётами компании. Ситуация изменилась с выходом Claude 3 в 2024 году.
Причины перехода:
- Масштабирование: для Claude Opus 5 потребовался объём данных, который физически невозможно собрать без синтетики
- Улучшение reasoning: синтетические цепочки рассуждений (chain-of-thought), сгенерированные более слабыми моделями, оказались эффективным инструментом для обучения stronger models
- Снижение стоимости: генерация синтетики для alignment дешевле найма тысяч аннотаторов-людей
Сейчас Anthropic использует синтетические данные для RLHF и Constitutional AI, но сохраняет человеческий контент как основу претрейнингового корпуса. Это гибрид, а не чистый подход.
Другие игроки:
- Cohere фокусируется на curated data для enterprise-моделей, активно фильтрует веб-корпуса, но не исключает синтетику для специализированных доменов вроде кода
- EleutherAI выпустила The Pile - открытый датасет с минимальной долей AI-контента, однако сам проект признаёт: гарантировать нулевое присутствие синтетики в веб-источниках невозможно
- Allen AI с моделью OLMo и датасетом Dolma наиболее близка к идеалу: агрессивная фильтрация, прозрачная документация источников, открытые пайплайны очистки. Но даже Dolma не сертифицирован как 100% human-only
Вывод однозначен: чистых моделей нет. Есть модели с низкой долей AI-контента, и разница между «низкой долей» и «нулевой долей» - принципиальна для практических применений.
Дают ли новые архитектуры прирост на чистых человеческих данных?
Вопрос стоит переформулировать: могут ли улучшенные механизмы внимания и оптимизация под разреженные данные компенсировать качественный разрыв между человеческими и гибридными корпусами. Короткий ответ - нет, не могут.
Сравнение на бенчмарках: человеческие данные против синтетических
Возьмём три модели сопоставимого размера с разной долей синтетики в претрейнинге:
| Модель | Доля синтетики | MMLU | HumanEval | GSM8K |
|---|---|---|---|---|
| OLMo 7B (Dolma) | <5% | 52.4 | 28.7 | 41.2 |
| Mistral 7B | ~15-20% | 62.5 | 36.1 | 52.8 |
| Llama 3 8B | ~25-30% | 68.9 | 42.4 | 59.7 |
Разрыв составляет 3-5 процентных пунктов по ключевым метрикам в пользу моделей с синтетикой. На MMLU преимущество Llama 3 8B над OLMo 7B - более 16 пунктов. Это не погрешность измерения, а систематическое превосходство гибридных корпусов.
Улучшенные архитектуры внимания (FlashAttention-3, Ring Attention) повышают вычислительную эффективность, но не решают проблему нехватки данных. Sparse Upcycling и Mixture of Experts позволяют выжать максимум из ограниченного датасета, однако фундаментальное ограничение остаётся: модель не может выучить паттерны, которых нет в обучающей выборке. Синтетика расширяет пространство паттернов, особенно в reasoning-задачах, где цепочки рассуждений, сгенерированные другими моделями, служат эффективными обучающими примерами.
Практический вывод для ML-инженера: если вы выбираете между чистыми данными и качеством на бенчмарках, в 2026 году это взаимоисключающие цели. Компромисс - контролируемая доля синтетики под конкретную задачу.
Гибридные подходы: как минимизировать долю AI-контента без потери качества
Для проектов, где регуляторные требования или внутренние политики диктуют минимизацию синтетики, существуют отработанные техники.
Инструменты для детекции и фильтрации синтетического контента
Текущий ландшафт инструментов по состоянию на 2026 год:
- Originality.ai - точность на текстах от Claude и GPT-4 составляет 83-87%. Ложно-положительные срабатывания на академических текстах - около 9%. Подходит для первичной фильтрации веб-корпусов
- GPTZero - специализируется на детекции образовательного контента, точность 78-82%
- Binoculars - open-source инструмент от исследователей, использует кросс-модельный подход: сравнивает perplexity текста на разных LLM. Точность выше 90% на длинных текстах, но требует значительных вычислительных ресурсов
- Watermarking - SynthID от Google DeepMind и аналоги встраивают криптографические метки в токены при генерации. Надёжность высокая, но работает только для текстов от поддерживаемых моделей
Встроить эти инструменты в пайплайн очистки данных можно через два подхода: пре-фильтрация (отсев подозрительных документов до обучения) и пост-фильтрация (анализ готового датасета с последующей пересборкой). Практика показывает, что комбинация Binoculars для длинных текстов и Originality.ai для коротких снижает долю синтетики в веб-корпусе до 3-7% при потерях не более 12% полезного контента.
Рецепты для сбора датасета с долей синтетики <10%:
- FineWeb (HuggingFace) - открытый датасет с многоэтапной фильтрацией, включая детекцию AI-контента. Документация содержит воспроизводимый пайплайн
- DCLM (DataComp for Language Models) - бенчмарк и инструментарий для курирования данных, позволяет задать жёсткие ограничения на источники
- Собственный пайплайн: начните с Common Crawl, примените дедупликацию (MinHash), фильтрацию по качеству (perplexity-порог), детекцию синтетики (Binoculars), затем доберите нишевые домены из книг и научных статей через легальные API
Подробнее о юридических аспектах использования данных для обучения - в материале о проприетарных данных и рисках интеллектуальной собственности.
Практический смысл возврата к чистому контенту: за и против
Оценим трезво: когда вложения в чистые данные оправданы, а когда это ресурсная ловушка.
Экономика чистого претрейнинга: сколько стоит собрать данные
Прямые затраты на сбор 1 трлн токенов человеческого контента:
- Краудсорсинг (платформы аннотации, верификация): $15-30 млн
- Лицензирование книг и научных статей: $5-10 млн (при текущих ставках правообладателей)
- Оцифровка архивов и физических носителей: $2-5 млн
- Инфраструктура хранения и обработки: $1-2 млн
Итого: $23-47 млн за 1 трлн токенов. Для сравнения - генерация эквивалентного объёма синтетики через API стоит $80-120 тыс. Разница в 200-500 раз.
Аргументы за чистые данные:
- Снижение риска model collapse - рекурсивное обучение на синтетике ведёт к деградации распределений, что подтверждено в экспериментах на меньших масштабах
- Улучшение фактической точности - синтетические данные склонны воспроизводить галлюцинации породившей модели
- Соответствие регуляторным требованиям - EU AI Act и аналогичные документы ужесточают требования к прозрачности источников
Аргументы против:
- Стоимость сбора делает чистый претрейнинг экономически нецелесообразным для моделей крупнее 7B параметров
- Ограниченное разнообразие - человеческие данные смещены в сторону популярных тем и языков, синтетика позволяет таргетировать нишевые домены
- Отставание в reasoning-бенчмарках на 3-16 пунктов - для многих бизнес-применений это критично
Технический долг, накапливаемый при использовании синтетических данных, имеет свою цену - подробнее об этом в разборе о техническом долге в эпоху AI.
Будущее претрейнинга: вернёмся ли мы к человеческим данным?
Консенсус исследовательского сообщества по состоянию на 2026 год: синтетические данные останутся основным источником для масштабирования, но их качество и контролируемость будут расти. Три ключевых тренда:
- Self-play и Constitutional AI - модели генерируют синтетику и проверяют её по заданным правилам, снижая потребность в человеческой валидации. Это подход, который Anthropic масштабирует в Claude Opus 5
- Data-centric AI - фокус смещается с объёма на качество. 1 трлн хорошо отфильтрованных токенов даёт лучшие результаты, чем 10 трлн неочищенных
- Человеческие данные как премиум-сегмент - для alignment, safety training и специализированных моделей (медицина, юриспруденция) чистые датасеты сохранят ценность, но не как основа претрейнинга
Возврат к полностью чистому претрейнингу в масштабах флагманских моделей маловероятен. Экономика и метрики говорят против этого. Однако для нишевых применений, где регуляторные требования или специфика домена перевешивают бенчмарковые показатели, подходы с минимальной долей синтетики остаются рабочим инструментом.
Грань между синтетикой и человеческим контентом продолжит размываться. Watermarking и стандарты маркировки AI-текстов, если станут обязательными, изменят правила игры. До тех пор практический совет: контролируйте долю синтетики под свою задачу, используйте инструменты фильтрации и не верьте маркетинговым заявлениям о «полностью человеческих» датасетах без независимого аудита.
Детальный технический разбор генерации синтетических данных и причин, по которым обвинения в копировании моделей часто необоснованны, - в статье о дистилляции и генерации синтетических данных.