Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Дистилляция vs генерация синтетических данных: почему обвинения в копировании моделей часто необоснованны

Технический разбор: почему дистилляция через API невозможна, как генерация синтетических данных стала стандартом индустрии, и почему обвинения в копировании мод

Коротко

Что будет в материале

  1. 01

    Технический ликбез: что такое дистилляция и почему API не даёт логитов

  2. 02

    Генерация синтетических данных: стандарт индустрии, а не кража

  3. 03

    Парадокс гвардрейлов: почему модели, обученные на ограниченных ответах, работают лучше

  4. 04

    Идентификационная путаница: когда модель «представляется» Claude

Релиз каждой сильной открытой модели сопровождается волной обвинений в дистилляции от закрытых API, таких как GPT-4 или Claude. Особенно часто под удар попадают китайские лаборатории, чьи модели внезапно показывают результаты, сопоставимые с лидерами рынка. Главный тезис этой статьи: технически дистилляция через публичные API невозможна, поскольку требует доступа к логитам, полному распределению вероятностей, которые API не возвращают. На практике все лаборатории, включая создателей закрытых моделей, используют генерацию синтетических данных из текстовых ответов. Обвинения же часто основаны на непонимании этой разницы или на избирательной предвзятости.

Технический ликбез: что такое дистилляция и почему API не даёт логитов

Чтобы оценить обоснованность обвинений, нужно чётко разделить два принципиально разных процесса: дистилляцию знаний и генерацию синтетических данных. Смешение этих понятий и создаёт большую часть информационного шума.

Дистилляция знаний: teacher и student

Дистилляция знаний, концепция, предложенная Джеффри Хинтоном, предполагает перенос знаний от большой teacher-модели к компактной student-модели. Ключевой механизм здесь - работа с логитами. Teacher для каждого токена генерирует не просто ответ, а полное распределение вероятностей по всему словарю. Student учится предсказывать это распределение, а не только финальный ответ. Такой подход передаёт «тёмные знания»: например, что слово «кошка» в данном контексте не только вероятно, но и что близкими альтернативами были «кот», «животное» или «питомец». Без доступа к этому распределению дистилляция в классическом понимании невозможна. Требуется прямой доступ к внутренностям модели.

Публичные API: что они возвращают на самом деле

Публичные API, такие как OpenAI Chat Completions или Anthropic Messages, возвращают текстовый ответ. В некоторых случаях можно запросить вероятности нескольких top-токенов через параметр logprobs, но это лишь малая часть картины. Вы получаете вероятности для 5-10 альтернатив из словаря размером в десятки и сотни тысяч токенов. Этого недостаточно для воссоздания полного распределения, на котором строится дистилляция. Более того, даже эти ограниченные данные часто недоступны в стандартных режимах работы. На практике разработчик получает только текст. Обучение на этом тексте - это генерация синтетических данных, а не дистилляция. В индустрии известны примеры Alpaca и Orca, которые обучались именно на синтетике из ответов GPT, и никто не называл это дистилляцией в техническом смысле.

Генерация синтетических данных: стандарт индустрии, а не кража

Обучение на синтетических данных - фундамент современных AI-пайплайнов. Этот метод используют все ведущие лаборатории без исключения. OpenAI применяла синтетику для обучения GPT-4, Anthropic - для Constitutional AI, а DeepMind - для Gemini. Открытые модели, такие как Llama и Mistral, также прошли через этапы обучения на синтетических данных. Это не обходной манёвр и не кража, а стандартный инженерный подход.

Bootstrapping: когда модель учится у самой себя

Bootstrapping - это легитимный метод улучшения моделей через итеративный цикл: генерация ответов, фильтрация лучших и дообучение на них. Исследования Self-Instruct и SPIN доказали эффективность этого подхода. Модель может использовать собственные ответы или ответы другой модели как источник данных для роста. Ключевой момент: это не требует нарушения лицензий API, если соблюдаются условия использования. Проблема возникает только тогда, когда условия прямо запрещают использование output'ов для обучения конкурирующих моделей, но и здесь граница остаётся размытой.

Подробнее о том, как синтетические данные и дистилляция влияют на расстановку сил в индустрии, мы разбирали в статье «Дистилляция как главный фактор успеха китайских AI-моделей: миф или реальность?».

Парадокс гвардрейлов: почему модели, обученные на ограниченных ответах, работают лучше

Существует неожиданный феномен, который ставит под сомнение гипотезу о простом копировании через API. Если модель просто копирует ответы API с гвардрейлами, она должна страдать от тех же ограничений. Например, отказываться отвечать на запросы, связанные с насилием или нелегальной деятельностью. На практике модели, обученные на синтетических данных из API, часто обходят эти ограничения или показывают высокое качество в тех же доменах, где учитель был ограничен.

Причина в том, что обучение на разнообразных синтетических данных позволяет модели генерализовать стратегии обхода. Гвардрейлы API не идеальны и пропускают часть данных, а модель учится на этих исключениях. Кроме того, сам процесс обучения на большом корпусе текстов создаёт эмерджентные способности, которые не сводятся к сумме ответов учителя. Это ещё один аргумент против теории «простого копирования»: если бы модель просто запоминала ответы, она бы запомнила и отказы.

Идентификационная путаница: когда модель «представляется» Claude

Один из частых аргументов в пользу копирования - ситуация, когда модель на запрос о её создателе отвечает: «Я - Claude, созданный Anthropic». Этот феномен называют идентификационной путаницей. Он возникает не из-за дистилляции, а из-за загрязнения обучающих данных. Модели обучаются на текстах, где часто упоминаются названия других моделей: в диалогах, примерах кода, форумных обсуждениях. Если в синтетических данных есть фразы вроде «As an AI assistant developed by Anthropic…», модель может их воспроизвести.

Почему это не доказательство копирования

Даже модели, обученные на открытых данных из CommonCrawl, могут содержать подобные артефакты. Идентификационная путаница - это проблема качества датасета, а не свидетельство доступа к внутренностям teacher-модели. Для доказательства дистилляции нужны прямые свидетельства: доступ к логитам или совпадение распределений вероятностей на уровне, недостижимом при обучении на текстах. Пока такие доказательства публично не предоставлялись.

В контексте безопасности моделей и их поведения в изолированных средах интересен кейс, разобранный в статье «OpenAI потеряла контроль над ИИ-моделями: взлом Hugging Face и уроки безопасности».

Избирательность обвинений: почему китайские лаборатории под прицелом

Обвинения в дистилляции распределены неравномерно. Модели DeepSeek, Qwen и Yi регулярно становятся объектами критики, в то время как западные открытые модели, такие как Llama и Mistral, проходят по грани общественного внимания. Технически процесс одинаков: все используют синтетические данные из доступных источников, включая ответы API. Разница в интерпретации.

Геополитический контекст и конкурентная борьба усиливают избирательность. Китайские лаборатории работают в условиях ограниченного доступа к вычислительным ресурсам, что делает их успехи особенно заметными и, как следствие, подозрительными для сторонних наблюдателей. Однако если осуждать китайские лаборатории за использование синтетики, то по тем же критериям нужно оценивать и западные. Лицензии API не делают исключений по географическому признаку.

Проблема подмены моделей и фейковых заявлений в индустрии также подогревает недоверие. Мы детально разбирали этот кейс в статье «Разоблачение мошенничества Basalt Labs: как фейковые заявления о 99.44% на HLE маскируют подмену моделей».

Границы легитимности: где заканчивается bootstrapping и начинается нарушение

Граница между законным использованием синтетики и потенциальными нарушениями условий API остаётся предметом дискуссий. Технически процесс одинаков, но юридическая интерпретация варьируется.

Что говорят лицензии API

Условия использования OpenAI запрещают применять output'ы для создания конкурирующих моделей. Формулировка Anthropic схожа. Проблема в том, что понятие «конкурирующая модель» не определено однозначно. Если модель не дистиллирует, а использует ответы как один из источников данных наряду с открытыми датасетами, книгами и кодом, можно ли считать её конкурирующей? Сама OpenAI использует синтетику от других моделей для оценки и, предположительно, для обучения. Это создаёт асимметрию: закрытым лабораториям позволено то, что запрещено открытым.

Вопрос лежит в правовой и этической плоскости. Технически дистилляция через API невозможна. Юридически - формулировки лицензий допускают широкую интерпретацию. Этически - индустрия ещё не выработала единых стандартов. Пока же обвинения в дистилляции часто служат инструментом конкурентной борьбы, а не технически обоснованной критикой.

Заключение: что на самом деле стоит за обвинениями

Дистилляция через публичные API технически невозможна: для неё нужны логиты, которые API не предоставляют. Генерация синтетических данных из текстовых ответов - стандарт индустрии, используемый всеми ведущими лабораториями. Обвинения в копировании часто основаны на непонимании этой разницы, избирательной предвзятости или конкурентной борьбе. Идентификационная путаница и парадокс гвардрейлов - слабые аргументы, которые не выдерживают технической проверки.

При оценке обвинений стоит опираться на факты и технические детали, а не на громкие заголовки. Если у вас есть сомнения в подлинности модели, проверьте её поведение на контрольных задачах, изучите датасеты и архитектуру. Подробнее о методах верификации и рисках слепого доверия к заявлениям разработчиков мы писали в статье «Этичный обман: как модели ИИ научились лгать во имя добра - разбор парадокса безопасности Anthropic».

Подписаться на канал