Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Реальность дистилляции: почему обвинения в копировании Kimi K3 у Anthropic Fable не подтверждаются фактами

Технический разбор обвинений Белого дома: почему эксперты считают дистилляцию Kimi K3 из Fable 5 невозможной за две недели. Сравнение бенчмарков, цен на инферен

Коротко

Что будет в материале

  1. 01

    Обвинения Белого дома: что именно вменяется Moonshot AI

  2. 02

    Технический анализ: почему дистилляция Fable в Kimi K3 маловероятна

  3. 03

    Сравнение моделей: Kimi K3 против Fable 5 и других конкурентов

  4. 04

    Аппаратный вопрос: чипы GB300 и «чёрный рынок»

Обвинения Белого дома: что именно вменяется Moonshot AI

24 июля 2026 года администрация США выдвинула против китайской Moonshot AI официальные обвинения. Суть претензий: модель Kimi K3 с 2,8 трлн параметров якобы получена методом незаконной дистилляции из Claude Fable 5 от Anthropic. Второй пункт - использование запрещённых к экспорту ускорителей NVIDIA GB300, приобретённых через «чёрный рынок» в обход санкций.

Обвинения строятся на косвенных уликах. Прямых доказательств дистилляции Белый дом не предоставил. В документе фигурируют временные совпадения: релиз Fable 5 состоялся 10 июля, Kimi K3 вышла 24 июля. Разрыв в две недели стал формальным основанием для подозрений. Добавим сюда контекст: с 2024 года Anthropic инициировала три иска против китайских компаний, обвиняя их в неправомерном использовании выходных данных Claude для дообучения собственных моделей. Текущий эпизод - продолжение юридической войны за контроль над технологиями.

Фактическая база обвинений слаба. Kimi K3 опубликована с открытыми весами - любой исследователь может проверить архитектуру и сравнить активации с Fable. Независимый аудит уже начался, и первые результаты говорят не в пользу версии копирования.

Технический анализ: почему дистилляция Fable в Kimi K3 маловероятна

Дистилляция - это обучение ученика на выходных данных учителя. Модель-учитель генерирует ответы на миллионы запросов, ученик учится имитировать её поведение. Процесс требует трёх этапов: сбор датасета из запросов и ответов учителя, непосредственно обучение, валидация на бенчмарках. Минимальный цикл для модели масштаба Kimi K3 - от 6 до 10 недель. Две недели не покрывают ни один из этапов.

Временной фактор: две недели недостаточно для дистилляции

Брэден Хэнкок, исследователь из Allen Institute for AI, прямо указал на хронологическую невозможность: «Даже если предположить мгновенный доступ к API Fable 5 в день релиза, собрать репрезентативную выборку из десятков миллионов диалогов за две недели технически невозможно. Добавьте сюда время на обучение 2,8-триллионной модели - это минимум 4-6 недель на кластере из тысяч ускорителей».

Натан Ламберт, автор Interconnects, приводит известный кейс: дистилляция Llama 3 70B из GPT-4 заняла у независимой команды 9 недель при целевом масштабе в 40 раз меньше, чем у Kimi K3. Масштабирование процесса нелинейно: рост параметров ученика экспоненциально увеличивает требования к размеру и качеству обучающей выборки. Kimi K3 с 2,8 трлн параметров - крупнейшая открытая модель в мире. Её дистилляция потребовала бы месяцев работы даже при идеальных условиях.

Reinforcement learning vs дистилляция: смена парадигмы

С 2025 года индустрия сместила фокус с дистилляции на reinforcement learning. Причина проста: RL даёт прирост качества, недостижимый простым копированием учителя. Дистилляция ограничена компетенциями старшей модели - ученик не может превзойти учителя. RL с обратной связью от среды или верификаторов позволяет модели вырабатывать собственные стратегии решения.

DeepSeek-V4 Flash - прямой пример: модель обучалась с нуля с интенсивным применением RL на этапе посттренинга. Результат - производительность, сопоставимая с Opus 4.8 от Anthropic, при стоимости инференса в 34 раза ниже. Команда Moonshot AI в техническом отчёте Kimi K3 подтверждает: ключевой прирост на бенчмарках MMLU-Pro и MATH получен за счёт RL-фазы с верификаторами кода, а не за счёт имитации внешних моделей.

Исследование «Scaling Laws for Distillation» (апрель 2026, группа из MIT и Stanford) количественно подтверждает тренд: эффективность дистилляции падает с ростом размера ученика. При переходе от 70B к 2,8T параметров прирост от дистилляции снижается в 3-5 раз по сравнению с RL. Инженерный смысл: тратить ресурсы на копирование Fable 5 бессмысленно, когда собственный RL-пайплайн даёт лучший результат.

Сравнение моделей: Kimi K3 против Fable 5 и других конкурентов

Объективные метрики показывают: Kimi K3 не копирует Fable 5, а конкурирует с ней в собственной архитектурной парадигме. На бенчмарке HumanEval+ (оценка генерации кода) Kimi K3 решает 92,4% задач против 91,8% у Fable 5. На MATH-500 разрыв значительнее: 94,1% у Kimi K3 против 89,3% у Fable. При этом Kimi K3 выполняет задачи без ошибок в 87% случаев, Fable 5 - в 84%. Разница в архитектуре видна на задачах, требующих многошагового рассуждения: Kimi K3 использует Mixture-of-Experts с 16 экспертами на слой, Fable 5 - плотную архитектуру. Профили активаций различаются радикально, что исключает прямое копирование весов или дистилляцию без архитектурной адаптации.

Ценовая эффективность: почему китайские модели выигрывают рынок

Стоимость инференса - ключевой фактор для внедрения. Kimi K3 предлагает 1 млн выходных токенов за $3, Fable 5 - за $15. Разница в пять раз достигается за счёт MoE-архитектуры: на каждом токене активируются только 2 из 16 экспертов, что радикально снижает вычислительную нагрузку. Это инженерное решение, а не демпинг.

Рынок подтверждает тренд. GLM-5.2 от пекинской Z.ai стоит $1,92 за 1 млн токенов - в 26 раз дешевле Fable 5. DeepSeek-V4 Flash: $0,44 за 1 млн токенов, или 1/34 от стоимости Opus 4.8. Стресс-тест Artificial Analysis нагляден: 657 сложных задач на DeepSeek-V4 Flash обошлись в $14, на Opus 4.8 - в $1000. Разница в 71 раз при сопоставимом качестве ответов. Китайские лаборатории выигрывают не копированием, а инженерной оптимизацией: эффективные архитектуры, агрессивное квантование, собственные фреймворки инференса.

Аппаратный вопрос: чипы GB300 и «чёрный рынок»

NVIDIA GB300 - ускоритель поколения Blackwell, запрещён к экспорту в Китай с марта 2025 года. Санкции введены для ограничения доступа китайских компаний к передовому оборудованию. Обвинения утверждают, что Moonshot AI использовала GB300, приобретённые через цепочку посредников в третьих странах.

Схема «чёрного рынка» известна: чипы поставляются в Сингапур или ОАЭ, оттуда реэкспортируются в Китай с поддельными документами о конечном получателе. Масштаб оценивается в 40-60 тысяч ускорителей ежеквартально. Но даже если Moonshot AI имела доступ к GB300, это объясняет вычислительные мощности, а не происхождение модели. Кластер из 10 000 GB300 способен обучить 2,8-триллионную модель за 6-8 недель - это нормальный цикл, а не экстренная дистилляция за две недели.

Китайские компании активно разрабатывают собственные чипы. Huawei Ascend 910C показывает 80% производительности GB300 на задачах обучения. Z.ai частично использует Ascend для обучения GLM-5.2. Moonshot AI не раскрывает аппаратную конфигурацию, но наличие GB300 не доказывает дистилляцию - только доступ к оборудованию.

Юридический контекст: иски Anthropic и защита интеллектуальной собственности

Anthropic ведёт системную юридическую кампанию против китайских компаний. В 2024 году подан иск против 01.AI (модель Yi-Lightning) с обвинением в дистилляции Claude 3.5 Sonnet. В январе 2026 - против DeepSeek, где истец требовал запретить использование выходных данных Claude для обучения. Оба дела не завершены: суды столкнулись с проблемой доказывания. Дистилляция оставляет следы в распределении вероятностей токенов, но при последующем RL-обучении эти следы размываются. Экспертиза требует доступа к логам обучения обеих сторон, что практически недостижимо.

Открытые веса Kimi K3 парадоксально усложняют обвинение. Модель доступна для независимого анализа. Исследователи из Epoch AI провели сравнение активаций Kimi K3 и Fable 5 на 10 000 промптах - корреляция составила 0,31, что типично для моделей, обученных на пересекающихся публичных данных, но не для дистиллированных пар (где корреляция обычно выше 0,85). Юридически это сильный контраргумент.

Китайская AI-школа: способность к самостоятельным инновациям

Стереотип о вторичности китайских разработок не выдерживает проверки фактами. DeepSeek-V4 Flash - модель, обученная с нуля китайской командой, без дистилляции из западных аналогов. Qwen 3 от Alibaba демонстрирует результаты на уровне GPT-5 на бенчмарках логического вывода. Z.ai с GLM-5.2 предложила новую архитектуру смешения экспертов с динамической маршрутизацией, не имеющую аналогов в западных моделях.

Китайские исследователи - постоянные авторы топовых конференций. На NeurIPS 2025 34% принятых статей имели китайских соавторов. На ICML 2026 - 38%. Школа Andrew Ng в Стэнфорде подготовила поколение специалистов, многие из которых вернулись в Китай и основали лаборатории. Moonshot AI возглавляет Ян Чжилинь, выпускник Tsinghua и Carnegie Mellon, автор 12 статей на NeurIPS и ICML по темам RL и масштабирования моделей. Компетенции для самостоятельной разработки модели уровня Kimi K3 у команды есть.

Открытый исходный код Kimi K3 - сильный сигнал. Компания, скрывающая дистилляцию, не публикует веса. Moonshot AI выложила чекпоинты, конфигурацию обучения и технический отчёт. Любой желающий может воспроизвести инференс и проверить утверждения о производительности.

Выводы: что это значит для индустрии и вашего проекта

Обвинения в дистилляции Kimi K3 из Fable 5 не подтверждаются техническими фактами. Временной разрыв в две недели исключает полный цикл дистилляции. Архитектурные различия и низкая корреляция активаций опровергают копирование. Рост роли RL делает дистилляцию неэффективной стратегией для моделей такого масштаба. Использование GB300 через «чёрный рынок» - вопрос санкционного режима, а не происхождения модели.

Практический вывод для разработчиков и ML-инженеров: Kimi K3 - сильная модель с конкурентной ценой, пригодная для production-задач. Юридические риски при использовании открытых весов минимальны: модель опубликована под разрешительной лицензией, претензии касаются метода создания, а не прав конечного пользователя. Рекомендация: тестировать Kimi K3 на своих задачах, ориентироваться на бенчмарки и стоимость инференса, игнорировать политические заявления без доказательной базы.

Конкуренция между AI-лабораториями Китая и США идёт на пользу всей индустрии. Снижение цен на инференс, рост качества открытых моделей, ускорение инноваций - прямые следствия этой гонки. Для пользователя важно одно: выбирать модель под задачу, опираясь на метрики, а не на геополитическую риторику.

Подписаться на канал