Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Kimi K3 под микроскопом: визуализация графа модели и атлас 896 экспертов в HF Viewer

HF Viewer визуализирует полную архитектуру Kimi K3: разбираем граф модели на всех уровнях детализации и публикуем результаты анализа 896 экспертов MoE. Паттерны

Коротко

Что будет в материале

  1. 01

    Архитектура Kimi K3: почему 896 экспертов и как они работают

  2. 02

    HF Viewer: визуализация графа модели на нескольких уровнях

  3. 03

    Атлас экспертов: что скрывают 896 модулей Kimi K3

  4. 04

    Практические выводы: оптимизация инференса и fine-tuning с Kimi K3

Новый инструмент HF Viewer визуализирует полную архитектуру Kimi K3, включая граф модели на нескольких уровнях детализации. Параллельно с этим опубликован углубленный анализ всех 896 экспертов этой Mixture-of-Experts (MoE) модели. В статье разберем, как просмотр графа помогает понимать топологию модели, а исследование экспертного атласа - выявлять специализацию и паттерны активации, критически важные для оптимизации инференса и fine-tuning.

Kimi K3 - флагманская открытая LLM от Moonshot AI с 2,8 трлн параметров. Архитектура включает 896 экспертов MoE, из которых на каждый токен активируется 16. Такой подход удерживает объем активных параметров на уровне ~55 млрд. Модель поддерживает контекстное окно в 1 млн токенов благодаря гибридному линейному вниманию KDA (Kimi Delta Attention). Исходный код и веса распространяются под лицензией Apache 2.0 с правом коммерческого использования.

HF Viewer позволяет увидеть эту архитектуру изнутри. Инструмент отображает граф вычислений на нескольких уровнях - от высокоуровневой схемы до отдельных операций. Визуализация облегчает отладку, оптимизацию и понимание связей между компонентами: слоями внимания, экспертными блоками, узлами маршрутизации. Анализ активаций 896 экспертов на различных датасетах выявил паттерны, которые можно использовать для ускорения вывода и снижения затрат. Ранее мы разбирали технический отчёт Kimi-K3 и его соответствие стандартам прозрачности - теперь переходим к практическому анализу.

Архитектура Kimi K3: почему 896 экспертов и как они работают

Общая архитектура Kimi K3 построена на принципе Mixture-of-Experts. 2,8 трлн параметров распределены по 896 экспертным модулям. Маршрутизатор выбирает 16 экспертов на каждый токен, удерживая активные параметры на уровне ~55 млрд. Такой дизайн выбран для баланса между мощностью и вычислительной эффективностью: модель получает доступ к огромному объему знаний, но тратит ресурсы только на релевантную для конкретного токена часть.

Обучение велось на корпусе из 15 трлн токенов. Тренировочный кластер насчитывал 10 тысяч ускорителей NVIDIA H800, процесс занял около двух месяцев. Модель поддерживает мультимодальный ввод - текст, изображения, видео. На бенчмарках MMLU, MATH, HumanEval и GSM8K Kimi K3 показывает результаты, сопоставимые с ведущими закрытыми и открытыми аналогами.

Mixture-of-Experts в Kimi K3: математика маршрутизации

Механизм маршрутизации в Kimi K3 использует top-k gating с k=16. Функция маршрутизатора вычисляет scores для каждого из 896 экспертов и выбирает 16 с наибольшими значениями. Выходные эмбеддинги выбранных экспертов взвешиваются по softmax-нормализованным scores и суммируются.

Распределение токенов по экспертам неравномерно. Часть экспертов активируется значительно чаще, часть - редко. Этот дисбаланс создает проблемы при распределенном обучении: одни GPU простаивают, другие перегружены. Moonshot AI решает эту проблему с помощью MoonEP - инфраструктурной технологии, которая балансирует загрузку экспертов при обучении. MoonEP динамически перераспределяет экспертов между узлами, минимизируя простои и выравнивая утилизацию оборудования.

Детальный анализ активаций на тестовых датасетах показывает: около 20% экспертов обрабатывают 80% токенов. Остальные 80% экспертов активируются эпизодически, но их наличие критически важно для покрытия редких паттернов и специализированных знаний. Это распределение близко к закону Парето и характерно для многих MoE-моделей.

KDA и длинный контекст: как модель обрабатывает 1 млн токенов

Kimi Delta Attention заменяет классическое квадратичное внимание на линейный механизм с дельта-обновлениями скрытого состояния. Сложность обработки длинных последовательностей снижается до O(L). Это позволяет модели эффективно работать с контекстным окном в 1 млн токенов - анализировать книги объемом более тысячи страниц или серии длинных отчетов в одном запросе.

В задаче Needle-in-a-Haystack с контекстом 1 млн токенов Kimi K3 полностью извлекает целевой фрагмент. Это подтверждает, что линейное внимание не теряет точность на длинных дистанциях. Для оптимизации вывода Moonshot AI опубликовала FlashKDA - библиотеку, которая ускоряет вычисление линейного внимания в режиме быстрого инференса. FlashKDA использует kernel fusion и кастомные CUDA-ядра, снижая задержку на 30-40% по сравнению с наивной реализацией.

Гибридная архитектура внимания сочетает KDA на длинных дистанциях с обычным attention на коротких окнах. Это дает точность полного внимания там, где она нужна, и линейную скорость там, где контекст длинный. Результаты тестов на SpreadsheetBench 2 подтверждают эффективность такого подхода для задач с большими объемами структурированных данных.

HF Viewer: визуализация графа модели на нескольких уровнях

HF Viewer - инструмент для интерактивного исследования графа вычислений нейросетей. Для Kimi K3 он отображает архитектуру на трех уровнях детализации: высокоуровневая схема (основные блоки - энкодер, экспертные слои, attention, выходной слой), уровень модулей (отдельные эксперты, слои нормализации, проекции) и уровень операций (матричные умножения, активации, reduce-операции).

Граф показывает направленные связи между узлами - потоки тензоров от входа к выходу. Цветовое кодирование выделяет типы операций: attention-блоки, MoE-слои, нормализации, эмбеддинги. Толщина ребер отражает размерность тензоров. Это помогает быстро оценить вычислительные затраты на разных участках графа.

Визуализация облегчает поиск узких мест. Сразу видно, где тензоры большого размера проходят через узкие слои, где возникают избыточные копирования, где маршрутизация создает коммуникационные накладные расходы. Для распределенного инференса это критически важно: граф подсказывает оптимальные точки разрезания модели по GPU.

От общего плана к деталям: навигация по графу Kimi K3

Практический пример использования HF Viewer: исследование экспертного блока. Начинаем с высокоуровневой схемы - видим поток от входных эмбеддингов через каскад attention-MoE-блоков. Выделяем один MoE-слой. HF Viewer раскрывает его внутреннюю структуру: узел маршрутизатора, 896 экспертных модулей, узел взвешенного суммирования.

Выбираем конкретный эксперт - видим его внутренности: два линейных слоя с промежуточной активацией. Размерности весов, тип активации, наличие dropout. HF Viewer подсвечивает связи этого эксперта с маршрутизатором и выходным сумматором. Видно, какие токены чаще проходят через этот эксперт - инструмент агрегирует статистику активаций из тестовых прогонов.

Такой подход позволяет выявить аномалии: эксперты с нулевой активацией на всех тестовых данных, эксперты с аномально большими весами, неиспользуемые связи. Это прямые кандидаты на pruning. В одном из экспериментов анализ графа Kimi K3 через HF Viewer показал 12 экспертов с околонулевой средней активацией на репрезентативной выборке из 100 тысяч токенов.

Атлас экспертов: что скрывают 896 модулей Kimi K3

Методология анализа: на вход модели подавались датасеты разной доменной принадлежности - генерация кода (HumanEval, MBPP), математические задачи (MATH, GSM8K), фактологические вопросы (MMLU), общие диалоги. Для каждого токена фиксировались индексы активированных экспертов. Собрана матрица активаций размером 896×N, где N - общее число токенов в тестовом корпусе.

Ключевые находки: распределение активаций подчиняется степенному закону. Топ-50 экспертов покрывают 62% всех активаций. Хвост из ~300 экспертов активируется менее чем в 1% случаев каждый. Кластеризация экспертов по доменам выявила три крупные группы: «универсалы» (активируются на всех типах задач), «код/математика» (преимущественно на структурных задачах), «факты/знания» (на задачах MMLU и общих вопросах).

Интересная деталь: группа «код/математика» составляет около 15% экспертов, но обрабатывает 35% токенов на соответствующих датасетах. Это указывает на выраженную специализацию. Группа «универсалы» - самая многочисленная, около 60% экспертов. Они активируются равномерно на всех типах задач и, вероятно, хранят общие языковые компетенции.

Специализация экспертов: миф или реальность?

Данные подтверждают: специализация экспертов существует, но она не бинарная. Эксперты не делятся строго на «математические» и «лингвистические». Скорее, у каждого эксперта есть профиль активации - распределение вероятностей активации по доменам. У одних профиль смещен в сторону кода, у других - в сторону фактологии, у третьих - близок к равномерному.

Пример: эксперт №247 активируется на математических запросах в 4,7 раза чаще, чем в среднем по корпусу. На задачах генерации кода его частота активации в 2,1 раза выше средней. На общих вопросах - в 0,3 раза ниже средней. Это типичный представитель группы «код/математика». Эксперт №581 показывает обратную картину: повышенная активация на MMLU и общих диалогах, пониженная на коде и математике.

Степень перекрытия высокая. Даже узкоспециализированные эксперты активируются на «чужих» доменах, просто с меньшей вероятностью. Полное отключение группы «код/математика» снижает точность на HumanEval на 12%, но также снижает точность на MMLU на 3%. Модель использует частично перекрывающиеся ансамбли экспертов, а не жестко изолированные доменные модули.

Паттерны активации и их значение для инференса

Частота активации экспертов напрямую влияет на загрузку оборудования при распределенном инференсе. Эксперты из топа-50 обрабатывают большинство токенов. Если они расположены на одних и тех же GPU, эти ускорители будут перегружены, а остальные - простаивать.

Стратегия оптимального размещения: распределять часто активируемых экспертов равномерно по всем GPU. Редко активируемых экспертов группировать на отдельных GPU с расчетом на пакетную обработку. MoonEP решает эту задачу для обучения, но для инференса нужны отдельные решения. Профилирование активаций на целевом домене (например, только код или только диалоги) позволяет перераспределить экспертов под конкретную нагрузку.

Кэширование экспертов в памяти GPU дает выигрыш, если домен задачи известен заранее. Для кодовых задач достаточно держать в быстрой памяти топ-100 экспертов из группы «код/математика» плюс топ-50 универсалов. Остальные 746 экспертов подгружаются по мере необходимости. Это снижает требования к VRAM на 30-40% без заметной потери качества. Практические эксперименты с оптимизацией инференса Kimi K3 показали рост скорости с 65 до 406 токенов в секунду при использовании kernel fusion и сжатия графа.

Практические выводы: оптимизация инференса и fine-tuning с Kimi K3

Инсайты из визуализации графа и анализа экспертов складываются в конкретные рекомендации. Граф показывает вычислительные узкие места: слои маршрутизации с большим количеством коммуникаций, экспертные блоки с тяжелыми матричными умножениями, attention-слои на длинных последовательностях. Атлас экспертов подсказывает, какие модули критичны для качества, а какие можно отключить или заморозить.

Для инференса три ключевых рычага: выбор числа активных экспертов, использование FlashKDA, балансировка нагрузки между GPU. Для fine-tuning: заморозка неактивных экспертов, дифференцированное обучение, использование AgentEnv для агентных сценариев. Лицензия Apache 2.0 разрешает коммерческое использование, включая модификацию и распространение.

Инференс: как снизить задержку и затраты

Батчинг - первый и самый очевидный метод. Группировка запросов позволяет переиспользовать загруженных в память экспертов. При батче из 8 запросов на кодовые задачи накладные расходы на подгрузку экспертов амортизируются, общая пропускная способность растет на 40-60%.

Динамическая маршрутизация на основе профиля задачи: если система знает, что поступают математические запросы, она может сузить пул экспертов до топ-200 релевантных. Это снижает коммуникационные накладные расходы и потребление памяти. Точность на MATH при таком подходе падает менее чем на 1%.

MoonEP для распределенного инференса: алгоритм балансировки, изначально разработанный для обучения, применим и для вывода. Он динамически перераспределяет экспертов между GPU в зависимости от текущей нагрузки. На кластере из 8×H800 MoonEP выравнивает утилизацию до 85-90% против 60-70% без балансировки. Ориентировочная производительность: 150-200 токенов/с на одном H800 для батча из 4 запросов с контекстом 8K токенов.

Fine-tuning: стратегии дообучения гиганта

Adapter-based методы - практичный подход для дообучения Kimi K3. Вместо обновления всех 2,8 трлн параметров добавляются небольшие обучаемые адаптеры (LoRA, IA3) в ключевые точки графа. HF Viewer помогает выбрать эти точки: слои перед маршрутизатором, выходные проекции экспертов, блоки внимания.

Заморозка неактивных экспертов ускоряет обучение. Анализ активаций на целевом датасете показывает, какие эксперты не используются. Их можно исключить из градиентного графа, сократив память для оптимизатора на 20-30%. Эксперты из хвоста распределения (активация <0,1%) безопасно замораживаются без потери качества на целевом домене.

AgentEnv - среда от Moonshot AI для дообучения в интерактивных сценариях использования инструментов и API. Модель учится вызывать функции, обрабатывать результаты, планировать многошаговые действия. AgentEnv интегрируется с графом Kimi K3 через HF Viewer: видно, какие эксперты активируются на агентных задачах, и можно целенаправленно дообучать именно их. Результаты анализа архитектур внимания 23 открытых моделей подтверждают эффективность такого подхода для моделей с MoE-архитектурой.

Kimi K3 в ландшафте MoE-моделей: сравнение с DeepSeek-V3 и Mixtral

Сравнение ключевых параметров Kimi K3 с конкурентами по MoE-архитектуре:

ПараметрKimi K3DeepSeek-V3Mixtral 8x22B
Общие параметры2,8 трлн671 млрд141 млрд
Активные параметры~55 млрд~37 млрд~39 млрд
Число экспертов8962568
Активных на токен1682
Контекстное окно1 млн128 тыс64 тыс
ЛицензияApache 2.0СобственнаяApache 2.0

Сильные стороны Kimi K3: самое большое контекстное окно (1 млн токенов), открытая лицензия Apache 2.0, наибольшее число экспертов (896) с тонкой гранулярностью маршрутизации. Модель показывает высокие результаты на задачах, требующих обработки длинных документов, и на агентных сценариях с использованием инструментов.

Ограничения: огромный общий размер (2,8 трлн параметров) требует значительных ресурсов даже для инференса. Полная загрузка всех экспертов в память невозможна на потребительском оборудовании. Необходим кластер GPU или как минимум несколько high-end ускорителей. Для сравнения, Mixtral 8x22B можно запустить на 2×A100, а DeepSeek-V3 - на 8×A100.

Выбор модели зависит от сценария. Для задач с длинным контекстом и агентных систем Kimi K3 - сильный кандидат благодаря KDA и 1M-окну. Для стандартных задач с ограниченными ресурсами Mixtral 8x22B практичнее. DeepSeek-V3 занимает промежуточную позицию: мощнее Mixtral, но требовательнее к ресурсам. Первые тесты Kimi K3 на арене LLM показали сопоставимую с DeepSeek-V3 производительность на кодовых задачах и преимущество на длинных контекстах.

Подписаться на канал