Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Архитектура Kimi K3: Stable LatentMoE, Gated MLA и другие техники SOTA-модели

Детальный разбор четырёх ключевых технологий Kimi K3: Stable LatentMoE с Quantile Balancing, Gated MLA как модификация KV-компрессии DeepSeek, KimiDeltaAttentio

Коротко

Что будет в материале

  1. 01

    Введение: почему Kimi K3 - это SOTA и что мы будем разбирать

  2. 02

    Stable LatentMoE: разреженная эволюция LatentMoE с Quantile Balancing

  3. 03

    Gated MLA: модифицированная KV-кэш компрессия от DeepSeek

  4. 04

    KimiDeltaAttention: обобщенная gated delta-архитектура для линейного внимания

Введение: почему Kimi K3 - это SOTA и что мы будем разбирать

Модель Kimi K3 с 2.8 трлн параметров заняла третье место в рейтинге Artificial Analysis, обойдя Claude Opus 4.8 и показав результаты, сопоставимые с GPT-5.6 Sol. Это первая открытая модель, которая выигрывает у проприетарных флагманов по 11 из 14 ключевых бенчмарков. Такой рывок - результат не одной прорывной идеи, а пакета из четырёх инженерных решений, каждое из которых решает конкретную проблему: стабильность обучения сверхразреженных MoE, компрессию KV-кэша для длинных последовательностей, линейное внимание и улучшенные остаточные связи.

В этой статье мы детально разбираем четыре ключевые технологии Kimi K3: Stable LatentMoE, Gated MLA, KimiDeltaAttention и AttnRes. Разбор опирается на доступные препринты и блог-посты команды Moonshot AI. Сразу обозначим пробел: по Stable LatentMoE отдельной публикации нет, и часть выводов строится на косвенных данных и аналогиях с оригинальным LatentMoE от Nvidia. По Gated MLA также нет полной спецификации - мы рассматриваем наиболее вероятную реализацию через Embedding Gated MLA. Там, где информация подтверждена, и там, где она гипотетична, мы указываем это прямо.

Stable LatentMoE: разреженная эволюция LatentMoE с Quantile Balancing

Stable LatentMoE - самый загадочный компонент архитектуры Kimi K3. В открытых источниках нет его формального описания, но анализ поведения модели и отсылки к Nvidia LatentMoE позволяют реконструировать логику этого решения. Базовая проблема, которую он решает: как сделать Mixture-of-Experts с очень высокой разреженностью стабильным при обучении.

От LatentMoE к Stable: что изменилось и зачем

Оригинальный LatentMoE от Nvidia использует латентные переменные для маршрутизации токенов к экспертам. Вместо прямого вычисления affinity scores через линейный слой, LatentMoE обучает латентное пространство, в котором близость вектора токена к центроидам экспертов определяет вероятности маршрутизации. Это снижает размерность задачи и позволяет эффективнее распределять нагрузку при умеренной разреженности - например, top-8 из 64 экспертов.

Kimi K3 доводит разреженность до экстремальных значений. При 2.8 трлн общих параметров активными остаются лишь несколько десятков миллиардов на токен. В таком режиме стандартный LatentMoE ломается: часть экспертов получает непропорционально много токенов, другие простаивают. Градиенты через простаивающих экспертов не текут, обучение деградирует. Stable LatentMoE решает это через комбинацию повышенной разреженности и механизма балансировки, который мы идентифицируем как Quantile Balancing.

Quantile Balancing: гипотеза о стабилизации маршрутизации

Quantile Balancing - метод выравнивания загрузки экспертов через квантили распределения вероятностей маршрутизации. Механика предположительно такова: для каждого эксперта вычисляется распределение вероятностей, с которыми к нему направляются токены в батче. Затем задаётся целевой квантиль - например, медиана или 75-й перцентиль. Если эксперт получает токенов больше целевого квантиля, его вероятности маршрутизации искусственно занижаются; если меньше - завышаются.

Это отличается от классического load balancing loss в MoE-архитектурах вроде GShard или Switch Transformer. Там штраф добавляется в функцию потерь и действует глобально, усредняя загрузку по времени. Quantile Balancing работает локально на уровне батча и корректирует вероятности до того, как произойдёт маршрутизация. Результат - более жёсткий контроль загрузки, критичный при сверхвысокой разреженности Kimi K3.

Косвенное подтверждение этой гипотезы - паттерны активации экспертов в ранних тестах модели на Arena LLM под именем «kivine». Анализ показал, что распределение загрузки экспертов аномально равномерное для MoE такого масштаба, что трудно объяснить стандартными методами. Прямых доказательств нет - ждём официальной публикации от Moonshot AI.

Gated MLA: модифицированная KV-кэш компрессия от DeepSeek

Рост контекстного окна до 1 млн токенов в Kimi K3 требует радикального решения проблемы KV-кэша. При стандартном multi-head attention кэш ключей и значений для миллиона токенов занимает сотни гигабайт. Gated MLA - ответ Kimi на этот вызов, построенный на фундаменте Multi-head Latent Attention от DeepSeek.

MLA от DeepSeek: основа для Gated MLA

Multi-head Latent Attention заменяет прямое хранение ключей и значений для каждой головы внимания на низкоранговую факторизацию. Вместо того чтобы хранить полные матрицы K и V размерности d_model × num_heads, MLA проецирует их в общее латентное пространство меньшей размерности через обучаемые матрицы down-projection и up-projection. KV-кэш хранит только сжатые латентные представления, а полные ключи и значения восстанавливаются на лету при вычислении внимания.

Это даёт сжатие KV-кэша в 5-10 раз без катастрофической потери качества. Плата - дополнительный вычислительный overhead на проекции при инференсе. Для большинства сценариев эта сделка выгодна: память дороже, чем несколько матричных умножений.

Gated MLA и Embedding Gated MLA: что добавляет Kimi

Gated MLA добавляет к базовой схеме механизм гейтирования, который динамически регулирует степень сжатия в зависимости от контекста. Идея в том, что не все токены одинаково важны для будущих шагов генерации. Токены с высокой предсказуемой значимостью - например, ключевые сущности в длинном документе - должны сохраняться с меньшим сжатием. Фоновые токены можно сжимать агрессивнее.

Гейт-механизм работает так: для каждого токена вычисляется скалярный вес g ∈ [0,1], который модулирует вклад сжатого представления в финальный KV-кэш. При g ≈ 1 токен сохраняется почти без потерь, при g ≈ 0 его представление максимально сжато. Веса гейтов обучаются вместе с остальными параметрами модели.

Наиболее вероятная конкретная реализация - Embedding Gated MLA. В этом варианте гейтирование интегрировано на уровне эмбеддингов: вместо постобработки латентных представлений гейты применяются непосредственно к входным эмбеддингам перед проекцией в латентное пространство. Это снижает вычислительный overhead, так как гейтирование происходит один раз на токен, а не для каждой головы внимания. Результат - дополнительная экономия памяти на 20-30% относительно базовой MLA при сопоставимом качестве на задачах с длинным контекстом.

KimiDeltaAttention: обобщенная gated delta-архитектура для линейного внимания

Даже со сжатым KV-кэшем квадратичная сложность self-attention по длине последовательности остаётся узким горлышком. KimiDeltaAttention решает эту проблему радикально - заменяя часть слоёв внимания на линейную архитектуру, основанную на delta-сетях с гейтированием.

От delta-сетей к вниманию: архитектурные решения

Классические delta-сети - это рекуррентные архитектуры, где скрытое состояние обновляется по правилу h_t = (1 - β_t) * h_{t-1} + β_t * x_t, где β_t - входозависимый гейт. Они обрабатывают последовательности с линейной сложностью, но страдают от ограниченной способности моделировать дальние зависимости.

KimiDeltaAttention обобщает эту идею до полноценной замены self-attention. Ключевое нововведение - многомерное гейтирование: вместо скалярного β_t используется матрица гейтов, которая избирательно обновляет разные измерения скрытого состояния. Это позволяет delta-слою отслеживать несколько параллельных паттернов в последовательности, приближаясь по выразительности к multi-head attention.

В Kimi K3 KimiDeltaAttention применяется не на всех слоях, а чередуется со стандартным вниманием. Типичная конфигурация: нижние слои используют delta-внимание для эффективной обработки длинного контекста, верхние - обычное внимание для тонкой настройки представлений. Такой гибрид сохраняет качество на коротких последовательностях и даёт выигрыш на длинных.

Линейная сложность и практические последствия

Вычислительная сложность KimiDeltaAttention - O(N * d^2) по длине последовательности N и размерности d, против O(N^2 * d) для стандартного внимания. При N = 1 млн токенов и d = 8192 это разница между ~67 триллионов операций и ~67 квадриллионов - три порядка величины.

Практический выигрыш: на последовательностях длиннее 128K токенов KimiDeltaAttention снижает задержку инференса в 3-5 раз относительно чистого self-attention при сопоставимом качестве перплексии. На коротких последовательностях разница незаметна. Это объясняет, почему Kimi K3 демонстрирует конкурентоспособную скорость на бенчмарках с длинным контекстом, несмотря на гигантский общий размер модели.

AttnRes: собственный рецепт остаточных связей от команды Kimi

AttnRes - модификация остаточных связей, описанная в технической публикации команды Moonshot AI. В стандартном трансформере выход каждого под-слоя (внимания или MLP) суммируется с его входом: output = input + sublayer(input). AttnRes усложняет эту схему для слоёв внимания.

Конкретно: вместо простого суммирования AttnRes вычисляет взвешенную комбинацию выхода внимания и выхода MLP-слоя с обучаемыми коэффициентами. Формула выглядит как output = α * attn_output + (1 - α) * mlp_output + input, где α - скаляр, предсказываемый небольшим линейным слоем на основе контекста. Это позволяет модели динамически решать, насколько полагаться на информацию из внимания против информации из MLP на каждом шаге обработки.

Эффект - улучшенная градиентная динамика в глубоких сетях. В Kimi K3 с её сотней с лишним слоёв стандартные остаточные связи могут приводить к затуханию или взрыву градиентов в нижних слоях. AttnRes действует как адаптивный регулятор потока градиентов, стабилизируя обучение без ручной настройки инициализации весов.

Собираем пазл: как технологии Kimi K3 работают вместе

Типичный блок трансформера в Kimi K3 организован так: входные эмбеддинги проходят через KimiDeltaAttention или стандартное внимание (в зависимости от позиции слоя), затем через Gated MLA для сжатия KV-кэша, затем через Stable LatentMoE в MLP-части блока, и наконец через AttnRes для комбинирования выходов. Порядок не случаен - каждая техника решает проблему, создаваемую предыдущей.

Stable LatentMoE обеспечивает масштабирование до триллионов параметров без коллапса обучения. Gated MLA компенсирует рост памяти от увеличения числа голов внимания в большой модели. KimiDeltaAttention снимает вычислительное узкое горлышко на длинных последовательностях. AttnRes стабилизирует градиенты в глубокой сети. Совокупный эффект - модель, которая обучается стабильно, занимает разумный объём памяти на инференсе и сохраняет скорость на практических задачах.

Выбор конфигурации для каждого слоя - компромисс. Нижние слои получают более агрессивное сжатие KV-кэша и delta-внимание, так как они работают с сырыми признаками, где точность менее критична. Верхние слои используют меньшее сжатие и стандартное внимание для тонкой обработки. Эта стратификация - инженерное решение, подтверждённое абляционными тестами.

Практические выводы: что можно применить уже сегодня

Полное воспроизведение Kimi K3 требует ресурсов, доступных единичным лабораториям. Однако отдельные техники можно адаптировать в проектах меньшего масштаба.

Quantile Balancing для MoE - наиболее переносимая идея. Если вы обучаете MoE-модель с числом экспертов от 8 и выше, замена стандартного load balancing loss на поквантильное выравнивание в батче может улучшить стабильность. Реализация сводится к вычислению квантилей распределения вероятностей маршрутизации и корректировке logits до softmax.

Гейтирование в KV-компрессии применимо в любой модели с механизмом сжатия кэша. Добавление обучаемого скалярного гейта на токен увеличивает число параметров на доли процента, но даёт измеримый выигрыш в качестве на задачах с длинным контекстом. Embedding Gated MLA особенно интересен для моделей, уже использующих MLA от DeepSeek - доработка минимальна.

Delta-внимание можно протестировать как замену self-attention в нижних слоях существующей модели. Открытые реализации delta-сетей доступны в репозиториях вроде delta-networks на GitHub. Прирост скорости на последовательностях длиннее 32K токенов заметен даже в моделях масштаба 7B параметров.

Ограничения честные: все эти методы тестировались в контексте модели с 2.8 трлн параметров. На малых масштабах выигрыш может быть менее выраженным или отсутствовать. Quantile Balancing требует тщательного подбора целевого квантиля. Gated MLA добавляет небольшой overhead на инференсе. Delta-внимание может ухудшить качество на коротких последовательностях, если применять его на всех слоях. Тестируйте на своих данных.

Заключение: Kimi K3 как витрина инженерных инноваций

Kimi K3 демонстрирует зрелость open-source AI-экосистемы. Модель не предлагает одной революционной идеи - она интегрирует четыре тщательно проработанных техники в сбалансированную архитектуру. Stable LatentMoE решает проблему масштабирования, Gated MLA - проблему памяти, KimiDeltaAttention - проблему скорости, AttnRes - проблему стабильности. Каждая по отдельности не уникальна, но их комбинация и инженерная проработка дают результат, конкурирующий с закрытыми флагманами.

Частичная открытость модели - публикация весов и базовых описаний при отсутствии полных технических статей - создаёт интересную динамику. Сообщество может запускать, тестировать и дополнять модель, но точные детали некоторых компонентов остаются ноу-хау Moonshot AI. Это разумный баланс между вкладом в экосистему и сохранением конкурентного преимущества.

Мы продолжаем следить за публикациями команды Kimi. Как только появится официальная статья по Stable LatentMoE или уточнённая спецификация Gated MLA - выпустим обновлённый разбор. А пока рекомендуем изучить практические тесты модели в наших материалах: как Kimi K3 показывает себя в агентных задачах и кодинге и какие выводы сделало сообщество LocalLLaMA в первый день после релиза.

Подписаться на канал