Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Как агентный оптимизатор на основе GPT 5.6 Sol разогнал инференс Kimi K3 до 406 tok/s: разбор методов

Рой агентов GPT 5.6 Sol за 40 часов разогнал инференс Kimi K3 с 65 до 406 токенов в секунду. Разбор методов: kernel fusion, сжатие графа с 331 до 22 GPU-вызовов

Коротко

Что будет в материале

  1. 01

    Результат: с 65 до 406 токенов в секунду за 40 часов

  2. 02

    Kimi K3: что за модель и почему её оптимизация - вызов

  3. 03

    Агентный оптимизатор GPT 5.6 Sol: как рой агентов переписал граф

  4. 04

    Кастомные WebGPU-ядра: KDA, MLA и MoE под капотом

Результат: с 65 до 406 токенов в секунду за 40 часов

Рой агентов GPT 5.6 Sol за 40 часов увеличил скорость инференса модели Kimi K3 с 65 до 406 токенов в секунду. Рост в 6.2 раза. Достигнут за счёт полной перестройки вычислительного графа и внедрения трёх кастомных WebGPU-ядер.

Исходная модель - MoE-архитектура на 2.8 трлн параметров от Moonshot AI. До оптимизации каждый токен требовал 331 вызов к GPU. Агенты сократили это число до 22. Ключевой метод - kernel fusion: объединение разрозненных операторов в компактные вычислительные блоки. Параллельно разработаны специализированные ядра Kimi Delta Attention (KDA), Multi-Head Latent Attention (MLA) и оптимизированное MoE-ядро.

Этот кейс показывает: агентные системы способны за часы выполнять работу, которая у команды инженеров заняла бы недели. Разберём каждый этап трансформации.

Kimi K3: что за модель и почему её оптимизация - вызов

Kimi K3 - флагманская разработка китайского стартапа Moonshot AI. Модель с 2.8 трлн параметров использует архитектуру Mixture of Experts: на каждый токен активируются 16 из 896 экспертов. Добавьте нативную поддержку зрения - и получите вычислительный граф, который на старте насчитывал 331 узел.

Позиционирование Kimi K3 на рынке сильное. В рейтинге Arena модель заняла первое место во Frontend Code с 1679 баллами, обойдя Claude Fable 5 в слепом тестировании. Она превосходит Claude Opus 4.8 и GPT-5.5 в задачах кодинга и агентных сценариев. Подробный разбор бенчмарков мы публиковали в сравнительном тестировании Kimi K3 против Opus и GPT. Однако по общей производительности модель уступает Claude Fable 5 и GPT-5.6 Sol.

Главная проблема - скорость. 65 токенов в секунду для модели такого класса означают высокую стоимость инференса и задержки, неприемлемые для real-time приложений. 331 вызов к GPU на каждый токен создавал колоссальные накладные расходы на запуск ядер и передачу данных между памятью и вычислительными блоками. Оптимизация этого графа стала целью эксперимента.

Агентный оптимизатор GPT 5.6 Sol: как рой агентов переписал граф

Эксперимент строился вокруг роя специализированных агентов на базе GPT 5.6 Sol. Каждый агент решал узкую задачу: анализ структуры графа, поиск паттернов для слияния, генерация кода кастомных ядер, верификация корректности. Координация шла через общую память - агенты обменивались результатами и итеративно улучшали решения.

Процесс занял 40 часов непрерывной работы. Для сравнения: ручная оптимизация графа из 331 узла потребовала бы от команды ML-инженеров нескольких недель. Агенты действовали по циклу: профилирование узких мест, генерация гипотез, реализация изменений, автоматическое тестирование на корректность и замер производительности. Неудачные варианты отбрасывались, удачные закреплялись в общей кодовой базе.

От 331 узла к 22 вызовам: слияние операторов (kernel fusion)

Kernel fusion - главный инструмент ускорения. Принцип: несколько последовательных операций объединяются в одно GPU-ядро. Это устраняет накладные расходы на запуск отдельных ядер и передачу промежуточных данных через глобальную память.

В исходном графе Kimi K3 агенты обнаружили сотни мест, где операции нормализации, активации и проекции шли последовательно, порождая лишние циклы записи-чтения. Типичный пример: слой LayerNorm, за которым сразу следует линейная проекция внимания, а затем функция активации. Вместо трёх отдельных вызовов агенты генерировали одно fused-ядро, выполняющее все три операции за один проход.

Результат: граф сжался с 331 узла до 22 GPU-вызовов на токен. Утилизация вычислительных блоков выросла, задержки на запуск ядер упали радикально. Latency сократился кратно, что напрямую конвертировалось в рост throughput с 65 до 406 токенов в секунду.

Кастомные WebGPU-ядра: KDA, MLA и MoE под капотом

Выбор WebGPU как целевой платформы не случаен. Этот API даёт низкоуровневый доступ к GPU-ресурсам при сохранении переносимости между различными видеокартами и операционными системами. Агенты генерировали код на WGSL, задействуя возможности, недоступные в высокоуровневых фреймворках.

Kimi Delta Attention (KDA): ускорение внимания через дельты

Классический механизм внимания пересчитывает матрицу совместимости для всей последовательности токенов на каждом шаге декодирования. KDA использует свойство авторегрессионной генерации: при добавлении нового токена большая часть вычислений дублирует предыдущий шаг.

Ядро вычисляет только дельту - изменение матрицы внимания, вызванное появлением нового токена. Это снижает вычислительную сложность с O(n²) до O(n) по длине последовательности. Дополнительно агенты реализовали эффективное кэширование промежуточных результатов в разделяемой памяти GPU, минимизировав обращения к глобальной памяти.

Multi-Head Latent Attention (MLA): сжатие без потерь

В стандартном multi-head attention ключи и значения для каждой головы хранятся и обрабатываются независимо. MLA проецирует их в низкоразмерное латентное пространство, общее для всех голов. Размерность латентного представления подбирается так, чтобы сохранить качество внимания при значительном сокращении объёма вычислений.

Для Kimi K3 агенты подобрали коэффициент сжатия, при котором потери качества на бенчмарках не превысили 0.1%, а объём передаваемых данных сократился в 4 раза. Кастомное ядро выполняет проекцию в латентное пространство и обратное восстановление за один проход, без промежуточной записи в память.

MoE-ядро: быстрая маршрутизация 16 из 896 экспертов

Архитектура Mixture of Experts создаёт специфическую проблему: при 896 экспертах накладные расходы на маршрутизацию и загрузку весов сравнимы с полезными вычислениями. Агенты разработали ядро с тремя оптимизациями.

Первая - предвыборка: роутер определяет нужных экспертов для следующего токена, пока текущий ещё обрабатывается. Вторая - кэширование часто используемых экспертов в быстрой памяти GPU. Третья - асинхронная загрузка весов редких экспертов, не блокирующая вычислительный конвейер. Совокупный эффект: задержка на маршрутизацию снижена до уровня, при котором MoE-блок перестал быть узким местом.

Практическая ценность: метрики, стоимость и возможность повторения

Ключевые метрики до и после оптимизации: throughput вырос с 65 до 406 токенов в секунду, latency на один токен сократился пропорционально. Количество GPU-вызовов на токен снизилось с 331 до 22. Утилизация вычислительных блоков GPU выросла за счёт устранения простоев между запусками ядер.

Стоимость инференса снизилась кратно: меньше вызовов к GPU - меньше энергопотребления и меньше требований к пропускной способности памяти. Для продакшен-систем, обрабатывающих миллионы токенов в день, экономия исчисляется тысячами долларов ежемесячно.

Воспроизводимость эксперимента ограничена. Агенты GPT 5.6 Sol - закрытая система, доступная по API. Требуется глубокая экспертиза в GPU-программировании для верификации сгенерированного кода. Зависимость от WebGPU сужает круг поддерживаемого железа: нужны видеокарты с полноценной поддержкой этого API. Подход оправдан для больших MoE-моделей с разветвлённым вычислительным графом, где ручная оптимизация экономически нецелесообразна. Для небольших dense-моделей выигрыш будет скромнее.

Архитектурные детали Kimi K3, включая Stable LatentMoE и Gated MLA, мы разбирали в техническом анализе модели. Там же рассмотрены ограничения открытой информации о внутреннем устройстве.

Выводы: агентная оптимизация как новый стандарт

Кейс Kimi K3 фиксирует важный сдвиг: агентные системы переходят от генерации текста к автоматизации сложных инженерных задач. 40 часов работы роя агентов заменили недели ручного труда по профилированию, поиску паттернов для kernel fusion и написанию кастомных ядер.

Тренд на слияние операторов и специализированные вычислительные ядра будет усиливаться по мере роста размеров моделей. WebGPU получает практическое применение в инференсе больших языковых моделей, предлагая переносимую альтернативу CUDA.

Практическая рекомендация: отслеживайте развитие агентных оптимизаторов и экспериментируйте с WebGPU для задач инференса. Начните с профилирования вычислительного графа вашей модели - вероятно, вы обнаружите возможности для kernel fusion, которые дадут быстрый выигрыш без привлечения агентных систем.

Оговорка: данные об оптимизации Kimi K3 получены из описания эксперимента и требуют независимой верификации. Результаты могут варьироваться в зависимости от аппаратной конфигурации и версии модели. Для более широкого контекста о позиционировании Kimi K3 на рынке открытых моделей рекомендуем анализ эры эквивалентности открытых и закрытых моделей в 2026 году.

Подписаться на канал