Группа разработчиков Atomic Chat провела динамическое квантирование модели Kimi K3 с 2,8 триллиона параметров в формат GGUF Q3_K_S. Результат занимает 1114,76 ГиБ на диске. Инференс запущен на сервере без GPU: AMD EPYC 9554P (64 ядра), 1,5 ТБ DDR5 и NVMe RAID0. Модель полностью загружается в оперативную память. На 110 потоках скорость составила 4,21 токена в секунду при длине контекста 512 токенов. Это proof-of-concept, а не production-решение.
Прямой ответ на главный вопрос: запустить Kimi K3 на CPU можно. Но практическая ценность ограничена скоростью, которая в 20-50 раз ниже, чем у меньших моделей на GPU. Для диалоговых систем 4,21 t/s - это медленно. Для пакетной обработки, разовых экспериментов или задач, где критичен длинный контекст и энциклопедические знания модели, такой подход оправдан. Выбор зависит от сценария и бюджета.
В этом разборе - детали квантизации, архитектура Kimi K3, конфигурация сервера, результаты тестов и экономика CPU-инференса против GPU. Все цифры, конфиги и ограничения - без воды.
Что такое Kimi K3 и почему её квантизация - событие
Kimi K3 - модель компании Moonshot AI, опубликованная 27 июля 2026 года на Hugging Face. 2,8 триллиона параметров, архитектура Mixture of Experts (MoE) с 896 экспертами. На каждый токен активируются 16 экспертов - около 50 миллиардов активных параметров. Исходные веса в формате MXFP4 занимают примерно 1,4–1,5 ТБ. Официальная рекомендация для запуска - 64 GPU уровня H200, стоимость оборудования от $1 млн до $3 млн.
Модель поддерживает контекстное окно в 1 миллион токенов, в отдельных режимах - до 1 триллиона. В индексе Artificial Analysis Kimi K3 набрала 57 баллов - уровень Opus 4.8 и GPT-5.5. В рейтинге Arena Intelligence модель заняла третье место среди ИИ-агентов и одиннадцатое среди текстовых моделей. На LMArena Frontend Code Arena - первое место с 76% побед над Claude Fable 5 в слепых сравнениях по фронтенду. В агентном бенчмарке GDPval v2 рейтинг Elo вырос с 1190 у предыдущей версии K2.6 до 1668 у K3.
Публикация весов сделала модель доступной для сообщества. Квантизация в GGUF - логичный следующий шаг: снизить требования к памяти настолько, чтобы модель поместилась в ОЗУ сервера, а не в видеопамять кластера GPU. Детальный разбор архитектуры и требований Kimi K3 - в отдельной статье.
Архитектурные особенности, позволившие сжатие
MoE-архитектура - ключевой фактор. Из 896 экспертов на каждый токен активны только 16. Это снижает вычислительную нагрузку: модель не просчитывает все параметры для каждого токена, а маршрутизирует запрос через подмножество экспертов. Разреженная активация делает квантизацию эффективнее: меньше активных весов - меньше накопление ошибок квантования.
Второй фактор - Kimi Delta Attention (KDA) и Attention Residuals. Полностью softmax-внимание в модели не используется. Часть слоёв в каждом блоке заменена на KDA. Это снижает объём вычислений для механизма внимания и уменьшает чувствительность к потере точности при сжатии. Вместе с весами опубликованы технический отчёт и три внутренних инструмента: FlashKDA, MoonEP и AgentENV.
Динамическое квантирование в GGUF Q3_K_S: как из 1.5 ТБ получили 1.1 ТБ
GGUF - формат файлов для инференса на CPU, разработанный в экосистеме llama.cpp. Q3_K_S - уровень квантизации: 3-битное квантование с сохранением важных весов. Буква K означает оптимизированную схему, S - small, вариант с меньшим размером за счёт более агрессивного сжатия части слоёв.
Динамическое квантирование учитывает распределение весов модели. В отличие от статического, где диапазоны квантования фиксированы заранее, динамический подход анализирует фактические значения весов и подбирает оптимальные пороги. Результат: размер снизился с ~1,5 ТБ до 1114,76 ГиБ - примерно на 25%. Atomic Chat использовали инструменты из экосистемы llama.cpp. Сообщество Unsloth также выпустило GGUFs для Kimi K3 - MXFP4-версия и mmproj-файл уже доступны.
Почему Q3_K_S, а не более агрессивное сжатие?
Уровни квантизации в GGUF: Q2, Q3, Q4, Q5, Q6, Q8. Q2 даёт максимальное сжатие, но риск потери когерентности высок. Q4 и выше сохраняют больше точности, но размер файла приближается к исходному. Q3_K_S - компромисс: значительное сжатие при сохранении связности ответов.
Доказательство сохранения качества - тест с газетой New York Times от 21 июля 1969 года. Модель корректно описала заголовок «Men Walk On Moon», слоган «All the News That's Fit to Print», цену в 10 центов и другие элементы. Галлюцинаций не зафиксировано. Это мультимодальный тест: модель анализировала изображение, что подтверждает сохранение визуальных способностей после квантизации до 3 бит.
Железо для инференса: сервер без GPU за $50-100 тысяч
Конфигурация Atomic Chat: процессор AMD EPYC 9554P - 64 ядра, 128 потоков, архитектура Zen 4, TDP 360 Вт. Оперативная память: 1,5 ТБ DDR5 ECC, 12-канальная подсистема. Дисковая подсистема: NVMe RAID0 из нескольких накопителей. Модель полностью помещается в ОЗУ - это ключевое требование. Стоимость такой конфигурации оценивается в $50-100 тысяч. Для сравнения: кластер из 64 H200 стоит $1-3 млн.
1,5 ТБ ОЗУ - экзотика для большинства организаций. Но это на порядок дешевле GPU-кластера. Энергопотребление: EPYC 9554P с пиковым TDP 360 Вт плюс ОЗУ и диски - около 500-600 Вт под нагрузкой. 64 H200 потребляют около 45 кВт. Разница в 75-90 раз.
Почему NVMe RAID0, а не просто загрузка с диска?
Модель весит 1,1 ТБ. Загрузка с одиночного NVMe заняла бы несколько минут. RAID0 из нескольких дисков увеличивает пропускную способность пропорционально числу накопителей. Это сокращает время до первого токена. Для однократной загрузки задержка приемлема. Для частых перезапусков дисковая подсистема становится узким местом: каждый старт инференса требует полной загрузки модели в ОЗУ.
Тестирование: 4.21 токена в секунду и никаких галлюцинаций
Параметры теста: контекст 512 токенов, 110 потоков. Скорость 4,21 t/s - примерно 250 токенов в минуту. Для медленного чтения этого достаточно. Для диалогового интерфейса - нет: пользователь ждёт ответа десятки секунд. 110 потоков - эмпирический подбор под EPYC 9554P. Процессор имеет 64 физических ядра и 128 логических с SMT. 110 потоков близки к числу физических ядер с небольшим запасом на hyperthreading - это типичная практика для CPU-инференса.
512 токенов - короткий контекст. Модель поддерживает до 1 млн токенов, но при масштабировании контекста скорость на CPU падает линейно или хуже. При 32k токенов скорость может упасть ниже 1 t/s. Это фундаментальное ограничение CPU-инференса: отсутствие параллелизма, который дают GPU.
Когерентность и отсутствие галлюцинаций: тест с газетой NYT
Модель получила изображение газеты New York Times от 21 июля 1969 года. Заголовок: «Men Walk On Moon». Слоган: «All the News That's Fit to Print». Цена: 10 центов. Kimi K3 верно идентифицировала все элементы, корректно описала контекст и не добавила вымышленных деталей.
Значение теста: даже после сжатия до 3 бит модель сохраняет мультимодальные способности и фактическую точность. Катастрофической деградации качества не произошло. Ограничение: тест проведён на одном примере. Общая надёжность квантизированной версии на сложных промптах и длинных контекстах не подтверждена независимыми бенчмарками.
Экономика CPU-инференса: когда 4 t/s лучше, чем 100 t/s на GPU
Сравнение затрат: сервер с 1,5 ТБ ОЗУ ($50-100k) против кластера 64 H200 ($1-3M). Разница в капитальных затратах - 20-30 раз. Энергопотребление: ~550 Вт против ~45 кВт. Годовая стоимость электричества при цене $0,1/кВт·ч: ~$480 против ~$39 400. CPU-инференс выигрывает по всем экономическим показателям, кроме одного - производительности.
Сценарии, где CPU-инференс оправдан: разовые эксперименты с моделью, офлайн-обработка данных (ночная пакетная генерация), задачи без требований к latency. Сценарии, где GPU необходим: интерактивные приложения, высоконагруженные сервисы, real-time системы. Бенчмарк Kimi K3 на RTX 6000 PRO 96GB показал скорость 0,23 tok/s - даже GPU-инференс этой модели сложен без кластеризации.
Сравнение с меньшими моделями: а нужна ли вообще Kimi K3?
Llama 3 70B на одной A100 даёт 50+ t/s при качестве, близком к топовым моделям. Стоимость такой системы - $15-20 тысяч. Это на порядок дешевле CPU-сервера для Kimi K3. Для 95% практических задач меньшая модель на GPU предпочтительнее: быстрее, дешевле, проще в развёртывании.
Kimi K3 оправдана в сценариях, где нужны уникальные способности: энциклопедические знания, длинный контекст до 1 млн токенов, мультимодальность. Примеры: анализ многотысячных юридических документов, обработка полных кодовых баз, задачи, где меньшие модели теряют связность на длинных дистанциях. В этих случаях 4,21 t/s - приемлемая плата за качество. Практическое руководство по конвертации и запуску Kimi K3 в llama.cpp поможет начать тестирование.
Как повторить эксперимент: файлы, инструменты, инструкции
Исходные веса Kimi K3 в формате MXFP4 доступны на Hugging Face. Квантизированная версия GGUF Q3_K_S от Atomic Chat также опубликована - ссылки ведут на репозитории сообщества. Инструмент для инференса: llama.cpp. Минимальные требования: CPU с поддержкой AVX2, 1,5 ТБ ОЗУ, быстрый NVMe-массив. Загрузка модели в память и первый инференс займут десятки минут. Требуется стабильное питание и охлаждение - 360 Вт TDP процессора плюс нагрев модулей ОЗУ.
Параметры запуска: количество потоков (110 для EPYC 9554P), размер контекста (512 токенов в тесте), путь к файлу модели. Конфигурация llama.cpp для MoE-моделей имеет особенности: параметры n-cpu-moe, настройки mmap. Анализ требований Kimi K3 к памяти GPU даёт контекст для понимания, почему CPU-инференс вообще стал необходим.
Тонкости запуска: подбор потоков и управление памятью
110 потоков для EPYC 9554P - эмпирический оптимум. Полная загрузка всех 128 логических ядер приводит к троттлингу и падению производительности. Рекомендация: начинать с числа физических ядер (64) и увеличивать с шагом 8-16, замеряя скорость.
NUMA-настройки критичны для равномерного доступа к памяти. 1,5 ТБ ОЗУ распределены по 12 каналам - привязка потоков к конкретным NUMA-узлам снижает задержки. Использование huge pages (1 ГБ или 2 МБ) уменьшает количество TLB miss и повышает пропускную способность памяти на 5-15%.
Ограничения и риски: что осталось за кадром
Скорость 4,21 t/s - это медленно для диалоговых систем. Пользователь ждёт ответа 30-60 секунд на типичный запрос. Для сравнения: GPT-4-level модели на GPU выдают 50-100 t/s. Потребление памяти: 1,5 ТБ ОЗУ - экзотика. Большинство серверов имеют 256-512 ГБ. Отсутствие бенчмарков на стандартных задачах (MMLU, HumanEval) для квантизированной версии не позволяет объективно оценить потерю точности. Тест с газетой - качественный, но единичный.
Возможные артефакты квантизации: потеря точности на сложных промптах, деградация на длинных контекстах, нестабильность генерации. Модель может работать хуже на задачах, требующих тонкого понимания нюансов. Это не исследовано.
Почему 512 токенов контекста - это мало для 2026 года
Современные задачи - анализ документов, кодовых баз, длинных диалогов - требуют десятков тысяч токенов. 512 токенов покрывают 1-2 абзаца текста. Модель заявлена с поддержкой 1 млн токенов, но тестирование на 512 токенах не показывает поведение на длинных дистанциях. При масштабировании контекста до 32k токенов скорость на CPU упадёт до <1 t/s из-за квадратичного роста вычислений внимания. GPU обрабатывают длинный контекст эффективнее благодаря параллелизму.
Выводы: CPU-инференс для гигантских моделей - нишевый инструмент, а не замена GPU
Квантизация Kimi K3 в GGUF Q3_K_S - впечатляющий технический эксперимент. Atomic Chat доказали: модель масштаба 2,8T можно запустить на CPU с сохранением когерентности. Практическая ценность ограничена: 4,21 t/s недостаточно для интерактивной работы, 1,5 ТБ ОЗУ - высокий порог входа.
Для большинства задач разумнее использовать меньшие модели на GPU. CPU-инференс Kimi K3 оправдан в узких сценариях: нужна именно эта модель с её уникальными знаниями и длинным контекстом, а бюджет на GPU-кластер отсутствует. Это нишевый инструмент для исследований, офлайн-обработки и экспериментов.
Сообществу предстоит протестировать квантизированную версию на стандартных бенчмарках, длинных контекстах и сложных промптах. Результаты этих тестов определят, станет ли CPU-инференс гигантских моделей рабочим инструментом или останется демонстрацией возможностей.