Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Unsloth начал выпуск GGUFs для Kimi K3: MXFP4 и mmproj уже доступны

Сообщество Unsloth опубликовало первые GGUFs для Kimi K3: MXFP4-версия на 1.5 ТБ и mmproj-файл уже доступны для скачивания. Пошаговое руководство по локальному

Коротко

Что будет в материале

  1. 01

    Что такое Kimi K3 и почему её GGUF - событие

  2. 02

    Что именно выложил Unsloth: MXFP4 и mmproj

  3. 03

    Требования к железу и первые оценки производительности

  4. 04

    Как запустить Kimi K3 локально: пошаговое руководство

Сообщество Unsloth опубликовало первые GGUFs для модели Kimi K3 от Moonshot AI. В репозитории уже доступны MXFP4-версия объёмом 1.5 ТБ и mmproj-файл. Это первый реальный шанс запустить флагманскую модель локально, не дожидаясь официального релиза полных весов, который был обещан к 27 июля 2026 года.

Релиз важен для разработчиков и исследователей, которые хотят оценить производительность Kimi K3 на собственном оборудовании. MXFP4-квантование снижает порог входа, но всё ещё требует серьёзных ресурсов. В этом разборе - что именно выложил Unsloth, как запустить модель и какие конфигурации железа справятся с 1.5 ТБ весов.

Что такое Kimi K3 и почему её GGUF - событие

Kimi K3 - флагманская модель Moonshot AI, выпущенная 16 июля 2026 года. Архитектура Mixture-of-Experts включает 896 экспертов, из которых 16 активны на каждый токен. Общее количество параметров - 2.8 трлн, контекстное окно - 1 млн токенов. Модель сразу после релиза установила рекорд на Hugging Face по количеству скачиваний и обсуждений.

Появление GGUFs от Unsloth - значимый шаг по нескольким причинам. Во-первых, это первая возможность локального инференса без привязки к облачному API. Во-вторых, Unsloth действует независимо от Moonshot AI, ускоряя доступ сообщества к модели. В-третьих, MXFP4-формат - это компромисс между размером файла и качеством генерации, который делает запуск Kimi K3 реальным на серверном оборудовании.

Контекст усиливается тем, что Moonshot AI обещала открыть полные веса к 27 июля 2026 года. На момент публикации GGUFs официальные веса ещё не вышли. Инициатива Unsloth заполняет этот временной разрыв и позволяет начать тестирование немедленно. Если вы следили за релизом весов Kimi K3, то знаете: требования к инференсу - главный барьер для большинства команд.

Что именно выложил Unsloth: MXFP4 и mmproj

Репозиторий unsloth/Kimi-K3-GGUF содержит два ключевых артефакта. Файлы загружены через upload-large-folder, что указывает на продолжение публикаций. Текущий состав релиза - это стартовый набор для текстового и мультимодального инференса.

MXFP4: компромисс между размером и точностью

MXFP4 - формат квантования с плавающей точкой, который использует 4 бита на вес. В отличие от целочисленных форматов вроде Q4_K_M или Q8_0, MXFP4 сохраняет динамический диапазон значений за счёт блочного масштабирования. Это даёт лучшее качество генерации при том же объёме памяти.

1.5 ТБ - это всё ещё много. Для сравнения, Q4_K_M-квант Llama-3-70B занимает около 40 ГБ. Разница в 37 раз объясняется масштабом Kimi K3: 2.8 трлн параметров против 70 млрд. Однако 1.5 ТБ - это уже достижимо на серверах с большим объёмом оперативной памяти. Ожидаемое влияние на качество: MXFP4 сохраняет около 95-98% точности от FP16-оригинала, что делает его практичным выбором для тестирования и прототипирования.

Unsloth выбрал MXFP4 как первый формат, поскольку он обеспечивает наилучшее соотношение размера и качества среди доступных методов сильного сжатия. Другие квантизации - Q4, Q8 - ожидаются в следующих обновлениях репозитория.

mmproj: ключ к мультимодальности

mmproj-файл содержит веса проекционного слоя, который преобразует эмбеддинги изображений в пространство, понятное языковой модели. Без него Kimi K3 работает только с текстом. С ним модель способна анализировать изображения, скриншоты и диаграммы.

В llama.cpp и совместимых движках mmproj подключается отдельным флагом при запуске. Модель загружает текстовые веса из основного GGUF-файла, а проекционные веса - из mmproj. Это стандартный подход, знакомый пользователям LLaVA и других мультимодальных моделей. Подробнее о конвертации и запуске нестандартных архитектур - в гайде по запуску Kimi K3 в llama.cpp.

Требования к железу и первые оценки производительности

1.5 ТБ - это только размер файла с весами. В рантайме потребуется дополнительная память под кэш ключей и значений, буферы инференса и системные накладные расходы. Реальный объём RAM или VRAM будет на 10-15% больше.

Минимальные и рекомендуемые конфигурации

СценарийRAMVRAMОжидаемая скорость
CPU-only (DDR5)2 ТБ-0.5-1 токен/с
4x A100 80GB512 ГБ320 ГБ5-8 токенов/с
8x H100 80GB1 ТБ640 ГБ15-20 токенов/с

Цифры оценочные, основанные на известных характеристиках MXFP4-инференса для моделей схожего масштаба. Точные бенчмарки появятся после первых запусков сообществом.

Потребительские GPU не справятся с этой задачей. Даже RTX 4090 с 24 ГБ VRAM не вместит 1/60 часть весов. Единственный реальный путь для небольших команд - CPU-only инференс на сервере с 2 ТБ RAM. Это медленно, но работает. Компании с доступом к кластерам A100 или H100 получат интерактивную скорость.

Дисковые требования: 1.5 ТБ свободного места, желательно NVMe SSD для ускорения загрузки весов в память. На HDD процесс загрузки займёт часы.

Как запустить Kimi K3 локально: пошаговое руководство

Инструкция предполагает, что у вас уже настроен llama.cpp или совместимый движок. Если нет - начните с установки актуальной версии из официального репозитория.

Загрузка файлов из репозитория Unsloth

Репозиторий доступен на Hugging Face: unsloth/Kimi-K3-GGUF. Для загрузки 1.5 ТБ используйте git-lfs с настройкой параллельных потоков:

GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/unsloth/Kimi-K3-GGUF
cd Kimi-K3-GGUF
git lfs pull --include="*.gguf" --include="*.mmproj"

Альтернативный вариант - huggingface_hub с возобновлением при обрыве соединения. Учитывайте, что загрузка на скорости 1 Гбит/с займёт около 3.5 часов.

Примеры команд для запуска

Текстовый режим:

./llama-cli -m Kimi-K3-MXFP4.gguf -p "Объясни архитектуру Mixture-of-Experts" -n 512 -t 64 -ngl 0

Мультимодальный режим:

./llama-llava-cli -m Kimi-K3-MXFP4.gguf --mmproj mmproj-Kimi-K3.gguf --image screenshot.png -p "Опиши содержимое изображения" -n 512

Флаг -ngl 0 означает CPU-only инференс. Если у вас есть GPU, увеличьте значение до количества слоёв, которые помещаются в VRAM. Типичные ошибки при запуске: нехватка памяти (следите за dmesg), несовместимость версии llama.cpp (используйте последний билд), отсутствие mmproj при попытке мультимодального режима.

Сравнение с официальным API и другими способами доступа

Локальный GGUF-запуск, официальный API Moonshot AI и полные веса через Hugging Face Transformers - три разных пути с разными компромиссами.

API даёт максимальную производительность без затрат на оборудование. Вы платите за токены, получаете скорость 50+ токенов/с и не думаете об инфраструктуре. Минус - данные уходят на внешний сервер. Для чувствительных проектов это неприемлемо.

Полные веса через Transformers - самый гибкий вариант. Вы контролируете каждый слой, можете файнтюнить и модифицировать модель. Но требования к памяти ещё выше, чем у MXFP4: FP16-оригинал занимает около 5.6 ТБ. Без кластера H100 запустить его невозможно.

GGUF от Unsloth занимает промежуточную позицию. Это локальный запуск с полным контролем над данными и приемлемым качеством. Цена - 1.5 ТБ памяти и невысокая скорость на CPU. Для тестирования, прототипирования и нечувствительных к задержке задач - оптимальный выбор. Первые тесты сообщества LocalLLaMA подтверждают, что модель работает стабильно, хотя и требует тщательной настройки параметров инференса - в обзоре первых тестов Kimi K3 собраны конфигурации и типичные проблемы.

Статус открытых весов и что будет дальше

Moonshot AI обещала открыть полные веса Kimi K3 к 27 июля 2026 года. На момент публикации GGUFs официального релиза нет. Инициатива Unsloth - это независимый проект, который не заменяет официальные веса, но даёт возможность начать работу раньше.

Что ожидать в ближайшее время:

  • Официальный релиз весов от Moonshot AI - предположительно в конце июля или начале августа 2026
  • Новые квантизации в репозитории Unsloth - Q4_K_M, Q8_0 и другие форматы для менее требовательных конфигураций
  • Появление инференс-провайдеров, предлагающих Kimi K3 через API по цене ниже официальной

Ситуация с открытием весов осложняется геополитическим контекстом. Санкционные ограничения США могут повлиять на доступность модели для пользователей из определённых регионов. Локальный GGUF-файл частично решает эту проблему: однажды скачанные веса не требуют доступа к внешним серверам. Подробный анализ причин задержки официальных весов - в статье почему Moonshot AI не открыла веса Kimi K3.

Работа с русским языком: первые впечатления

Kimi K3 обучалась на мультиязычном корпусе, и русский язык входит в число поддерживаемых. Мультиязычные бенчмарки модели показывают результаты на уровне GPT-4 для основных европейских языков, включая русский.

Ранние тесты сообщества на текстовых задачах подтверждают: модель генерирует грамматически правильный русский текст, понимает контекст и способна решать задачи вроде суммаризации и ответов на вопросы. Качество на русском не деградирует так сильно, как у моделей, обученных преимущественно на английском.

Проверить качество на своих задачах просто: запустите модель с приведёнными выше командами и подайте промпт на русском. Оцените связность, фактическую точность и стиль. Если вы работали с предыдущими версиями Kimi или аналогами - сравните результаты. Для structured-задач (код, JSON, таблицы) русский промпт работает наравне с английским.

Полноценные бенчмарки русскоязычной производительности Kimi K3 появятся после накопления достаточного количества тестов от сообщества. Пока что первые впечатления - модель пригодна для продакшен-задач на русском языке.

Подписаться на канал