Перейти к содержанию
Публикация AiManual

MiMo V2.6 9B Distill RL: где искать RL-чекпоинт и что реально известно о релизе

RL-чекпоинт MiMo V2.6 9B Distill RL публично не подтверждён: разбираем, что известно об SFT-версии MiMo V2.6 Distill Qwen 9B от Xiaomi MiMo, чем SFT отличается

Коротко

Что будет в материале

  1. 01

    Коротко: есть ли RL-чекпоинт MiMo V2.6 9B Distill RL

  2. 02

    Почему RL-чекпоинт мог не появиться в открытом доступе

  3. 03

    Где искать чекпоинты MiMo V2.6 и подобных моделей

  4. 04

    На что смотреть при выборе файлов и квантизаций

Публично подтверждённого RL-чекпоинта MiMo V2.6 9B Distill RL нет. Автор публикации в r/LocalLLaMA написал, что собирался протестировать модель, но не смог найти RL-чекпоинт, и в самом сообщении не указано ни имя репозитория, ни файл весов (обсуждение в сообществе). Это вопрос сообщества, а не релиз.

При этом подтверждённо существует MiMo V2.6 Distill Qwen 9B: 9B агентная модель от Xiaomi MiMo, созданная через supervised fine-tuning модели Qwen3.5-9B на данных, сгенерированных MiMo (каталог моделей). Её выпустили как SFT-чекпоинт для открытых исследований в области агентного RL. Разница принципиальная: доступна база, поверх которой RL-этап только предполагается, а не результат этого этапа.

Ещё одна деталь, которую легко пропустить. Название из вопроса (MiMo V2.6 9B Distill RL) и имя доступной модели (MiMo V2.6 Distill Qwen 9B) различаются. Считать их одной и той же моделью без подтверждения от разработчика нельзя.

Коротко: есть ли RL-чекпоинт MiMo V2.6 9B Distill RL

Официального анонса RL-версии нет. Нет и подтверждённой даты выхода, характеристик, размера контекста или ссылок на скачивание. Всё, что можно утверждать сейчас, сводится к одной строке: искомый RL-чекпоинт на момент публикации исходного сообщения не найден.

Что подтверждено, а что нет

УтверждениеСтатус
Существует отдельный RL-чекпоинт MiMo V2.6 9B Distill RLНе подтверждено
Известна дата релиза RL-версииНет данных
Есть рабочая ссылка на RL-весаНе найдена
Существует MiMo V2.6 Distill Qwen 9B от Xiaomi MiMoПодтверждено
База: Qwen3.5-9B, дообученная на данных MiMoПодтверждено
Релиз оформлен как SFT-чекпоинт для исследований агентного RLПодтверждено
Лицензия MIT, теги safetensors и code, pipeline image-text-to-textПодтверждено
Смесь SFT-данных объёмом 77,4 млрд токенов и результаты оценки в карточкеПодтверждено

Данные по лицензии, тегам, pipeline и объёму обучающей смеси взяты из карточки модели (описание MiMo V2.6 Distill Qwen 9B). Ни одна из этих характеристик не относится к RL-версии: они описывают SFT-релиз.

Строка «SFT-чекпоинт для открытых исследований агентного RL» говорит о назначении релиза, а не о наличии RL-весов. Веса после SFT означают, что RL-этап кому-то придётся провести самому. Именно поэтому вопрос «где RL-чекпоинт» пока остаётся без ответа.

И обратное утверждение тоже неверно. Говорить, что RL-версия не выйдет никогда, не на чем: в доступных материалах нет ни подтверждения, ни опровержения. Корректная формулировка одна: официальных данных о релизе RL-чекпоинта MiMo V2.6 9B Distill RL нет.

Почему RL-чекпоинт мог не появиться в открытом доступе

Цепочка обучения агентной модели обычно выглядит так: base → distill → SFT → RL. Base отвечает за общие языковые способности, дистилляция переносит поведение крупной модели в компактную, SFT закрепляет формат ответов на размеченных примерах, RL оптимизирует поведение по наградам. MiMo V2.6 Distill Qwen 9B остановилась на SFT-шаге и позиционируется как база для исследований агентного RL (карточка модели).

Чем SFT-чекпоинт отличается от RL-чекпоинта

SFT учит модель повторять желаемое поведение по готовым парам «запрос - ответ». Примеры готовят люди или более сильная модель, веса подстраиваются под этот стиль. Результат предсказуем, воспроизводим и проверяется на отложенной выборке.

RL работает иначе. Модель пробует разные варианты, получает оценку от reward-модели или среды и постепенно смещает вероятности в сторону действий с высоким вознаграждением. Для агентных задач разница заметна: многошаговые сценарии с вызовами инструментов плохо описываются готовыми примерами, зато хорошо оптимизируются наградами. Есть и цена: RL-чекпоинт обычно лучше следует инструкциям, но ведёт себя менее предсказуемо и хуже воспроизводится.

Практический вывод простой. Доступная MiMo V2.6 Distill Qwen 9B не проходила RL-этап в опубликованных весах, и ждать от неё поведения RL-версии не стоит.

Почему веса RL-версий публикуют не всегда

Причин несколько, и они редко связаны с желанием что-то скрыть:

  • RL-этап опирается на reward-модель и среду, которые не всегда можно выложить вместе с весами;
  • многоступенчатый workflow сложно воспроизвести на чужом железе;
  • часть пайплайна зависит от внешних хостируемых сервисов, а не от локального кода;
  • лицензионные и юридические ограничения на данные, использованные для награды;
  • риски злоупотребления для моделей, усиленных под агентные и кибербезопасностные задачи;
  • инфраструктура: полный RL-прогон дороже и дольше, чем SFT.

Наглядный пример общей практики есть в другом проекте: компонент H3-Context-IR не включили в открытый релиз, потому что он зависит от многоступенчатого workflow и нескольких хостируемых моделей и сервисов (карточка на Hugging Face). Это иллюстрация подхода, а не доказательство того, что причина у MiMo именно такая.

Где искать чекпоинты MiMo V2.6 и подобных моделей

Искать стоит в четырёх местах: Hugging Face, официальные каналы разработчика (Xiaomi MiMo), GitHub-репозитории проекта и зеркала вроде ModelScope. Обсуждения в сообществах полезны как сигнал, но не как источник ссылок.

Hugging Face: как искать правильно

  1. Введите точное имя MiMo V2.6 Distill Qwen 9B, а не сокращение из вопроса.
  2. Проверьте автора репозитория: официальный аккаунт разработчика или сторонний пользователь.
  3. Отфильтруйте по тегам safetensors и code, посмотрите pipeline tag image-text-to-text.
  4. Отсортируйте по дате обновления и откройте вкладку Files: config.json, tokenizer, список весов.
  5. Прочитайте карточку целиком, ищите упоминания RL, reward-моделей и инструкций по дообучению.
  6. Проверьте, есть ли готовые квантизации: GGUF, AWQ, GPTQ.

Если в репозитории лежит только SFT-чекпоинт, RL-версии там нет. Обратное неверно: отсутствие «RL» в названии не доказывает отсутствие RL-весов, но и считать их существующими без подтверждения нельзя.

Полезно заранее понимать, как вообще устроены открытые релизы 2026 года и какие форматы весов публикуют вместе с моделью, чтобы отличать полный релиз от частичного (разбор свежих open-weights релизов).

Зеркала и альтернативные площадки

ModelScope, GitHub Releases и страницы исследовательских лабораторий иногда появляются раньше или позже основного репозитория. На зеркалах чаще встречаются неофициальные загрузки: проверяйте лицензию (у известного SFT-релиза MiMo это MIT), сверяйте хеши файлов и не запускайте бинарники из непроверенных источников.

Быстрый чек-лист безопасности перед скачиванием:

  • совпадает ли имя репозитория с официальным;
  • указана ли лицензия и совпадает ли она с исходной;
  • есть ли хеши или контрольные суммы файлов;
  • обновлялся ли репозиторий после даты официального релиза;
  • нет ли в файлах исполняемых скриптов, которых не было в оригинале.

На что смотреть при выборе файлов и квантизаций

Форматов три группы, и выбирают их по железу, а не по привычке:

  • safetensors - оригинальные веса. Нужны для полного fine-tuning, конвертации или запуска через vLLM и подобные серверы.
  • GGUF - формат для llama.cpp и совместимых рантаймов. Работает на CPU и в гибридном режиме CPU+GPU, удобен на машинах без большой видеопамяти.
  • AWQ и GPTQ - квантизованные веса под GPU-инференс, когда VRAM достаточно, а скорость важна.

Квантизации для локального запуска 9B

ТочностьОриентир по памяти под весаКомментарий
FP16около 18 ГБПолная точность, нужна серьёзная карта
8-bitоколо 9-10 ГБКомпромисс между качеством и памятью
4-bit (Q4_K_M, AWQ)около 5-7 ГБСамый популярный вариант для домашнего железа

Цифры приблизительные и относятся к весам: контекстное окно и KV-cache добавляют памяти сверху, и тем больше, чем длиннее контекст. Реальные требования зависят от реализации, батча и длины промпта, поэтому проверяйте их на своей сборке.

Для агентных задач ниже Q4 опускаться рискованно: многошаговые сценарии с вызовом инструментов прощают ошибки хуже, чем одиночные вопросы, и деградация проявляется именно на длинных цепочках. Как выглядят агрессивные квантизации для агентного кодинга на слабом железе, разобрано в отдельном материале про 4B-квант под машины с 16 ГБ RAM.

Если цель - запуск на ноутбуке или смартфоне, логика выбора другая: там решают размер контекста и способ компактификации истории диалога (практические сценарии локальных LLM на мобильных).

Что делать, если RL-чекпоинт так и не найден

Вариантов четыре, и они не равнозначны по трудозатратам.

  1. Использовать доступный SFT-чекпоинт как есть.
  2. Провести RL-этап самостоятельно: PPO, GRPO и родственные методы требуют reward-модели, среды и вычислительных ресурсов.
  3. Следить за официальными каналами Xiaomi MiMo и обновлениями репозитория на Hugging Face.
  4. Посмотреть на альтернативные агентные модели схожего размера, если задача не терпит ожидания.

Использовать SFT-версию как основу

MiMo V2.6 Distill Qwen 9B нацелена на кодинг, общие агентные задачи, визуальный кодинг и кибербезопасность, а лицензия MIT разрешает использование и модификацию. Для многих задач SFT-версии достаточно, особенно если речь о локальном эксперименте, а не о продакшене. Держите в голове ограничение: поведение SFT-модели и RL-модели отличается, и переносить ожидания с одной на другую не стоит.

Самостоятельный RL - не быстрый путь. Нужны стабильная среда с инструментами, метрика награды и как минимум один прогон, который может занять дни. Если ресурсов нет, практичнее подождать официального релиза или взять модель, у которой RL-этап уже пройден.

Итог: что известно и что делать

RL-чекпоинт MiMo V2.6 9B Distill RL на момент публикации исходного сообщения не найден и официально не подтверждён. Подтверждён другой артефакт: MiMo V2.6 Distill Qwen 9B от Xiaomi MiMo на базе Qwen3.5-9B, выпущенная как SFT-чекпоинт для открытых исследований агентного RL, под лицензией MIT, с 77,4 млрд токенов в SFT-смеси и опубликованными результатами оценки.

Что сделать прямо сейчас: найти на Hugging Face точное имя MiMo V2.6 Distill Qwen 9B, проверить автора, теги, лицензию и наличие квантизаций, скачать подходящий формат под свою VRAM и протестировать агентные сценарии на своих задачах. Параллельно держать открытой страницу модели и следить за официальными анонсами. Слухи о дате выхода RL-версии распространять не стоит: подтверждений у них нет.

Подписаться на канал