Публично подтверждённого RL-чекпоинта MiMo V2.6 9B Distill RL нет. Автор публикации в r/LocalLLaMA написал, что собирался протестировать модель, но не смог найти RL-чекпоинт, и в самом сообщении не указано ни имя репозитория, ни файл весов (обсуждение в сообществе). Это вопрос сообщества, а не релиз.
При этом подтверждённо существует MiMo V2.6 Distill Qwen 9B: 9B агентная модель от Xiaomi MiMo, созданная через supervised fine-tuning модели Qwen3.5-9B на данных, сгенерированных MiMo (каталог моделей). Её выпустили как SFT-чекпоинт для открытых исследований в области агентного RL. Разница принципиальная: доступна база, поверх которой RL-этап только предполагается, а не результат этого этапа.
Ещё одна деталь, которую легко пропустить. Название из вопроса (MiMo V2.6 9B Distill RL) и имя доступной модели (MiMo V2.6 Distill Qwen 9B) различаются. Считать их одной и той же моделью без подтверждения от разработчика нельзя.
Коротко: есть ли RL-чекпоинт MiMo V2.6 9B Distill RL
Официального анонса RL-версии нет. Нет и подтверждённой даты выхода, характеристик, размера контекста или ссылок на скачивание. Всё, что можно утверждать сейчас, сводится к одной строке: искомый RL-чекпоинт на момент публикации исходного сообщения не найден.
Что подтверждено, а что нет
| Утверждение | Статус |
|---|---|
| Существует отдельный RL-чекпоинт MiMo V2.6 9B Distill RL | Не подтверждено |
| Известна дата релиза RL-версии | Нет данных |
| Есть рабочая ссылка на RL-веса | Не найдена |
| Существует MiMo V2.6 Distill Qwen 9B от Xiaomi MiMo | Подтверждено |
| База: Qwen3.5-9B, дообученная на данных MiMo | Подтверждено |
| Релиз оформлен как SFT-чекпоинт для исследований агентного RL | Подтверждено |
| Лицензия MIT, теги safetensors и code, pipeline image-text-to-text | Подтверждено |
| Смесь SFT-данных объёмом 77,4 млрд токенов и результаты оценки в карточке | Подтверждено |
Данные по лицензии, тегам, pipeline и объёму обучающей смеси взяты из карточки модели (описание MiMo V2.6 Distill Qwen 9B). Ни одна из этих характеристик не относится к RL-версии: они описывают SFT-релиз.
Строка «SFT-чекпоинт для открытых исследований агентного RL» говорит о назначении релиза, а не о наличии RL-весов. Веса после SFT означают, что RL-этап кому-то придётся провести самому. Именно поэтому вопрос «где RL-чекпоинт» пока остаётся без ответа.
И обратное утверждение тоже неверно. Говорить, что RL-версия не выйдет никогда, не на чем: в доступных материалах нет ни подтверждения, ни опровержения. Корректная формулировка одна: официальных данных о релизе RL-чекпоинта MiMo V2.6 9B Distill RL нет.
Почему RL-чекпоинт мог не появиться в открытом доступе
Цепочка обучения агентной модели обычно выглядит так: base → distill → SFT → RL. Base отвечает за общие языковые способности, дистилляция переносит поведение крупной модели в компактную, SFT закрепляет формат ответов на размеченных примерах, RL оптимизирует поведение по наградам. MiMo V2.6 Distill Qwen 9B остановилась на SFT-шаге и позиционируется как база для исследований агентного RL (карточка модели).
Чем SFT-чекпоинт отличается от RL-чекпоинта
SFT учит модель повторять желаемое поведение по готовым парам «запрос - ответ». Примеры готовят люди или более сильная модель, веса подстраиваются под этот стиль. Результат предсказуем, воспроизводим и проверяется на отложенной выборке.
RL работает иначе. Модель пробует разные варианты, получает оценку от reward-модели или среды и постепенно смещает вероятности в сторону действий с высоким вознаграждением. Для агентных задач разница заметна: многошаговые сценарии с вызовами инструментов плохо описываются готовыми примерами, зато хорошо оптимизируются наградами. Есть и цена: RL-чекпоинт обычно лучше следует инструкциям, но ведёт себя менее предсказуемо и хуже воспроизводится.
Практический вывод простой. Доступная MiMo V2.6 Distill Qwen 9B не проходила RL-этап в опубликованных весах, и ждать от неё поведения RL-версии не стоит.
Почему веса RL-версий публикуют не всегда
Причин несколько, и они редко связаны с желанием что-то скрыть:
- RL-этап опирается на reward-модель и среду, которые не всегда можно выложить вместе с весами;
- многоступенчатый workflow сложно воспроизвести на чужом железе;
- часть пайплайна зависит от внешних хостируемых сервисов, а не от локального кода;
- лицензионные и юридические ограничения на данные, использованные для награды;
- риски злоупотребления для моделей, усиленных под агентные и кибербезопасностные задачи;
- инфраструктура: полный RL-прогон дороже и дольше, чем SFT.
Наглядный пример общей практики есть в другом проекте: компонент H3-Context-IR не включили в открытый релиз, потому что он зависит от многоступенчатого workflow и нескольких хостируемых моделей и сервисов (карточка на Hugging Face). Это иллюстрация подхода, а не доказательство того, что причина у MiMo именно такая.
Где искать чекпоинты MiMo V2.6 и подобных моделей
Искать стоит в четырёх местах: Hugging Face, официальные каналы разработчика (Xiaomi MiMo), GitHub-репозитории проекта и зеркала вроде ModelScope. Обсуждения в сообществах полезны как сигнал, но не как источник ссылок.
Hugging Face: как искать правильно
- Введите точное имя MiMo V2.6 Distill Qwen 9B, а не сокращение из вопроса.
- Проверьте автора репозитория: официальный аккаунт разработчика или сторонний пользователь.
- Отфильтруйте по тегам safetensors и code, посмотрите pipeline tag image-text-to-text.
- Отсортируйте по дате обновления и откройте вкладку Files: config.json, tokenizer, список весов.
- Прочитайте карточку целиком, ищите упоминания RL, reward-моделей и инструкций по дообучению.
- Проверьте, есть ли готовые квантизации: GGUF, AWQ, GPTQ.
Если в репозитории лежит только SFT-чекпоинт, RL-версии там нет. Обратное неверно: отсутствие «RL» в названии не доказывает отсутствие RL-весов, но и считать их существующими без подтверждения нельзя.
Полезно заранее понимать, как вообще устроены открытые релизы 2026 года и какие форматы весов публикуют вместе с моделью, чтобы отличать полный релиз от частичного (разбор свежих open-weights релизов).
Зеркала и альтернативные площадки
ModelScope, GitHub Releases и страницы исследовательских лабораторий иногда появляются раньше или позже основного репозитория. На зеркалах чаще встречаются неофициальные загрузки: проверяйте лицензию (у известного SFT-релиза MiMo это MIT), сверяйте хеши файлов и не запускайте бинарники из непроверенных источников.
Быстрый чек-лист безопасности перед скачиванием:
- совпадает ли имя репозитория с официальным;
- указана ли лицензия и совпадает ли она с исходной;
- есть ли хеши или контрольные суммы файлов;
- обновлялся ли репозиторий после даты официального релиза;
- нет ли в файлах исполняемых скриптов, которых не было в оригинале.
На что смотреть при выборе файлов и квантизаций
Форматов три группы, и выбирают их по железу, а не по привычке:
- safetensors - оригинальные веса. Нужны для полного fine-tuning, конвертации или запуска через vLLM и подобные серверы.
- GGUF - формат для llama.cpp и совместимых рантаймов. Работает на CPU и в гибридном режиме CPU+GPU, удобен на машинах без большой видеопамяти.
- AWQ и GPTQ - квантизованные веса под GPU-инференс, когда VRAM достаточно, а скорость важна.
Квантизации для локального запуска 9B
| Точность | Ориентир по памяти под веса | Комментарий |
|---|---|---|
| FP16 | около 18 ГБ | Полная точность, нужна серьёзная карта |
| 8-bit | около 9-10 ГБ | Компромисс между качеством и памятью |
| 4-bit (Q4_K_M, AWQ) | около 5-7 ГБ | Самый популярный вариант для домашнего железа |
Цифры приблизительные и относятся к весам: контекстное окно и KV-cache добавляют памяти сверху, и тем больше, чем длиннее контекст. Реальные требования зависят от реализации, батча и длины промпта, поэтому проверяйте их на своей сборке.
Для агентных задач ниже Q4 опускаться рискованно: многошаговые сценарии с вызовом инструментов прощают ошибки хуже, чем одиночные вопросы, и деградация проявляется именно на длинных цепочках. Как выглядят агрессивные квантизации для агентного кодинга на слабом железе, разобрано в отдельном материале про 4B-квант под машины с 16 ГБ RAM.
Если цель - запуск на ноутбуке или смартфоне, логика выбора другая: там решают размер контекста и способ компактификации истории диалога (практические сценарии локальных LLM на мобильных).
Что делать, если RL-чекпоинт так и не найден
Вариантов четыре, и они не равнозначны по трудозатратам.
- Использовать доступный SFT-чекпоинт как есть.
- Провести RL-этап самостоятельно: PPO, GRPO и родственные методы требуют reward-модели, среды и вычислительных ресурсов.
- Следить за официальными каналами Xiaomi MiMo и обновлениями репозитория на Hugging Face.
- Посмотреть на альтернативные агентные модели схожего размера, если задача не терпит ожидания.
Использовать SFT-версию как основу
MiMo V2.6 Distill Qwen 9B нацелена на кодинг, общие агентные задачи, визуальный кодинг и кибербезопасность, а лицензия MIT разрешает использование и модификацию. Для многих задач SFT-версии достаточно, особенно если речь о локальном эксперименте, а не о продакшене. Держите в голове ограничение: поведение SFT-модели и RL-модели отличается, и переносить ожидания с одной на другую не стоит.
Самостоятельный RL - не быстрый путь. Нужны стабильная среда с инструментами, метрика награды и как минимум один прогон, который может занять дни. Если ресурсов нет, практичнее подождать официального релиза или взять модель, у которой RL-этап уже пройден.
Итог: что известно и что делать
RL-чекпоинт MiMo V2.6 9B Distill RL на момент публикации исходного сообщения не найден и официально не подтверждён. Подтверждён другой артефакт: MiMo V2.6 Distill Qwen 9B от Xiaomi MiMo на базе Qwen3.5-9B, выпущенная как SFT-чекпоинт для открытых исследований агентного RL, под лицензией MIT, с 77,4 млрд токенов в SFT-смеси и опубликованными результатами оценки.
Что сделать прямо сейчас: найти на Hugging Face точное имя MiMo V2.6 Distill Qwen 9B, проверить автора, теги, лицензию и наличие квантизаций, скачать подходящий формат под свою VRAM и протестировать агентные сценарии на своих задачах. Параллельно держать открытой страницу модели и следить за официальными анонсами. Слухи о дате выхода RL-версии распространять не стоит: подтверждений у них нет.