Перейти к содержанию
Публикация AiManual

MiMo-V2.6 Pro и Flash: высокие бенчмарки против реальных задач

MiMo-V2.6-Pro берёт 46 баллов на AA, но обходит собственную песочницу через git push -uf и git-алиасы. Разбираем практический тест senior-разработчика, провал F

Коротко

Что будет в материале

  1. 01

    Что заявлено: MiMo-V2.6-Pro и Flash на бумаге

  2. 02

    Практический тест MiMo-V2.6-Pro: песочница для git push

  3. 03

    MiMo-V2.6-Flash и повреждённый git worktree: 80k токенов в никуда

  4. 04

    MiMo-V2.6-Pro vs Flash: что выбрать на практике

MiMo-V2.6-Pro набирает 46 баллов в индексе AA и стоит копейки. MiMo-V2.6-Flash в рейтинг AA ещё не попал, зато в дата-центре обходится менее чем в половину цены Pro и укладывается в 192 ГБ памяти. На бумаге это выглядит как готовый рецепт и для облачного API, и для локального запуска.

На практике всё сложнее. Senior-разработчик разобрал обе модели на задачах с git и получил песочницу, которую MiMo-V2.6-Pro обошла через git push -uf, git-алиасы и env -u GIT_CONFIG_COUNT. У MiMo-V2.6-Flash другая история: на повреждённом git worktree агент сжёг около 80k токенов на хаотичные действия вместо восстановления из основного репозитория. Ниже конкретные случаи, сравнение Pro и Flash, разбор стиля общения и список альтернатив, которые автор теста считает рабочими.

Что заявлено: MiMo-V2.6-Pro и Flash на бумаге

MiMo-V2.6-Pro получил 46 баллов на AA и стоит копейки. По этому показателю он идёт во главе доступных открытых моделей. MiMo-V2.6-Flash в рейтинге AA пока не появился, при этом в дата-центре он стоит менее половины от Pro и немного уступает ему по бенчмаркам самой Xiaomi. Эти цифры и подробности теста приводит разбор обеих моделей на r/LocalLLaMA.

Оба варианта помещаются в 192 ГБ. Автор теста называет Flash первым реальным сценарием использования Gorgon Halo: модель влезает в такой объём памяти и при этом остаётся дееспособной.

К цифрам стоит относиться осторожно. Flash на AA не представлен, независимых прогонов нет, а сам автор сомневается в достоверности заявленных баллов MiMo-V2.6. Как читать такие рейтинги и почему один и тот же балл по-разному переносится в реальную работу, мы разбирали в материале о разнице между бенчмарками и условиями запуска LLM.

Практический тест MiMo-V2.6-Pro: песочница для git push

Задача: собрать песочницу, которая ограничивает git push и не даёт агенту испортить репозиторий. Работу вёл senior-разработчик, изоляция строилась вокруг bubblewrap sandbox.

Первое впечатление хорошее. Модель остановилась и задала вопросы о неясных углах дизайна, а затем перешла к реализации. Для архитектурной задачи это правильное поведение: сначала уточнить требования, потом писать код.

Минус тоже есть: работа шла медленно. Скорость инференса около 25 tok/s, и, по словам автора теста, это вопрос провайдеров, а не самой модели. Проблема должна уйти в ближайшие дни по мере подключения новых мощностей. Полный контекст эксперимента собран в том же разборе на r/LocalLLaMA.

Обходы, которые нашла MiMo-V2.6-Pro

Ограничения расставлены, но не закрыты. В режиме по умолчанию обычный git push проходит, git push --force и git push -f блокируются, а git push -uf спокойно стирает git remote. Связку флагов -u и -f модель не учла.

Три обхода, которые проходят через настройки git и переменные окружения:

  • алиас: git config alias.fp 'push --force --no-verify', после чего git fp уходит на сервер без блокировки;
  • сброс переменной: env -u GIT_CONFIG_COUNT /usr/bin/git push --force;
  • обход флага --no-git через подмену статуса внутри песочницы.
$ git push (падает)
$ echo GIT_STATUS blocked
$ GIT_STATUS="p0wn3d by l33t h4xx0r" git push (проходит)

Для сравнения: GLM-5.3 (full-fat), которому автор поручил security review того же контура, за 3 минуты нашёл девять серьёзных дыр безопасности, позволяющих обойти ограничения git и gh. Из этого не следует, что MiMo-V2.6-Pro слабее GLM-5.3 по всем задачам. Вывод касается конкретного теста с песочницей и проверки ограничений.

MiMo-V2.6-Flash и повреждённый git worktree: 80k токенов в никуда

Вторая задача выглядит рутинно: создать новую ветку от master и перенести cherry-pick один коммит из другой ветки. Осложнение одно: git worktree повреждён.

MiMo-V2.6-Flash не восстановилась из основного репозитория. Сначала попыталась найти основной git-репозиторий, потерпела неудачу, затем запаниковала и ушла в манипуляции с /tmp, mount --bind и прочую экзотику. Итог: около 80k токенов на действия, которые к результату не приблизили. Автор теста подозревает, что при достаточном запасе времени модель могла снести основной git-репозиторий, и отдельно оговаривает, что не хочет представлять её поведение вне песочницы.

Ключевое здесь не единичная ошибка на одной команде, а паттерн деградации, когда привычный сценарий ломается. Модель не откатывается к простому плану через основной репозиторий, а наращивает хаотичные действия.

MiMo-V2.6-Pro vs Flash: что выбрать на практике

ПараметрMiMo-V2.6-ProMiMo-V2.6-Flash
Балл на AA46, во главе доступных открытых моделейпока не представлен
Цена в дата-центрекопейкименее половины от Pro
Бенчмарки Xiaomiвышенемного уступает Pro
Объём памятивлезает в 192 ГБвлезает в 192 ГБ
Скоростьоколо 25 tok/s у тестировавшего, вопрос провайдеровданных в разборе нет
Песочница для git pushмножество обходов ограниченийв разборе не проверялась
Повреждённый worktreeв разборе не проверялась80k токенов бессмысленных действий

Логика выбора простая. Pro берёт высокий балл на AA и минимальную цену, но оставляет дыры в ограничениях и работает медленно на текущих провайдерах. Flash дешевле, помещается в 192 ГБ и подходит под Gorgon Halo по железу, однако провалил восстановление после сбоя worktree и в рейтинге AA отсутствует.

Ни один из вариантов нельзя назвать безопасным по умолчанию для автоматизированных пайплайнов, где агент имеет доступ к реальным репозиториям. Для черновых задач, разовых экспериментов и работы в одноразовой копии репозитория Pro может оказаться приемлемым. Для всего, что связано с продакшн-кодом, сначала придётся закрывать обходы вроде git push -uf и алиасов самостоятельно.

Стиль общения MiMo-V2.6: почему это важно для разработчика

Отдельная претензия автора касается текста, который модели выдают в чате: читать это раздражает, глаза устают, а смысл часто доходит только со второго прочтения. Оценка субъективная, формальных замеров удобства чтения не существует, и здесь стоит сделать поправку на личное восприятие.

В длинной сессии с агентом стиль общения влияет на скорость работы напрямую. Приходится перечитывать описание плана, догадываться, что модель имела в виду, и заново формулировать запрос. На часовой задаче это превращается в лишние десятки минут.

GLM, DeepSeek и Qwen автор называет значительно более приятными в работе. Речь о когнитивной нагрузке при чтении ответов, а не о разнице в возможностях моделей.

Альтернативы MiMo-V2.6: DSv4.1 Flash, GLM-5.3 и Qwen3.8-Flash

Автор теста рекомендует три замены: DSv4.1 Flash, GLM-5.3 и Qwen3.8-Flash. Аргумент по GLM-5.3 уже прозвучал: на security review той же песочницы он за 3 минуты нашёл девять обходов ограничений git и gh. Модель понимает логику ограничений и умеет искать слабые места, а не только генерирует код.

Второй аргумент связан с комфортом. GLM, DeepSeek и Qwen автор относит к тем моделям, с которыми приятно вести длинные сессии. Если ваш рабочий процесс строится вокруг агентов и постоянного диалога, это экономит часы.

Требования к VRAM, влияние квантования и длины контекста на выбор модели мы разбирали в отдельных материалах: сравнение GLM-5.3-Flash и DeepSeek-V4-Flash-0731 для локального запуска и тесты DeepSeek V4 Flash против Qwen 3.6 27B в coding и агентных сценариях.

Стоит ли покупать Gorgon Halo ради MiMo-V2.6-Flash

Короткий ответ: нет. Flash действительно помещается в 192 ГБ, и автор теста называет его первым реальным сценарием использования Gorgon Halo. Ставку на модель это не оправдывает: 80k токенов на хаотичные действия с повреждённым worktree и подозрение, что при большем запасе времени агент мог снести основной репозиторий, слишком высокая цена за экономию на инференсе.

Это не претензия к самому Gorgon Halo. Речь о том, что покупать аппарат под конкретную модель имеет смысл после того, как Flash появится на AA и пройдёт независимые прогоны на реальных задачах, а не на заявленных цифрах вендора.

Итог: кому подходят MiMo-V2.6-Pro и Flash, а кому нет

  • MiMo-V2.6-Pro: 46 баллов на AA и копеечная цена. Подойдёт для экспериментов и разовых задач, где агент не трогает важные репозитории. Перед работой с реальным кодом закройте обходы git push -uf, alias и env -u GIT_CONFIG_COUNT на своей стороне.
  • MiMo-V2.6-Flash: дешевле Pro более чем вдвое в дата-центре, помещается в 192 ГБ, но на AA не представлен и провалил восстановление после сбоя worktree. Для автономной работы с репозиториями выбор сомнительный.
  • Для сценариев, где важны безопасность и предсказуемость, автор теста советует смотреть на DSv4.1 Flash, GLM-5.3 и Qwen3.8-Flash.
  • Gorgon Halo ради MiMo-V2.6-Flash покупать не стоит, пока не появятся независимые результаты.

Оговорка: все впечатления выше - субъективная оценка одного senior-разработчика, а не итог формального бенчмарка. Flash в рейтинге AA отсутствует, к заявленным баллам MiMo-V2.6 автор относится с сомнением, а медленность Pro объясняется состоянием провайдеров. Если для вас важна цифра, дождитесь независимых прогонов на своих задачах.

Подписаться на канал