Перейти к содержанию
Публикация AiManual

Alibaba не представила компактные MoE-модели Qwen: что это значит для локального запуска

Alibaba не выпустила компактную MoE-модель вместе с Qwen 3.8 и не анонсировала её на Apsara, но это наблюдение сообщества, а не официальное заявление. Разбираем

Коротко

Что будет в материале

  1. 01

    Что произошло: Alibaba и отсутствие компактной MoE-модели Qwen

  2. 02

    Что такое MoE-архитектура и почему о ней говорят

  3. 03

    Почему компактные MoE-модели важны для локального запуска

  4. 04

    Что доступно сейчас: линейка Qwen и Qwen3.8-27B

Что произошло: Alibaba и отсутствие компактной MoE-модели Qwen

22 сентября 2026 года в сабреддите r/LocalLLaMA появился тред «Did Alibaba abandon 35B A3B?». Повод конкретный: вместе с Qwen 3.8 не вышла новая MoE-модель, а на конференции Apsara компактные MoE-модели не показали. Первоисточник обсуждения.

Это не пресс-релиз Alibaba и не официальное заявление команды Qwen. Наблюдение сформулировал участник сообщества, который следит за релизами и сравнивает анонсы с ожиданиями. Граница между фактом и ожиданием здесь принципиальна, поэтому разберём её отдельно.

Практический итог короткий: компактной MoE-модели в линейке Qwen 3.8 нет. При этом Qwen3.8-27B, компактная dense-модель нового поколения, доступна и рассчитана на локальный запуск, включая 16 ГБ VRAM.

Что подтверждено, а что остаётся предположением

В треде три ключевые фразы, и статус у них разный. Первая фиксирует состав релиза: «We did not get a new moe model with qwen 3.8». Вторая описывает конкретное мероприятие: «Alibaba did not announce any small moe models on apsara». Третья относится уже к личным ожиданиям автора: «I know we might get an announcement later but ngl I kinda lost hope».

«We did not get a new moe model with qwen 3.8». «Alibaba did not announce any small moe models on apsara». «I know we might get an announcement later but ngl I kinda lost hope».
Подтверждено на момент публикацииОстаётся предположением
Вместе с Qwen 3.8 новая MoE-модель не вышлаAlibaba отказалась от разработки компактных MoE-моделей
На Apsara компактные MoE-модели не анонсировалиАнонса не будет вообще
Линейка Qwen 3.8 доступна, включая Qwen3.8-27BИзвестны сроки и характеристики будущей MoE-модели

В материалах нет подтверждённой информации о том, что Alibaba закрыла направление компактных MoE. Автор треда сам допускает, что анонс может состояться позже. Отсутствие новости в одном релизном цикле не равно отказу от технологии, и делать из этого вывод об отмене разработки не стоит.

Есть и второй пробел: неизвестно, какие именно компактные MoE-модели ожидались и с какими характеристиками. Разговор идёт вокруг формата 35B с 3B активных параметров, но это ожидание сообщества, а не подтверждённая спецификация будущего релиза.

Что такое MoE-архитектура и почему о ней говорят

MoE (Mixture of Experts) - это архитектура, в которой блок трансформера делится на множество параллельных подсетей-экспертов, а роутер для каждого токена выбирает лишь часть из них, обычно двух-четырёх. Dense-модель на каждом шаге задействует все свои параметры, MoE - только выбранные.

Отсюда главная метрика таких моделей: общее число параметров и число активных параметров на токен. Запись 35B-A3B означает примерно 35 миллиардов весов в хранилище и около 3 миллиардов, участвующих в вычислении одного токена. Работает это не как dense-модель на 3B: качество определяют все эксперты, а стоимость инференса в пересчёте на токен ближе к куда меньшей сети.

Обратная сторона предсказуема. Все веса нужно где-то держать, поэтому экономия идёт на вычислениях и скорости, а не на памяти. Обучение MoE сложнее из-за балансировки нагрузки между экспертами, и качество роутинга напрямую влияет на ответы. Подробности по конкретной конфигурации собраны в разборе архитектуры Qwen 3.x-35B-a3B.

MoE vs dense: в чём разница для пользователя

КритерийMoEDense
Память под весаВсе эксперты, объём по общему числу параметровОбъём по числу параметров модели
Вычисления на токенПо активным параметрамПо всем параметрам
Скорость генерацииВыше при сопоставимом качествеНиже при том же размере
РазвёртываниеСложнее, нужна поддержка в раннереПроще, меньше зависимостей
КвантованиеРискованнее, роутинг чувствителен к точностиПредсказуемее по качеству

Для домашнего сервера расклад такой: MoE позволяет держать модель с большим общим числом параметров и получать скорость, близкую к малым dense-моделям. Плата - объём VRAM под хранение всех экспертов. Dense-модель предсказуемее: если веса влезают в память, поведение по VRAM понятно заранее, без сюрпризов на длинном контексте.

Почему компактные MoE-модели важны для локального запуска

Спрос на компактные MoE объясняется просто: владелец одной видеокарты на 16-24 ГБ хочет получать качество модели заметно крупнее, чем влезает в его память как dense. MoE даёт такой шанс за счёт малого числа активных параметров: вычислений меньше, и генерация идёт быстрее, чем у dense-модели того же общего размера.

Ограничение остаётся тем же: хранить надо все веса. Гипотетическая MoE с 35B общих и 3B активных параметров в 4-битном квантовании займёт примерно 18-20 ГБ, то есть потребует карту на 24 ГБ или пару карт поменьше. Это прикидка по общему правилу, а не измеренная характеристика конкретной модели, которой пока нет.

Пока таких моделей в линейке не появилось, выбор для владельца потребительского железа сужается до dense-вариантов и моделей предыдущего поколения. Как это выглядит на практике с гигантами, показывает разбор запуска Qwen3.8 2.4T на двух RTX 5090 и трёх RTX 3090: около 0,25 токена в секунду и дефицит памяти вдвое.

Требования к VRAM и квантование

Квантование остаётся основным способом втиснуть модель в скромную память: веса переводят в 3-4 бита, и размер файла падает в разы относительно FP16. Для Qwen3.8-27B применяют смешанную точность: 20% весов (shared expert и attention-тензоры) остаются в 4 битах (Q4_K), остальные 80% уходят в 3 бита (Q3_K). Итоговый файл Q2Q4 весит около 13 ГБ и рассчитан на работу с 16 ГБ VRAM в агентных сценариях с большим контекстным окном. Описание формата квантования.

Смысл смешанной точности в том, чтобы не просадить самые чувствительные к точности части модели. Для MoE-моделей квантование рискованнее: эксперты, редко попадающие в выбор роутера, получают меньше градиентов при обучении и хуже переносят агрессивное сжатие. Практический ориентир такой: MoE терпит 4 бита, а к 2-3 битам качество проседает быстрее, чем у dense-модели того же размера.

Что доступно сейчас: линейка Qwen и Qwen3.8-27B

Открытое семейство Qwen на сентябрь 2026 года выглядит так. Qwen3.8 - самая способная генерация в открытой линейке на текущий момент, построенная на архитектурной основе Qwen3.5. Qwen3.6 - предыдущее поколение, которое широко разошлось по сообществу вместе с community-модификациями. Отдельные варианты новой линейки, включая серверные и Flash-конфигурации, разобраны в материале про Qwen3.8-Flash-Next. Модельная карточка линейки 3.8.

Qwen3.8-27B: ключевые характеристики для локального запуска

Для домашнего железа интересна Qwen3.8-27B. Это компактная dense-модель, то есть без MoE-роутинга: нативная vision-language сеть, которая понимает изображения и видео, плюс гибкое управление режимом размышления. Данные из описания модели.

ПараметрЗначение
Тип архитектурыDense, без MoE
МодальностиТекст, изображения, видео
Управление размышлениемЕсть, гибкое
Архитектурная базаQwen3.5
Формат Q2Q4Около 13 ГБ
Минимальный объём памяти16 ГБ VRAM
Запуск без GPUGoogle Colab, около 10 токенов/с
Агентные инструментыCodex и аналоги через Developer Role Support

Ещё один практический момент: Qwen3.8-27B заявляется как рабочая модель для агентных инструментов вроде Codex благодаря поддержке Developer Role, а улучшения в вызове инструментов помогают разбирать вложенные объекты без сбоев на парсинге. Без GPU-карты модель запускается через Google Colab как endpoint на скорости около 10 токенов в секунду. Описание возможностей.

Оговорка по цифрам: они относятся к конкретному формату квантования Q2Q4 и конкретному способу запуска, а не ко всем вариантам использования модели. На другой длине контекста, другом раннере или другом кванте значения будут отличаться.

Как запустить Qwen3.8-27B на 16 ГБ VRAM

Порядок действий без лишних сложностей. Сначала проверьте объём видеопамяти: 16 ГБ - нижняя граница для формата Q2Q4 весом около 13 ГБ, и остаток уйдёт на контекст и KV-кэш. Дальше возьмите GGUF-сборку нужного кванта и загрузите её в раннер с поддержкой GGUF, например llama.cpp или его обёртки. Если GPU нет, поднимите модель в Google Colab и обращайтесь к ней как к endpoint.

Что закладывать в ожидания: агрессивный квант экономит память, но может снижать качество на сложных задачах. Держите запас по контексту, тестируйте на своих промптах, а не на абстрактных примерах. И помните, что скорость сильно зависит от конфигурации: один и тот же квант на разных картах даст разный результат.

Что это значит для пользователей и сообщества

Практический эффект от отсутствия компактной MoE простой: у владельца 16-24 ГБ VRAM выбор сузился. Есть dense-модель Qwen3.8-27B, которая влезает в 16 ГБ, и есть модели предыдущих поколений. MoE-варианта, который дал бы качество крупной сети при малых вычислениях, в линейке 3.8 нет.

Сообщество ждало такую модель в формате 35B с 3B активных параметров. Подтверждённой информации о планах Alibaba нет: ни сроков, ни спецификаций, ни официальных заявлений. Любые прогнозы по датам остаются гаданием.

Отдельно стоит помнить о потолке возможностей малых моделей на ограниченном железе, чтобы не ждать от них лишнего: разбор пределов малых моделей показывает, где заканчиваются параметры и начинается упор в VRAM.

Стоит ли ждать анонса компактной MoE-модели

Автор обсуждения прямо пишет, что анонс может появиться позже, но добавляет, что надежду почти потерял. Позиция участника треда. Данных для прогноза мало: никто в дискуссии не ссылается на официальные планы Alibaba, поэтому любая оценка вероятности держится на общих паттернах релизов, а не на фактах.

Логика выбора простая. Если модель нужна для работы сейчас, ожидание себя не оправдывает: доступная dense-модель решает задачи сегодня. Если задачи не горят и интересна потенциально более эффективная архитектура, следите за официальными каналами Qwen и новыми появлениями на Hugging Face. Ставить проект на паузу ради возможного MoE-релиза не стоит.

Добавьте сюда время на адаптацию: даже после анонса нужны квантованные GGUF-версии, поддержка в раннерах и проверка на вашем железе. Между релизом весов и рабочим локальным запуском обычно проходит не один день.

Итоги: что делать прямо сейчас

  • Отсутствие компактной MoE-модели вместе с Qwen 3.8 и на Apsara - это данные сообщества, а не официальное заявление Alibaba. Анонс может состояться позже, отказа от направления никто не подтверждал.
  • MoE снижает вычислительную нагрузку за счёт малого числа активных параметров, но требует памяти под все веса: экономия идёт на скорости, а не на VRAM.
  • Qwen3.8-27B доступна сейчас: dense-модель с поддержкой изображений и видео, работающая на 16 ГБ VRAM в формате Q2Q4 весом около 13 ГБ, с запуском через Google Colab при отсутствии GPU и поддержкой агентных инструментов.
  • Если модель нужна сегодня, берите доступные варианты и тестируйте на своих задачах. Если интересует будущий MoE-релиз, следите за официальными анонсами, но не откладывайте рабочие проекты в ожидании модели без подтверждённых сроков.

Подписаться на канал