Что произошло: Alibaba и отсутствие компактной MoE-модели Qwen
22 сентября 2026 года в сабреддите r/LocalLLaMA появился тред «Did Alibaba abandon 35B A3B?». Повод конкретный: вместе с Qwen 3.8 не вышла новая MoE-модель, а на конференции Apsara компактные MoE-модели не показали. Первоисточник обсуждения.
Это не пресс-релиз Alibaba и не официальное заявление команды Qwen. Наблюдение сформулировал участник сообщества, который следит за релизами и сравнивает анонсы с ожиданиями. Граница между фактом и ожиданием здесь принципиальна, поэтому разберём её отдельно.
Практический итог короткий: компактной MoE-модели в линейке Qwen 3.8 нет. При этом Qwen3.8-27B, компактная dense-модель нового поколения, доступна и рассчитана на локальный запуск, включая 16 ГБ VRAM.
Что подтверждено, а что остаётся предположением
В треде три ключевые фразы, и статус у них разный. Первая фиксирует состав релиза: «We did not get a new moe model with qwen 3.8». Вторая описывает конкретное мероприятие: «Alibaba did not announce any small moe models on apsara». Третья относится уже к личным ожиданиям автора: «I know we might get an announcement later but ngl I kinda lost hope».
«We did not get a new moe model with qwen 3.8». «Alibaba did not announce any small moe models on apsara». «I know we might get an announcement later but ngl I kinda lost hope».
| Подтверждено на момент публикации | Остаётся предположением |
|---|---|
| Вместе с Qwen 3.8 новая MoE-модель не вышла | Alibaba отказалась от разработки компактных MoE-моделей |
| На Apsara компактные MoE-модели не анонсировали | Анонса не будет вообще |
| Линейка Qwen 3.8 доступна, включая Qwen3.8-27B | Известны сроки и характеристики будущей MoE-модели |
В материалах нет подтверждённой информации о том, что Alibaba закрыла направление компактных MoE. Автор треда сам допускает, что анонс может состояться позже. Отсутствие новости в одном релизном цикле не равно отказу от технологии, и делать из этого вывод об отмене разработки не стоит.
Есть и второй пробел: неизвестно, какие именно компактные MoE-модели ожидались и с какими характеристиками. Разговор идёт вокруг формата 35B с 3B активных параметров, но это ожидание сообщества, а не подтверждённая спецификация будущего релиза.
Что такое MoE-архитектура и почему о ней говорят
MoE (Mixture of Experts) - это архитектура, в которой блок трансформера делится на множество параллельных подсетей-экспертов, а роутер для каждого токена выбирает лишь часть из них, обычно двух-четырёх. Dense-модель на каждом шаге задействует все свои параметры, MoE - только выбранные.
Отсюда главная метрика таких моделей: общее число параметров и число активных параметров на токен. Запись 35B-A3B означает примерно 35 миллиардов весов в хранилище и около 3 миллиардов, участвующих в вычислении одного токена. Работает это не как dense-модель на 3B: качество определяют все эксперты, а стоимость инференса в пересчёте на токен ближе к куда меньшей сети.
Обратная сторона предсказуема. Все веса нужно где-то держать, поэтому экономия идёт на вычислениях и скорости, а не на памяти. Обучение MoE сложнее из-за балансировки нагрузки между экспертами, и качество роутинга напрямую влияет на ответы. Подробности по конкретной конфигурации собраны в разборе архитектуры Qwen 3.x-35B-a3B.
MoE vs dense: в чём разница для пользователя
| Критерий | MoE | Dense |
|---|---|---|
| Память под веса | Все эксперты, объём по общему числу параметров | Объём по числу параметров модели |
| Вычисления на токен | По активным параметрам | По всем параметрам |
| Скорость генерации | Выше при сопоставимом качестве | Ниже при том же размере |
| Развёртывание | Сложнее, нужна поддержка в раннере | Проще, меньше зависимостей |
| Квантование | Рискованнее, роутинг чувствителен к точности | Предсказуемее по качеству |
Для домашнего сервера расклад такой: MoE позволяет держать модель с большим общим числом параметров и получать скорость, близкую к малым dense-моделям. Плата - объём VRAM под хранение всех экспертов. Dense-модель предсказуемее: если веса влезают в память, поведение по VRAM понятно заранее, без сюрпризов на длинном контексте.
Почему компактные MoE-модели важны для локального запуска
Спрос на компактные MoE объясняется просто: владелец одной видеокарты на 16-24 ГБ хочет получать качество модели заметно крупнее, чем влезает в его память как dense. MoE даёт такой шанс за счёт малого числа активных параметров: вычислений меньше, и генерация идёт быстрее, чем у dense-модели того же общего размера.
Ограничение остаётся тем же: хранить надо все веса. Гипотетическая MoE с 35B общих и 3B активных параметров в 4-битном квантовании займёт примерно 18-20 ГБ, то есть потребует карту на 24 ГБ или пару карт поменьше. Это прикидка по общему правилу, а не измеренная характеристика конкретной модели, которой пока нет.
Пока таких моделей в линейке не появилось, выбор для владельца потребительского железа сужается до dense-вариантов и моделей предыдущего поколения. Как это выглядит на практике с гигантами, показывает разбор запуска Qwen3.8 2.4T на двух RTX 5090 и трёх RTX 3090: около 0,25 токена в секунду и дефицит памяти вдвое.
Требования к VRAM и квантование
Квантование остаётся основным способом втиснуть модель в скромную память: веса переводят в 3-4 бита, и размер файла падает в разы относительно FP16. Для Qwen3.8-27B применяют смешанную точность: 20% весов (shared expert и attention-тензоры) остаются в 4 битах (Q4_K), остальные 80% уходят в 3 бита (Q3_K). Итоговый файл Q2Q4 весит около 13 ГБ и рассчитан на работу с 16 ГБ VRAM в агентных сценариях с большим контекстным окном. Описание формата квантования.
Смысл смешанной точности в том, чтобы не просадить самые чувствительные к точности части модели. Для MoE-моделей квантование рискованнее: эксперты, редко попадающие в выбор роутера, получают меньше градиентов при обучении и хуже переносят агрессивное сжатие. Практический ориентир такой: MoE терпит 4 бита, а к 2-3 битам качество проседает быстрее, чем у dense-модели того же размера.
Что доступно сейчас: линейка Qwen и Qwen3.8-27B
Открытое семейство Qwen на сентябрь 2026 года выглядит так. Qwen3.8 - самая способная генерация в открытой линейке на текущий момент, построенная на архитектурной основе Qwen3.5. Qwen3.6 - предыдущее поколение, которое широко разошлось по сообществу вместе с community-модификациями. Отдельные варианты новой линейки, включая серверные и Flash-конфигурации, разобраны в материале про Qwen3.8-Flash-Next. Модельная карточка линейки 3.8.
Qwen3.8-27B: ключевые характеристики для локального запуска
Для домашнего железа интересна Qwen3.8-27B. Это компактная dense-модель, то есть без MoE-роутинга: нативная vision-language сеть, которая понимает изображения и видео, плюс гибкое управление режимом размышления. Данные из описания модели.
| Параметр | Значение |
|---|---|
| Тип архитектуры | Dense, без MoE |
| Модальности | Текст, изображения, видео |
| Управление размышлением | Есть, гибкое |
| Архитектурная база | Qwen3.5 |
| Формат Q2Q4 | Около 13 ГБ |
| Минимальный объём памяти | 16 ГБ VRAM |
| Запуск без GPU | Google Colab, около 10 токенов/с |
| Агентные инструменты | Codex и аналоги через Developer Role Support |
Ещё один практический момент: Qwen3.8-27B заявляется как рабочая модель для агентных инструментов вроде Codex благодаря поддержке Developer Role, а улучшения в вызове инструментов помогают разбирать вложенные объекты без сбоев на парсинге. Без GPU-карты модель запускается через Google Colab как endpoint на скорости около 10 токенов в секунду. Описание возможностей.
Оговорка по цифрам: они относятся к конкретному формату квантования Q2Q4 и конкретному способу запуска, а не ко всем вариантам использования модели. На другой длине контекста, другом раннере или другом кванте значения будут отличаться.
Как запустить Qwen3.8-27B на 16 ГБ VRAM
Порядок действий без лишних сложностей. Сначала проверьте объём видеопамяти: 16 ГБ - нижняя граница для формата Q2Q4 весом около 13 ГБ, и остаток уйдёт на контекст и KV-кэш. Дальше возьмите GGUF-сборку нужного кванта и загрузите её в раннер с поддержкой GGUF, например llama.cpp или его обёртки. Если GPU нет, поднимите модель в Google Colab и обращайтесь к ней как к endpoint.
Что закладывать в ожидания: агрессивный квант экономит память, но может снижать качество на сложных задачах. Держите запас по контексту, тестируйте на своих промптах, а не на абстрактных примерах. И помните, что скорость сильно зависит от конфигурации: один и тот же квант на разных картах даст разный результат.
Что это значит для пользователей и сообщества
Практический эффект от отсутствия компактной MoE простой: у владельца 16-24 ГБ VRAM выбор сузился. Есть dense-модель Qwen3.8-27B, которая влезает в 16 ГБ, и есть модели предыдущих поколений. MoE-варианта, который дал бы качество крупной сети при малых вычислениях, в линейке 3.8 нет.
Сообщество ждало такую модель в формате 35B с 3B активных параметров. Подтверждённой информации о планах Alibaba нет: ни сроков, ни спецификаций, ни официальных заявлений. Любые прогнозы по датам остаются гаданием.
Отдельно стоит помнить о потолке возможностей малых моделей на ограниченном железе, чтобы не ждать от них лишнего: разбор пределов малых моделей показывает, где заканчиваются параметры и начинается упор в VRAM.
Стоит ли ждать анонса компактной MoE-модели
Автор обсуждения прямо пишет, что анонс может появиться позже, но добавляет, что надежду почти потерял. Позиция участника треда. Данных для прогноза мало: никто в дискуссии не ссылается на официальные планы Alibaba, поэтому любая оценка вероятности держится на общих паттернах релизов, а не на фактах.
Логика выбора простая. Если модель нужна для работы сейчас, ожидание себя не оправдывает: доступная dense-модель решает задачи сегодня. Если задачи не горят и интересна потенциально более эффективная архитектура, следите за официальными каналами Qwen и новыми появлениями на Hugging Face. Ставить проект на паузу ради возможного MoE-релиза не стоит.
Добавьте сюда время на адаптацию: даже после анонса нужны квантованные GGUF-версии, поддержка в раннерах и проверка на вашем железе. Между релизом весов и рабочим локальным запуском обычно проходит не один день.
Итоги: что делать прямо сейчас
- Отсутствие компактной MoE-модели вместе с Qwen 3.8 и на Apsara - это данные сообщества, а не официальное заявление Alibaba. Анонс может состояться позже, отказа от направления никто не подтверждал.
- MoE снижает вычислительную нагрузку за счёт малого числа активных параметров, но требует памяти под все веса: экономия идёт на скорости, а не на VRAM.
- Qwen3.8-27B доступна сейчас: dense-модель с поддержкой изображений и видео, работающая на 16 ГБ VRAM в формате Q2Q4 весом около 13 ГБ, с запуском через Google Colab при отсутствии GPU и поддержкой агентных инструментов.
- Если модель нужна сегодня, берите доступные варианты и тестируйте на своих задачах. Если интересует будущий MoE-релиз, следите за официальными анонсами, но не откладывайте рабочие проекты в ожидании модели без подтверждённых сроков.