Что известно о Qwen 3: слухи, версии 3.7/3.8 и дорожная карта Alibaba
Официальных заявлений Alibaba о выпуске моделей Qwen масштаба 30B–100B на конец июля 2026 года нет. Сообщество активно обсуждает возможные версии 3.7 и 3.8, опираясь на утечки и косвенные данные. Главный источник шума - анонс Qwen3.8-Max-Preview на 2,4 трлн параметров, который Alibaba позиционирует как модель второго эшелона после Claude Fable 5. Однако публичных бенчмарков и карточки модели до сих пор нет, а независимые тесты в Arena не проводились. Это создаёт информационный вакуум, который сообщество заполняет прогнозами.
Параллельно с этим появились сообщения о возможной модели Qwen 3.x-35B-a3B с архитектурой Mixture of Experts. Если информация подтвердится, это будет первая модель семейства Qwen среднего размера, оптимизированная под инференс на потребительском железе. Мы детально разбирали её архитектуру и перспективы в отдельной статье - Qwen 3.x-35B-a3B: архитектура MoE, перспективы и сценарии применения.
Фактическая дорожная карта Alibaba остаётся закрытой. Компания не публикует долгосрочных планов по open-source моделям, ограничиваясь анонсами за несколько недель до релиза. Так было с Qwen 2.5, так происходит и сейчас с Qwen3.8. Это значит, что любой прогноз - экстраполяция на основе исторических паттернов и анализа конкурентного давления.
От Qwen 2.5 к Qwen 3: темпы выпуска и паттерны разработки
Qwen 2.5 выходила волнами с сентября 2025 по февраль 2026 года. За этот период Alibaba выпустила модели размером от 0.5B до 72B, закрыв весь спектр - от мобильных устройств до серверных инсталляций. Интервал между анонсом и публикацией весов составлял от 2 до 6 недель. Технические отчёты появлялись через 1-3 месяца после релиза.
Типичный цикл разработки LLM такого масштаба включает:
- 3-5 месяцев на обучение базовой модели (при наличии кластера из 10 000+ GPU);
- 1-2 месяца на SFT и RLHF/DPO;
- 2-4 недели на red-teaming и внутреннее тестирование безопасности;
- 2-6 недель на подготовку релиза, документации и упаковку весов.
Если Alibaba начала обучать модели 30B–100B в начале 2026 года, то реалистичный срок выхода - август-октябрь 2026. Если обучение стартовало позже, срок сдвигается на ноябрь-декабрь или начало 2027. Косвенный признак активности - ежедневные чекпоинты Qwen3.8, о механике которых мы писали в разборе ежедневных итераций Alibaba. Такой темп обновлений указывает на наличие свободных вычислительных ресурсов, которые могут быть задействованы и для обучения моделей меньшего масштаба.
Почему сообщество ждет именно 30B–100B: ниша между легкостью и мощью
Модели 7B-13B упираются в потолок качества на сложных задачах: multi-hop reasoning, длинная кодогенерация, агентные сценарии. Модели 400B+ требуют кластеров из 8+ GPU даже в INT4. Диапазон 30B–100B - компромисс, который позволяет запускать инференс на 1-4 GPU и при этом получать качество, сопоставимое с проприетарными API.
Llama 3.1-70B и Mistral Large доказали востребованность этого сегмента. Llama 3.1-70B набрала 86.0 MMLU и 81.7 HumanEval, Mistral Large - 89.2 MMLU. Обе модели активно используются в production: от чат-ботов до сложных RAG-систем. Qwen 2.5-72B показала сопоставимые результаты, но уступала по многоязычности и качеству кода. Сообщество ожидает, что Qwen 3 закроет этот разрыв.
Дополнительный драйвер - рост популярности локального деплоя. Компании не хотят отправлять чувствительные данные в облачные API. Модель 70B в INT4 помещается в 40-48 ГБ VRAM, что укладывается в бюджет одной A100-80G или двух RTX 4090. Это делает её доступной для среднего бизнеса и исследовательских групп.
Прогноз даты релиза: почему вторая половина 2026 - реалистичный сценарий
Три фактора указывают на вторую половину 2026 года как наиболее вероятное окно для релиза Qwen 30B–100B.
Фактор первый: конкурентное давление. Llama 4 ожидается в сентябре-октябре 2026. Mistral работает над следующим поколением Large. Если Alibaba не ответит в течение 1-2 месяцев после выхода конкурентов, она рискует потерять долю в open-source сегменте. Выпуск Qwen3.8-Max-Preview в июле - вероятно, попытка удержать внимание сообщества до готовности основных моделей.
Фактор второй: техническая готовность. Судя по ежедневным чекпоинтам Qwen3.8, Alibaba отладила пайплайн быстрой итерации. Это сокращает время на пост-тренинг и выравнивание. Если базовая модель 70B уже обучена, то 2-3 месяца на SFT, RLHF и тестирование - реалистичный срок. Это даёт релиз в октябре-ноябре 2026.
Фактор третий: исторический паттерн. Alibaba выпускает модели среднего размера через 4-6 месяцев после флагманских анонсов. Qwen3.8-Max-Preview анонсирован в июле 2026. Добавляем 4-6 месяцев - получаем ноябрь 2026 - январь 2027. Это согласуется с прогнозом «не ранее второй половины 2026».
Важная оговорка: всё это - экстраполяция. Alibaba может изменить стратегию в любой момент. Кадровые перестановки в команде Qwen, которые мы анализировали в статье о влиянии смены команды на развитие модели, добавляют неопределённости. Новый состав может как ускорить, так и затормозить разработку.
Инференс Qwen 30B, 70B и 100B: что выбрать под свои задачи
Выбор размера модели - это выбор между качеством, скоростью и стоимостью инференса. Для Qwen 3 ожидаемые характеристики можно спрогнозировать на основе Qwen 2.5 и архитектурных трендов.
| Размер | VRAM FP16 | VRAM INT8 | VRAM INT4 | GPU (минимально) | Сценарий |
|---|---|---|---|---|---|
| 30B | 60 ГБ | 30 ГБ | 15-18 ГБ | 1x A100-80G / 2x RTX 4090 | Чат-боты, суммаризация, классификация |
| 70B | 140 ГБ | 70 ГБ | 35-42 ГБ | 2x A100-80G / 4x RTX 4090 | RAG, анализ документов, сложная кодогенерация |
| 100B | 200 ГБ | 100 ГБ | 50-60 ГБ | 4x A100-80G / 8x RTX 4090 | Агенты, multi-step reasoning, научные расчёты |
Для 100B-моделей архитектура MoE меняет картину. Если Qwen выпустит 100B-MoE с 10-15B активных параметров, требования к памяти для инференса снизятся до уровня 30-40 ГБ VRAM при сохранении качества, близкого к dense-моделям 100B+. Сообщество активно требует такой релиз, особенно в контексте запуска на Apache Spark - мы разбирали эту петицию и технические ограничения в отдельном материале.
Аппаратные требования: от consumer-железа до серверных решений
Квантизация - главный инструмент для запуска крупных моделей на ограниченном железе. Практика тестирования Qwen3.5 122B на 64 ГБ RAM показала: даже с агрессивным квантованием UD-Q2_K_XL модель выдаёт осмысленные ответы, но скорость падает до 2.9 токенов/с. Узкое место - пропускная способность памяти. DDR4-3200 даёт около 50 ГБ/с, DDR5-6000 - до 80 ГБ/с. Для комфортной работы с 70B-моделью в INT4 нужна пропускная способность не менее 200 ГБ/с, что достижимо только на GPU с HBM.
Конфигурации для разных бюджетов:
- Consumer-сегмент (до $5000): 2x RTX 4090 24G, модель 30B в INT4, скорость 20-40 токенов/с. Подходит для прототипирования и персонального использования.
- Prosumer/малый бизнес ($5000-$15000): 1x A100-80G или 4x RTX 4090, модель 70B в INT4, скорость 15-30 токенов/с. Достаточно для production чат-ботов и RAG.
- Enterprise ($30000+): 4-8x A100-80G или H100, модель 100B в INT8, скорость 50+ токенов/с. Агентные системы, высоконагруженные API.
Сравнение с конкурентами: Llama 4, Mistral Large и другие
Прогнозировать позиции Qwen 3 можно на основе истории улучшений между поколениями. Qwen 2.5-72B отставала от Llama 3.1-70B на 2-4 пункта MMLU и на 5-7 пунктов HumanEval. Если Qwen 3 сохранит темп прироста в 3-5% по ключевым бенчмаркам, она сравняется или обойдёт Llama 4 в задачах на многоязычность и математику - традиционно сильных сторонах семейства Qwen.
Mistral Large остаётся ориентиром по качеству кода. Qwen 2.5-72B проигрывала ей на HumanEval около 8 пунктов. Сокращение этого разрыва - критический фактор для adoption в среде разработчиков. Если Qwen 3 покажет 85+ HumanEval, это станет переломным моментом.
Ключевая интрига - стоимость инференса. Qwen3.8-Max-Preview уже показала снижение расхода входных токенов на 35-40% в многошаговых задачах по сравнению с Minimax M3 и GPT 5.6, что мы детально разбирали в анализе эффективности токенов. Если этот же подход применят к моделям 30B–100B, Qwen 3 может стать самым экономичным решением в своём классе.
Как подготовиться к релизу: практические рекомендации
Ожидание релиза не означает бездействия. Три шага, которые можно сделать уже сейчас.
Что можно сделать уже сегодня: бенчмаркинг на Qwen 2.5
Запустите Qwen 2.5-72B через vLLM и замерьте метрики на ваших задачах. Это даст baseline для сравнения с Qwen 3 и позволит оценить реальную нагрузку на инфраструктуру.
# docker-compose для vLLM с Qwen 2.5-72B
version: '3.8'
services:
vllm:
image: vllm/vllm-openai:latest
command: >
--model Qwen/Qwen2.5-72B-Instruct
--tensor-parallel-size 2
--max-model-len 32768
--gpu-memory-utilization 0.90
--dtype auto
ports:
- "8000:8000"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 2
capabilities: [gpu]
volumes:
- /mnt/models:/root/.cache/huggingface
Ключевые метрики для замера:
- Tokens per second (tps) на генерации - целевой минимум 20 tps для интерактивных сценариев;
- Time to first token (TTFT) - должно быть менее 500 мс для комфортной работы;
- Latency на обработку промпта длиной 4096 токенов - критично для RAG;
- Пиковое потребление VRAM - основа для расчёта стоимости инференса.
Спроектируйте инфраструктуру с запасом под 70B-модели. Если сейчас вы используете 13B-модель на одной RTX 4090, заложите в бюджет апгрейд до 2-4 GPU или аренду A100 в облаке. Переход с 13B на 70B увеличивает требования к VRAM в 4-5 раз, а к пропускной способности памяти - в 3-4 раза.
Мониторьте официальные каналы Alibaba: репозиторий Qwen на Hugging Face, блог Alibaba Cloud и аккаунт команды в Twitter/X. Анонсы обычно появляются там за 2-4 недели до публикации весов. Этого времени достаточно для подготовки окружения, но недостаточно для закупки железа - поэтому планирование инфраструктуры нужно начинать заранее.
Резюме: стоит ли ждать Qwen 3 или брать аналоги сейчас
Решение зависит от горизонта планирования и критичности проекта.
Если вам нужно внедрение в production в ближайшие 2-3 месяца - берите текущих лидеров. Llama 3.1-70B и Mistral Large - зрелые модели с предсказуемым поведением, обширной экосистемой инструментов и понятными ограничениями. Вы не получите потенциального прироста от Qwen 3, но и не попадёте в ситуацию «ждём ещё полгода».
Если запуск проекта планируется на начало 2027 года - ожидание Qwen 3 оправдано. Прирост в 3-5% по ключевым бенчмаркам и потенциальное снижение стоимости инференса на 30-40% (судя по технологиям, обкатанным на Qwen3.8-Max-Preview) могут окупить задержку. Особенно если ваши задачи связаны с многоязычностью или математическим reasoning - традиционно сильными сторонами Qwen.
Промежуточный вариант: начать разработку на Llama 3.1-70B с архитектурой, допускающей замену модели. Абстрагируйте вызовы LLM за единым API-слоем, используйте формат промптов, совместимый с разными моделями, и не зашивайте жёстко особенности конкретной модели в пайплайн. Когда Qwen 3 выйдет, вы сможете переключиться за несколько дней и провести A/B-тестирование на реальных данных.
Релиз Qwen 30B–100B - вопрос времени. Вторая половина 2026 года остаётся наиболее вероятным окном. Точная дата зависит от конкурентного давления, готовности архитектуры и внутренних процессов Alibaba. Мы продолжим отслеживать ситуацию и обновим прогноз при появлении новых данных.