Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Следующее поколение Qwen: когда ждать модели 30B–100B и к чему готовиться

Прогноз релиза Qwen 30B–100B: разбираем слухи о версиях 3.7/3.8, оцениваем реалистичные сроки выхода во второй половине 2026 и даём практические рекомендации по

Коротко

Что будет в материале

  1. 01

    Что известно о Qwen 3: слухи, версии 3.7/3.8 и дорожная карта Alibaba

  2. 02

    Прогноз даты релиза: почему вторая половина 2026 - реалистичный сценарий

  3. 03

    Инференс Qwen 30B, 70B и 100B: что выбрать под свои задачи

  4. 04

    Как подготовиться к релизу: практические рекомендации

Что известно о Qwen 3: слухи, версии 3.7/3.8 и дорожная карта Alibaba

Официальных заявлений Alibaba о выпуске моделей Qwen масштаба 30B–100B на конец июля 2026 года нет. Сообщество активно обсуждает возможные версии 3.7 и 3.8, опираясь на утечки и косвенные данные. Главный источник шума - анонс Qwen3.8-Max-Preview на 2,4 трлн параметров, который Alibaba позиционирует как модель второго эшелона после Claude Fable 5. Однако публичных бенчмарков и карточки модели до сих пор нет, а независимые тесты в Arena не проводились. Это создаёт информационный вакуум, который сообщество заполняет прогнозами.

Параллельно с этим появились сообщения о возможной модели Qwen 3.x-35B-a3B с архитектурой Mixture of Experts. Если информация подтвердится, это будет первая модель семейства Qwen среднего размера, оптимизированная под инференс на потребительском железе. Мы детально разбирали её архитектуру и перспективы в отдельной статье - Qwen 3.x-35B-a3B: архитектура MoE, перспективы и сценарии применения.

Фактическая дорожная карта Alibaba остаётся закрытой. Компания не публикует долгосрочных планов по open-source моделям, ограничиваясь анонсами за несколько недель до релиза. Так было с Qwen 2.5, так происходит и сейчас с Qwen3.8. Это значит, что любой прогноз - экстраполяция на основе исторических паттернов и анализа конкурентного давления.

От Qwen 2.5 к Qwen 3: темпы выпуска и паттерны разработки

Qwen 2.5 выходила волнами с сентября 2025 по февраль 2026 года. За этот период Alibaba выпустила модели размером от 0.5B до 72B, закрыв весь спектр - от мобильных устройств до серверных инсталляций. Интервал между анонсом и публикацией весов составлял от 2 до 6 недель. Технические отчёты появлялись через 1-3 месяца после релиза.

Типичный цикл разработки LLM такого масштаба включает:

  • 3-5 месяцев на обучение базовой модели (при наличии кластера из 10 000+ GPU);
  • 1-2 месяца на SFT и RLHF/DPO;
  • 2-4 недели на red-teaming и внутреннее тестирование безопасности;
  • 2-6 недель на подготовку релиза, документации и упаковку весов.

Если Alibaba начала обучать модели 30B–100B в начале 2026 года, то реалистичный срок выхода - август-октябрь 2026. Если обучение стартовало позже, срок сдвигается на ноябрь-декабрь или начало 2027. Косвенный признак активности - ежедневные чекпоинты Qwen3.8, о механике которых мы писали в разборе ежедневных итераций Alibaba. Такой темп обновлений указывает на наличие свободных вычислительных ресурсов, которые могут быть задействованы и для обучения моделей меньшего масштаба.

Почему сообщество ждет именно 30B–100B: ниша между легкостью и мощью

Модели 7B-13B упираются в потолок качества на сложных задачах: multi-hop reasoning, длинная кодогенерация, агентные сценарии. Модели 400B+ требуют кластеров из 8+ GPU даже в INT4. Диапазон 30B–100B - компромисс, который позволяет запускать инференс на 1-4 GPU и при этом получать качество, сопоставимое с проприетарными API.

Llama 3.1-70B и Mistral Large доказали востребованность этого сегмента. Llama 3.1-70B набрала 86.0 MMLU и 81.7 HumanEval, Mistral Large - 89.2 MMLU. Обе модели активно используются в production: от чат-ботов до сложных RAG-систем. Qwen 2.5-72B показала сопоставимые результаты, но уступала по многоязычности и качеству кода. Сообщество ожидает, что Qwen 3 закроет этот разрыв.

Дополнительный драйвер - рост популярности локального деплоя. Компании не хотят отправлять чувствительные данные в облачные API. Модель 70B в INT4 помещается в 40-48 ГБ VRAM, что укладывается в бюджет одной A100-80G или двух RTX 4090. Это делает её доступной для среднего бизнеса и исследовательских групп.

Прогноз даты релиза: почему вторая половина 2026 - реалистичный сценарий

Три фактора указывают на вторую половину 2026 года как наиболее вероятное окно для релиза Qwen 30B–100B.

Фактор первый: конкурентное давление. Llama 4 ожидается в сентябре-октябре 2026. Mistral работает над следующим поколением Large. Если Alibaba не ответит в течение 1-2 месяцев после выхода конкурентов, она рискует потерять долю в open-source сегменте. Выпуск Qwen3.8-Max-Preview в июле - вероятно, попытка удержать внимание сообщества до готовности основных моделей.

Фактор второй: техническая готовность. Судя по ежедневным чекпоинтам Qwen3.8, Alibaba отладила пайплайн быстрой итерации. Это сокращает время на пост-тренинг и выравнивание. Если базовая модель 70B уже обучена, то 2-3 месяца на SFT, RLHF и тестирование - реалистичный срок. Это даёт релиз в октябре-ноябре 2026.

Фактор третий: исторический паттерн. Alibaba выпускает модели среднего размера через 4-6 месяцев после флагманских анонсов. Qwen3.8-Max-Preview анонсирован в июле 2026. Добавляем 4-6 месяцев - получаем ноябрь 2026 - январь 2027. Это согласуется с прогнозом «не ранее второй половины 2026».

Важная оговорка: всё это - экстраполяция. Alibaba может изменить стратегию в любой момент. Кадровые перестановки в команде Qwen, которые мы анализировали в статье о влиянии смены команды на развитие модели, добавляют неопределённости. Новый состав может как ускорить, так и затормозить разработку.

Инференс Qwen 30B, 70B и 100B: что выбрать под свои задачи

Выбор размера модели - это выбор между качеством, скоростью и стоимостью инференса. Для Qwen 3 ожидаемые характеристики можно спрогнозировать на основе Qwen 2.5 и архитектурных трендов.

Размер VRAM FP16 VRAM INT8 VRAM INT4 GPU (минимально) Сценарий
30B 60 ГБ 30 ГБ 15-18 ГБ 1x A100-80G / 2x RTX 4090 Чат-боты, суммаризация, классификация
70B 140 ГБ 70 ГБ 35-42 ГБ 2x A100-80G / 4x RTX 4090 RAG, анализ документов, сложная кодогенерация
100B 200 ГБ 100 ГБ 50-60 ГБ 4x A100-80G / 8x RTX 4090 Агенты, multi-step reasoning, научные расчёты

Для 100B-моделей архитектура MoE меняет картину. Если Qwen выпустит 100B-MoE с 10-15B активных параметров, требования к памяти для инференса снизятся до уровня 30-40 ГБ VRAM при сохранении качества, близкого к dense-моделям 100B+. Сообщество активно требует такой релиз, особенно в контексте запуска на Apache Spark - мы разбирали эту петицию и технические ограничения в отдельном материале.

Аппаратные требования: от consumer-железа до серверных решений

Квантизация - главный инструмент для запуска крупных моделей на ограниченном железе. Практика тестирования Qwen3.5 122B на 64 ГБ RAM показала: даже с агрессивным квантованием UD-Q2_K_XL модель выдаёт осмысленные ответы, но скорость падает до 2.9 токенов/с. Узкое место - пропускная способность памяти. DDR4-3200 даёт около 50 ГБ/с, DDR5-6000 - до 80 ГБ/с. Для комфортной работы с 70B-моделью в INT4 нужна пропускная способность не менее 200 ГБ/с, что достижимо только на GPU с HBM.

Конфигурации для разных бюджетов:

  • Consumer-сегмент (до $5000): 2x RTX 4090 24G, модель 30B в INT4, скорость 20-40 токенов/с. Подходит для прототипирования и персонального использования.
  • Prosumer/малый бизнес ($5000-$15000): 1x A100-80G или 4x RTX 4090, модель 70B в INT4, скорость 15-30 токенов/с. Достаточно для production чат-ботов и RAG.
  • Enterprise ($30000+): 4-8x A100-80G или H100, модель 100B в INT8, скорость 50+ токенов/с. Агентные системы, высоконагруженные API.

Сравнение с конкурентами: Llama 4, Mistral Large и другие

Прогнозировать позиции Qwen 3 можно на основе истории улучшений между поколениями. Qwen 2.5-72B отставала от Llama 3.1-70B на 2-4 пункта MMLU и на 5-7 пунктов HumanEval. Если Qwen 3 сохранит темп прироста в 3-5% по ключевым бенчмаркам, она сравняется или обойдёт Llama 4 в задачах на многоязычность и математику - традиционно сильных сторонах семейства Qwen.

Mistral Large остаётся ориентиром по качеству кода. Qwen 2.5-72B проигрывала ей на HumanEval около 8 пунктов. Сокращение этого разрыва - критический фактор для adoption в среде разработчиков. Если Qwen 3 покажет 85+ HumanEval, это станет переломным моментом.

Ключевая интрига - стоимость инференса. Qwen3.8-Max-Preview уже показала снижение расхода входных токенов на 35-40% в многошаговых задачах по сравнению с Minimax M3 и GPT 5.6, что мы детально разбирали в анализе эффективности токенов. Если этот же подход применят к моделям 30B–100B, Qwen 3 может стать самым экономичным решением в своём классе.

Как подготовиться к релизу: практические рекомендации

Ожидание релиза не означает бездействия. Три шага, которые можно сделать уже сейчас.

Что можно сделать уже сегодня: бенчмаркинг на Qwen 2.5

Запустите Qwen 2.5-72B через vLLM и замерьте метрики на ваших задачах. Это даст baseline для сравнения с Qwen 3 и позволит оценить реальную нагрузку на инфраструктуру.

# docker-compose для vLLM с Qwen 2.5-72B
version: '3.8'
services:
  vllm:
    image: vllm/vllm-openai:latest
    command: >
      --model Qwen/Qwen2.5-72B-Instruct
      --tensor-parallel-size 2
      --max-model-len 32768
      --gpu-memory-utilization 0.90
      --dtype auto
    ports:
      - "8000:8000"
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 2
              capabilities: [gpu]
    volumes:
      - /mnt/models:/root/.cache/huggingface

Ключевые метрики для замера:

  • Tokens per second (tps) на генерации - целевой минимум 20 tps для интерактивных сценариев;
  • Time to first token (TTFT) - должно быть менее 500 мс для комфортной работы;
  • Latency на обработку промпта длиной 4096 токенов - критично для RAG;
  • Пиковое потребление VRAM - основа для расчёта стоимости инференса.

Спроектируйте инфраструктуру с запасом под 70B-модели. Если сейчас вы используете 13B-модель на одной RTX 4090, заложите в бюджет апгрейд до 2-4 GPU или аренду A100 в облаке. Переход с 13B на 70B увеличивает требования к VRAM в 4-5 раз, а к пропускной способности памяти - в 3-4 раза.

Мониторьте официальные каналы Alibaba: репозиторий Qwen на Hugging Face, блог Alibaba Cloud и аккаунт команды в Twitter/X. Анонсы обычно появляются там за 2-4 недели до публикации весов. Этого времени достаточно для подготовки окружения, но недостаточно для закупки железа - поэтому планирование инфраструктуры нужно начинать заранее.

Резюме: стоит ли ждать Qwen 3 или брать аналоги сейчас

Решение зависит от горизонта планирования и критичности проекта.

Если вам нужно внедрение в production в ближайшие 2-3 месяца - берите текущих лидеров. Llama 3.1-70B и Mistral Large - зрелые модели с предсказуемым поведением, обширной экосистемой инструментов и понятными ограничениями. Вы не получите потенциального прироста от Qwen 3, но и не попадёте в ситуацию «ждём ещё полгода».

Если запуск проекта планируется на начало 2027 года - ожидание Qwen 3 оправдано. Прирост в 3-5% по ключевым бенчмаркам и потенциальное снижение стоимости инференса на 30-40% (судя по технологиям, обкатанным на Qwen3.8-Max-Preview) могут окупить задержку. Особенно если ваши задачи связаны с многоязычностью или математическим reasoning - традиционно сильными сторонами Qwen.

Промежуточный вариант: начать разработку на Llama 3.1-70B с архитектурой, допускающей замену модели. Абстрагируйте вызовы LLM за единым API-слоем, используйте формат промптов, совместимый с разными моделями, и не зашивайте жёстко особенности конкретной модели в пайплайн. Когда Qwen 3 выйдет, вы сможете переключиться за несколько дней и провести A/B-тестирование на реальных данных.

Релиз Qwen 30B–100B - вопрос времени. Вторая половина 2026 года остаётся наиболее вероятным окном. Точная дата зависит от конкурентного давления, готовности архитектуры и внутренних процессов Alibaba. Мы продолжим отслеживать ситуацию и обновим прогноз при появлении новых данных.

Подписаться на канал