Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Qwen3.8-Max: что скрывается за анонсом модели на 2,4 трлн параметров и стоит ли ждать её релиза

Разбираем анонс Qwen3.8-Max от Alibaba: архитектура MoE на 2,4 трлн параметров, нативная мультимодальность, цены API и отсутствие бенчмарков. Сравниваем с Kimi

Коротко

Что будет в материале

  1. 01

    Что известно о Qwen3.8-Max на данный момент: архитектура, параметры и мультимодальность

  2. 02

    Qwen3.8-Max vs Kimi K3 vs Claude Fable 5: сравнение на основе доступных данных

  3. 03

    Практическая ценность preview-версии: API, цены и ограничения

  4. 04

    Реалистичность локального запуска: можно ли развернуть 2,4 трлн параметров на своём железе

Alibaba выпустила Qwen3.8-Max-Preview - модель на 2,4 триллиона параметров, которую позиционируют как вторую после Claude Fable 5. Громкий анонс, но без карточки модели, без публичных бенчмарков и без независимых тестов в LMSys Arena. На руках только заявления компании и цены API. Тем временем Kimi K3 от Moonshot AI уже показывает результаты на бенчмарках и готовится открыть веса 27 июля 2026 года. Разбираем, что реально стоит за анонсом Qwen3.8-Max, где модель сильна, а где пока проигрывает конкурентам, и когда появятся объективные данные для итогового вывода.

Практическая ценность preview-версии есть, но с ограничениями. API работает, мультимодальность впечатляет, цены на старте снижены. Однако локальный запуск модели такого масштаба нереалистичен для обычного пользователя, а отсутствие независимых тестов заставляет полагаться только на обещания Alibaba. В этом разборе - архитектура, экономика использования, сравнение с Kimi K3 и Claude Fable 5, альтернативы для локального инференса и прогноз по срокам появления объективных данных.

Что известно о Qwen3.8-Max на данный момент: архитектура, параметры и мультимодальность

Qwen3.8-Max-Preview - флагманская модель Alibaba с заявленными 2,4 триллиона параметров. Это разреженная архитектура Mixture-of-Experts (MoE), нативная поддержка изображений, видео и документов. Точное число активных параметров не раскрыто, и это ключевая неизвестная: от неё зависит реальная стоимость инференса и требования к оборудованию. Модель доступна через API Alibaba Cloud, Token Plan и Qoder по сниженным ценам на период preview.

Стратегия Alibaba с этой моделью напоминает подход, который мы уже разбирали в контексте китайских open-weight моделей: быстрый выпуск, агрессивное позиционирование, но с одним отличием - Qwen3.8-Max пока закрыта. Ни карточки модели, ни весов, ни бенчмарков. Только заявления и preview-доступ.

Архитектура Mixture-of-Experts: что это значит для производительности и стоимости инференса

MoE-архитектура работает так: модель состоит из множества «экспертов» - специализированных подсетей, и при каждом запросе активируется только часть из них. 2,4 триллиона параметров - это общий объём, а не количество активных параметров на один токен. Если у Qwen3.8-Max активируется, скажем, 10% экспертов, реальная вычислительная нагрузка сопоставима с плотной моделью на 200-300 миллиардов параметров.

Это снижает требования к памяти и ускоряет инференс по сравнению с плотной моделью того же размера. Но есть нюанс: MoE-модели требовательны к пропускной способности памяти, потому что эксперты нужно подгружать. Для облачного API это решаемо, для локального запуска - критично. Даже с квантизацией INT4 модель на 2,4T параметров потребует около 1,2 ТБ видеопамяти только под веса, без учёта кэша ключей и значений. Это кластер из 15-20 GPU A100 по 80 ГБ.

Alibaba не раскрывает коэффициент разреженности Qwen3.8-Max. Без этого нельзя точно оценить ни стоимость инференса для провайдера, ни потенциал для локального запуска. Для сравнения: у Kimi K3 с 2,8 трлн параметров открытая архитектура и известный коэффициент активации, что позволяет сообществу точно рассчитывать требования к железу.

Мультимодальность из коробки: изображения, видео, документы

Qwen3.8-Max поддерживает нативную мультимодальность - изображения, видео и документы обрабатываются без отдельных моделей-коннекторов. Это практическое преимущество перед Claude Fable 5, где мультимодальность ограничена изображениями, и перед Kimi K3, где фокус смещён в сторону текстовых и кодовых задач.

Сценарии использования: анализ графиков и диаграмм в PDF-отчётах, описание видеоряда, извлечение структурированных данных из сканов документов. Для бизнес-аналитики и автоматизации документооборота такая интеграция сокращает пайплайн обработки: не нужно подключать отдельные vision-модели или OCR-системы.

Цены на мультимодальные входы пока не детализированы - Alibaba опубликовала только базовые тарифы на текстовые токены (~$2.50 за 1M входа, ~$7.50 за 1M выхода). Обработка изображений и видео обычно тарифицируется с коэффициентом, кратным текстовым токенам, и это стоит учитывать при расчёте бюджета.

Qwen3.8-Max vs Kimi K3 vs Claude Fable 5: сравнение на основе доступных данных

Сравнивать модели без независимых бенчмарков - задача с оговорками. Для Qwen3.8-Max доступны только заявления Alibaba, для Kimi K3 - публичные результаты на SpreadsheetBench 2 и ArtificalAnalysis, для Claude Fable 5 - статус текущего лидера. Сведём известные характеристики в таблицу.

Характеристика Qwen3.8-Max Kimi K3 Claude Fable 5
Параметры (всего) 2,4 трлн 2,8 трлн не раскрыто
Архитектура MoE MoE плотная (предп.)
Открытые веса нет с 27 июля 2026 нет
Мультимодальность изображения, видео, документы ограниченная изображения
Публичные бенчмарки нет SpreadsheetBench 2 (#1), ArtificalAnalysis (#3) множество
Цена API (вход/выход за 1M токенов) ~$2.50/$7.50 $3/$15 выше

Kimi K3 уже показала себя в независимых тестах. Модель заняла первое место в SpreadsheetBench 2, обогнав Claude Fable 5 на задачах с табличными данными, и третье место в рейтинге ArtificalAnalysis, опередив Claude Opus 4.8. Детальный разбор этих результатов подтверждает: Kimi K3 сильна в генерации кода, анализе текста и логических задачах. Qwen3.8-Max пока не может предъявить ничего сопоставимого.

Бенчмарки и независимые тесты: почему Kimi K3 пока впереди

Отсутствие публичных бенчмарков - критический недостаток Qwen3.8-Max на этапе принятия решений. Разработчик, выбирающий модель для production, не может опираться на заявления компании. Ему нужны цифры: точность на MMLU, HumanEval, MATH, производительность на реальных задачах.

Kimi K3 эти цифры уже дала. Прямой разбор производительности Kimi K3 против frontier-моделей показывает: модель с 2,8 трлн параметров и контекстом в 1M токенов конкурирует с закрытыми лидерами при цене API $3/$15 за 1M токенов. А с 27 июля 2026 веса станут открытыми - это меняет экономику для проектов с требованиями приватности.

Когда ждать Qwen3.8-Max в LMSys Arena? Обычно модели появляются там через 2-4 недели после preview-анонса. Если Alibaba не форсирует процесс, ждать объективных данных стоит к середине августа 2026. До этого любые сравнения - спекуляция.

Стратегии открытости: open weights у Kimi K3 и закрытость Qwen3.8-Max

27 июля 2026 года Kimi K3 открывает веса. Это значит: тонкая настройка под свои данные, локальный запуск на своём железе, отсутствие зависимости от API-провайдера. Для бизнеса с требованиями конфиденциальности - решающий фактор. Kimi K3 уже сократила отставание open-source от закрытых лидеров до 1,5 месяцев, и открытие весов усилит этот тренд.

Qwen3.8-Max пока закрыта. Alibaba не анонсировала планов по открытию весов, и модель доступна только через облачный API. Это стандартный подход для коммерческих моделей, но он ограничивает сценарии использования: никакой тонкой настройки, никакого локального инференса, полная зависимость от ценовой политики провайдера.

Практическая ценность preview-версии: API, цены и ограничения

Preview-доступ к Qwen3.8-Max открыт через три канала: Alibaba Cloud, Token Plan и Qoder. Базовые тарифы - ~$2.50 за 1M токенов входа и ~$7.50 за 1M токенов выхода. Это дешевле Kimi K3 на старте, но цены preview-периода могут измениться после полноценного релиза.

Ограничения стандартные для preview: нет SLA, возможны изменения API, нестабильность ответов. Alibaba практикует ежедневные чекпоинты во время превью-фазы - модель может менять поведение от сборки к сборке. Для экспериментов это нормально, для production - риск.

Экономика использования: когда Qwen3.8-Max дешевле конкурентов

При текущих ценах Qwen3.8-Max выгоднее Kimi K3 в сценариях с большим объёмом входных данных: обработка документов, анализ логов, чат-боты с длинным контекстом. Разница в $0.50 на 1M входных токенов при объёмах в миллиарды токенов в месяц даёт ощутимую экономию.

Пример расчёта для чат-бота с 10M запросов в месяц, средняя длина входа 2000 токенов, выхода 500 токенов:

  • Qwen3.8-Max: вход - 20B токенов × $2.50 = $50 000, выход - 5B токенов × $7.50 = $37 500, итого $87 500
  • Kimi K3: вход - 20B токенов × $3 = $60 000, выход - 5B токенов × $15 = $75 000, итого $135 000

Разница в $47 500 в месяц - существенно. Но этот расчёт не учитывает мультимодальные входы, которые у Qwen3.8-Max могут тарифицироваться с повышающим коэффициентом. Точных цифр Alibaba пока не дала.

Реалистичность локального запуска: можно ли развернуть 2,4 трлн параметров на своём железе

Короткий ответ: нет. Даже с MoE-архитектурой и агрессивной квантизацией модель на 2,4 триллиона параметров требует кластер серверов. Если предположить коэффициент активации 10% и квантизацию INT4, только под активные веса нужно около 120 ГБ видеопамяти. Полный набор весов - больше 1,2 ТБ. Это 15-20 GPU A100 по 80 ГБ, и это без учёта кэша KV и накладных расходов на коммуникацию между экспертами.

Для сравнения: запуск плотной модели на 70B параметров в INT4 требует около 40 ГБ - это одна consumer-видеокарта RTX 4090 или A6000. Разрыв на два порядка. Локальный инференс Qwen3.8-Max нереалистичен для 99% пользователей и компаний.

Альтернативы для локального инференса: Laguna S 2.1 и другие open-weight модели

Laguna S 2.1 от Poolside - открытая модель на 118 миллиардов параметров, которая помещается на один десктоп с NVIDIA DGX Spark и обходит модели в 10 раз крупнее на кодинговых бенчмарках. Веса доступны под лицензией OpenMDW-1.1 в форматах BF16, FP8, INT4, NVFP4.

Для задач, где нужен локальный инференс и высокое качество кода, Laguna S 2.1 - практичная альтернатива облачным гигантам. Модель не заменит Qwen3.8-Max в мультимодальных сценариях, но закроет потребности в генерации и анализе кода без затрат на API и рисков утечки данных.

Когда ждать объективных данных и стоит ли переходить на Qwen3.8-Max сейчас

Независимые тесты Qwen3.8-Max в LMSys Arena появятся ориентировочно через 2-4 недели. Если модель действительно вторая после Claude Fable 5, это подтвердится рейтингом. Если нет - станет ясно, насколько заявления Alibaba расходятся с реальностью.

Рекомендации по сценариям:

  • Эксперименты и R&D: пробовать API Qwen3.8-Max сейчас. Цены снижены, мультимодальность интересна, риски минимальны.
  • Production с упором на мультимодальность: тестировать Qwen3.8-Max, но не мигрировать до стабильной версии и публичных бенчмарков.
  • Production с требованиями приватности: ждать 27 июля и оценивать Kimi K3 с открытыми весами. Локальный запуск 2,8T модели сложен, но возможен на кластере, а открытость весов даёт контроль.
  • Локальный инференс на одном сервере: смотреть на Laguna S 2.1 или другие open-weight модели масштаба 70-120B.

Выбор между Qwen3.8-Max и Kimi K3 сводится к приоритетам. Нужна мультимодальность и низкая цена API - Qwen3.8-Max выглядит привлекательно, но требует проверки независимыми тестами. Нужна открытость, тонкая настройка и уже подтверждённое качество - Kimi K3 с 27 июля становится очевидным кандидатом. Первые утечки и тесты Kimi K3 на арене LLM подтверждают серьёзность этой модели. Ждать или переходить - решение за вами, но теперь оно основано на фактах, а не на заявлениях.

Подписаться на канал