Alibaba выпустила Qwen3.8-Max-Preview - модель на 2,4 триллиона параметров, которую позиционируют как вторую после Claude Fable 5. Громкий анонс, но без карточки модели, без публичных бенчмарков и без независимых тестов в LMSys Arena. На руках только заявления компании и цены API. Тем временем Kimi K3 от Moonshot AI уже показывает результаты на бенчмарках и готовится открыть веса 27 июля 2026 года. Разбираем, что реально стоит за анонсом Qwen3.8-Max, где модель сильна, а где пока проигрывает конкурентам, и когда появятся объективные данные для итогового вывода.
Практическая ценность preview-версии есть, но с ограничениями. API работает, мультимодальность впечатляет, цены на старте снижены. Однако локальный запуск модели такого масштаба нереалистичен для обычного пользователя, а отсутствие независимых тестов заставляет полагаться только на обещания Alibaba. В этом разборе - архитектура, экономика использования, сравнение с Kimi K3 и Claude Fable 5, альтернативы для локального инференса и прогноз по срокам появления объективных данных.
Что известно о Qwen3.8-Max на данный момент: архитектура, параметры и мультимодальность
Qwen3.8-Max-Preview - флагманская модель Alibaba с заявленными 2,4 триллиона параметров. Это разреженная архитектура Mixture-of-Experts (MoE), нативная поддержка изображений, видео и документов. Точное число активных параметров не раскрыто, и это ключевая неизвестная: от неё зависит реальная стоимость инференса и требования к оборудованию. Модель доступна через API Alibaba Cloud, Token Plan и Qoder по сниженным ценам на период preview.
Стратегия Alibaba с этой моделью напоминает подход, который мы уже разбирали в контексте китайских open-weight моделей: быстрый выпуск, агрессивное позиционирование, но с одним отличием - Qwen3.8-Max пока закрыта. Ни карточки модели, ни весов, ни бенчмарков. Только заявления и preview-доступ.
Архитектура Mixture-of-Experts: что это значит для производительности и стоимости инференса
MoE-архитектура работает так: модель состоит из множества «экспертов» - специализированных подсетей, и при каждом запросе активируется только часть из них. 2,4 триллиона параметров - это общий объём, а не количество активных параметров на один токен. Если у Qwen3.8-Max активируется, скажем, 10% экспертов, реальная вычислительная нагрузка сопоставима с плотной моделью на 200-300 миллиардов параметров.
Это снижает требования к памяти и ускоряет инференс по сравнению с плотной моделью того же размера. Но есть нюанс: MoE-модели требовательны к пропускной способности памяти, потому что эксперты нужно подгружать. Для облачного API это решаемо, для локального запуска - критично. Даже с квантизацией INT4 модель на 2,4T параметров потребует около 1,2 ТБ видеопамяти только под веса, без учёта кэша ключей и значений. Это кластер из 15-20 GPU A100 по 80 ГБ.
Alibaba не раскрывает коэффициент разреженности Qwen3.8-Max. Без этого нельзя точно оценить ни стоимость инференса для провайдера, ни потенциал для локального запуска. Для сравнения: у Kimi K3 с 2,8 трлн параметров открытая архитектура и известный коэффициент активации, что позволяет сообществу точно рассчитывать требования к железу.
Мультимодальность из коробки: изображения, видео, документы
Qwen3.8-Max поддерживает нативную мультимодальность - изображения, видео и документы обрабатываются без отдельных моделей-коннекторов. Это практическое преимущество перед Claude Fable 5, где мультимодальность ограничена изображениями, и перед Kimi K3, где фокус смещён в сторону текстовых и кодовых задач.
Сценарии использования: анализ графиков и диаграмм в PDF-отчётах, описание видеоряда, извлечение структурированных данных из сканов документов. Для бизнес-аналитики и автоматизации документооборота такая интеграция сокращает пайплайн обработки: не нужно подключать отдельные vision-модели или OCR-системы.
Цены на мультимодальные входы пока не детализированы - Alibaba опубликовала только базовые тарифы на текстовые токены (~$2.50 за 1M входа, ~$7.50 за 1M выхода). Обработка изображений и видео обычно тарифицируется с коэффициентом, кратным текстовым токенам, и это стоит учитывать при расчёте бюджета.
Qwen3.8-Max vs Kimi K3 vs Claude Fable 5: сравнение на основе доступных данных
Сравнивать модели без независимых бенчмарков - задача с оговорками. Для Qwen3.8-Max доступны только заявления Alibaba, для Kimi K3 - публичные результаты на SpreadsheetBench 2 и ArtificalAnalysis, для Claude Fable 5 - статус текущего лидера. Сведём известные характеристики в таблицу.
| Характеристика | Qwen3.8-Max | Kimi K3 | Claude Fable 5 |
|---|---|---|---|
| Параметры (всего) | 2,4 трлн | 2,8 трлн | не раскрыто |
| Архитектура | MoE | MoE | плотная (предп.) |
| Открытые веса | нет | с 27 июля 2026 | нет |
| Мультимодальность | изображения, видео, документы | ограниченная | изображения |
| Публичные бенчмарки | нет | SpreadsheetBench 2 (#1), ArtificalAnalysis (#3) | множество |
| Цена API (вход/выход за 1M токенов) | ~$2.50/$7.50 | $3/$15 | выше |
Kimi K3 уже показала себя в независимых тестах. Модель заняла первое место в SpreadsheetBench 2, обогнав Claude Fable 5 на задачах с табличными данными, и третье место в рейтинге ArtificalAnalysis, опередив Claude Opus 4.8. Детальный разбор этих результатов подтверждает: Kimi K3 сильна в генерации кода, анализе текста и логических задачах. Qwen3.8-Max пока не может предъявить ничего сопоставимого.
Бенчмарки и независимые тесты: почему Kimi K3 пока впереди
Отсутствие публичных бенчмарков - критический недостаток Qwen3.8-Max на этапе принятия решений. Разработчик, выбирающий модель для production, не может опираться на заявления компании. Ему нужны цифры: точность на MMLU, HumanEval, MATH, производительность на реальных задачах.
Kimi K3 эти цифры уже дала. Прямой разбор производительности Kimi K3 против frontier-моделей показывает: модель с 2,8 трлн параметров и контекстом в 1M токенов конкурирует с закрытыми лидерами при цене API $3/$15 за 1M токенов. А с 27 июля 2026 веса станут открытыми - это меняет экономику для проектов с требованиями приватности.
Когда ждать Qwen3.8-Max в LMSys Arena? Обычно модели появляются там через 2-4 недели после preview-анонса. Если Alibaba не форсирует процесс, ждать объективных данных стоит к середине августа 2026. До этого любые сравнения - спекуляция.
Стратегии открытости: open weights у Kimi K3 и закрытость Qwen3.8-Max
27 июля 2026 года Kimi K3 открывает веса. Это значит: тонкая настройка под свои данные, локальный запуск на своём железе, отсутствие зависимости от API-провайдера. Для бизнеса с требованиями конфиденциальности - решающий фактор. Kimi K3 уже сократила отставание open-source от закрытых лидеров до 1,5 месяцев, и открытие весов усилит этот тренд.
Qwen3.8-Max пока закрыта. Alibaba не анонсировала планов по открытию весов, и модель доступна только через облачный API. Это стандартный подход для коммерческих моделей, но он ограничивает сценарии использования: никакой тонкой настройки, никакого локального инференса, полная зависимость от ценовой политики провайдера.
Практическая ценность preview-версии: API, цены и ограничения
Preview-доступ к Qwen3.8-Max открыт через три канала: Alibaba Cloud, Token Plan и Qoder. Базовые тарифы - ~$2.50 за 1M токенов входа и ~$7.50 за 1M токенов выхода. Это дешевле Kimi K3 на старте, но цены preview-периода могут измениться после полноценного релиза.
Ограничения стандартные для preview: нет SLA, возможны изменения API, нестабильность ответов. Alibaba практикует ежедневные чекпоинты во время превью-фазы - модель может менять поведение от сборки к сборке. Для экспериментов это нормально, для production - риск.
Экономика использования: когда Qwen3.8-Max дешевле конкурентов
При текущих ценах Qwen3.8-Max выгоднее Kimi K3 в сценариях с большим объёмом входных данных: обработка документов, анализ логов, чат-боты с длинным контекстом. Разница в $0.50 на 1M входных токенов при объёмах в миллиарды токенов в месяц даёт ощутимую экономию.
Пример расчёта для чат-бота с 10M запросов в месяц, средняя длина входа 2000 токенов, выхода 500 токенов:
- Qwen3.8-Max: вход - 20B токенов × $2.50 = $50 000, выход - 5B токенов × $7.50 = $37 500, итого $87 500
- Kimi K3: вход - 20B токенов × $3 = $60 000, выход - 5B токенов × $15 = $75 000, итого $135 000
Разница в $47 500 в месяц - существенно. Но этот расчёт не учитывает мультимодальные входы, которые у Qwen3.8-Max могут тарифицироваться с повышающим коэффициентом. Точных цифр Alibaba пока не дала.
Реалистичность локального запуска: можно ли развернуть 2,4 трлн параметров на своём железе
Короткий ответ: нет. Даже с MoE-архитектурой и агрессивной квантизацией модель на 2,4 триллиона параметров требует кластер серверов. Если предположить коэффициент активации 10% и квантизацию INT4, только под активные веса нужно около 120 ГБ видеопамяти. Полный набор весов - больше 1,2 ТБ. Это 15-20 GPU A100 по 80 ГБ, и это без учёта кэша KV и накладных расходов на коммуникацию между экспертами.
Для сравнения: запуск плотной модели на 70B параметров в INT4 требует около 40 ГБ - это одна consumer-видеокарта RTX 4090 или A6000. Разрыв на два порядка. Локальный инференс Qwen3.8-Max нереалистичен для 99% пользователей и компаний.
Альтернативы для локального инференса: Laguna S 2.1 и другие open-weight модели
Laguna S 2.1 от Poolside - открытая модель на 118 миллиардов параметров, которая помещается на один десктоп с NVIDIA DGX Spark и обходит модели в 10 раз крупнее на кодинговых бенчмарках. Веса доступны под лицензией OpenMDW-1.1 в форматах BF16, FP8, INT4, NVFP4.
Для задач, где нужен локальный инференс и высокое качество кода, Laguna S 2.1 - практичная альтернатива облачным гигантам. Модель не заменит Qwen3.8-Max в мультимодальных сценариях, но закроет потребности в генерации и анализе кода без затрат на API и рисков утечки данных.
Когда ждать объективных данных и стоит ли переходить на Qwen3.8-Max сейчас
Независимые тесты Qwen3.8-Max в LMSys Arena появятся ориентировочно через 2-4 недели. Если модель действительно вторая после Claude Fable 5, это подтвердится рейтингом. Если нет - станет ясно, насколько заявления Alibaba расходятся с реальностью.
Рекомендации по сценариям:
- Эксперименты и R&D: пробовать API Qwen3.8-Max сейчас. Цены снижены, мультимодальность интересна, риски минимальны.
- Production с упором на мультимодальность: тестировать Qwen3.8-Max, но не мигрировать до стабильной версии и публичных бенчмарков.
- Production с требованиями приватности: ждать 27 июля и оценивать Kimi K3 с открытыми весами. Локальный запуск 2,8T модели сложен, но возможен на кластере, а открытость весов даёт контроль.
- Локальный инференс на одном сервере: смотреть на Laguna S 2.1 или другие open-weight модели масштаба 70-120B.
Выбор между Qwen3.8-Max и Kimi K3 сводится к приоритетам. Нужна мультимодальность и низкая цена API - Qwen3.8-Max выглядит привлекательно, но требует проверки независимыми тестами. Нужна открытость, тонкая настройка и уже подтверждённое качество - Kimi K3 с 27 июля становится очевидным кандидатом. Первые утечки и тесты Kimi K3 на арене LLM подтверждают серьёзность этой модели. Ждать или переходить - решение за вами, но теперь оно основано на фактах, а не на заявлениях.