Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Средние MoE-модели 2026: обзор Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и альтернатив

Сравниваем средние MoE-модели 2026 года: Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и DeepSeek v4 Flash. Бенчмарки, требования к VRAM, примеры кода для запуска

Коротко

Что будет в материале

  1. 01

    Критерии выбора: что значит «средняя MoE-модель» в 2026 году

  2. 02

    Qwen 3.5 35B: лидер по производительности в классе

  3. 03

    Gemma 4 A4B: компактность и эффективность от Google

  4. 04

    Nemotron 3 Nano: нишевый игрок с фокусом на эффективность

Критерии выбора: что значит «средняя MoE-модель» в 2026 году

В 2026 году сегмент средних MoE-моделей оформился в отдельный класс решений для инференса. Граница класса определяется практическими ограничениями оборудования: до 60 миллиардов параметров в формате float8 или до 110 миллиардов в формате mxfp4. Модели этого диапазона запускаются на одном-двух потребительских GPU или на серверном ускорителе среднего уровня, сохраняя производительность, сопоставимую с гораздо более тяжелыми dense-архитектурами.

Архитектура Mixture of Experts меняет экономику инференса. Вместо активации всех параметров на каждом токене модель задействует только небольшую долю экспертов - от 3 до 15 миллиардов активных параметров. Это снижает требования к пропускной способности памяти и вычислительным ресурсам. Для практика это означает: модель с 35B общих параметров и 3B активных может работать быстрее и требовать меньше VRAM, чем dense-модель на 8B, но превосходить её по качеству ответов.

DeepSeek v4 Flash формально выходит за верхнюю границу класса - её общий размер в float8 превышает 60B. Однако по характеру использования и позиционированию она примыкает к средним MoE, поэтому рассматривается как пограничный случай. Если ваше оборудование допускает небольшой запас по памяти, эта модель заслуживает внимания.

Задачи, которые закрывают средние MoE: обслуживание чат-ботов с низкой задержкой, кодогенерация, обработка документов, агентные сценарии. Они не требуют кластеров из 8 GPU и при этом дают качество, достаточное для коммерческого использования. Модели с 2B активных параметров закрывают нижнюю часть спектра, а средние MoE - его основной рабочий диапазон.

Qwen 3.5 35B: лидер по производительности в классе

Qwen 3.5 35B занимает верхнюю позицию среди средних MoE-моделей по совокупности бенчмарков. Модель построена на архитектуре Mixture of Experts с 35 миллиардами общих параметров и примерно 3 миллиардами активных на каждый токен. Соотношение общих и активных параметров оптимизировано для максимальной плотности знаний при умеренном потреблении памяти.

Контекстное окно в 128K токенов позволяет обрабатывать длинные документы без деградации качества. Поддержка vLLM, TensorRT-LLM и Hugging Face Transformers обеспечивает бесшовную интеграцию в существующие пайплайны инференса. На практике модель запускается на одном GPU с 24 ГБ VRAM в 4-битном квантовании или на двух картах в float8.

Архитектурные инновации Qwen 3.5 35B

Маршрутизация экспертов в Qwen 3.5 использует улучшенный механизм балансировки загрузки. В отличие от ранних MoE, где часть экспертов простаивала, здесь распределение токенов между экспертами близко к равномерному. Это повышает утилизацию параметров и стабилизирует скорость генерации.

Механизм внимания оптимизирован через Grouped Query Attention с 8 группами запросов, что снижает KV-кеш и ускоряет инференс на длинных последовательностях. По сравнению с dense-моделями схожего размера, например Qwen 2.5 14B, MoE-версия даёт прирост в 15-20% на задачах рассуждения при вдвое меньшем потреблении памяти на токен.

Отдельного упоминания заслуживает поддержка формата mxfp4 - микромасштабируемого 4-битного floating point. Этот формат сохраняет динамический диапазон лучше, чем целочисленное квантование, и позволяет запускать модель на оборудовании с 16 ГБ VRAM без критической потери качества.

Бенчмарки и сравнение с аналогами

БенчмаркQwen 3.5 35BGemma 4 A4BNemotron 3 Nano
MMLU82.478.175.3
HumanEval85.280.672.8
GSM8K91.788.384.1
BBH79.574.270.6

Qwen 3.5 35B опережает конкурентов по всем ключевым метрикам. Разрыв особенно заметен на задачах кода и математического рассуждения, где архитектура MoE с эффективной маршрутизацией даёт максимальное преимущество. Архитектурный анализ Qwen 3.x-35B подтверждает: модель проектировалась с прицелом на практический инференс, а не на бенчмарк-рекорды.

Слабая сторона Qwen 3.5 - требовательность к пропускной способности памяти при обработке длинных промптов. На GPU с узкой шиной, например RTX 4060 Ti с 128-битным интерфейсом, скорость prefill-фазы падает до 50-70 токенов в секунду. Это ограничивает применение в сценариях с большими системными промптами.

Gemma 4 A4B: компактность и эффективность от Google

Gemma 4 A4B - ответ Google на запрос рынка в максимально эффективных MoE-моделях. При 4 миллиардах активных параметров модель показывает результаты, сопоставимые с dense-архитектурами на 8-12B. Секрет в агрессивной стратегии обучения: корпус данных в 15 триллионов токенов с акцентом на код и многоязычные тексты.

Модель использует архитектуру с 4 экспертами, из которых активируются 2 на каждый токен. Это даёт 4B активных параметров при общем размере около 26B. Контекстное окно - 32K токенов, что меньше, чем у Qwen, но достаточно для большинства прикладных задач.

Запуск Gemma 4 A4B возможен на потребительских GPU с 8 ГБ VRAM в 4-битном квантовании. На RTX 3060 12GB модель выдаёт 45-55 токенов в секунду в режиме генерации - комфортный уровень для диалоговых систем. Прямое сравнение Gemma-4 и Qwen3.6-MoE показывает, что в задачах логического вывода 4B активных параметров Gemma конкурируют с MoE-аналогами на равных.

Сценарии использования Gemma 4 A4B

Модель хорошо проявляет себя в чат-ботах и ассистентах, где требуется низкая задержка и стабильная скорость ответа. Кодогенерация - вторая сильная сторона: на бенчмарке HumanEval модель набирает 80.6, уступая только Qwen 3.5 35B в своём классе.

Суммаризация документов и извлечение структурированной информации - ещё один практичный кейс. 32K контекста хватает для большинства корпоративных документов, а скорость обработки позволяет встраивать модель в real-time пайплайны.

Ограничения Gemma 4 A4B: узкое контекстное окно по сравнению с Qwen, более слабые результаты на математическом рассуждении уровня олимпиадных задач. Модель не предназначена для агентных сценариев с длинным горизонтом планирования - здесь требуется больше активных параметров.

Nemotron 3 Nano: нишевый игрок с фокусом на эффективность

Nemotron 3 Nano - разработка NVIDIA, оптимизированная под инференс на GPU компании. Модель использует архитектуру MoE с 8 экспертами и примерно 3B активных параметров. Ключевое отличие от конкурентов - нативная интеграция с TensorRT-LLM и поддержка формата FP8 на аппаратном уровне.

На GPU с архитектурой Blackwell и старше Nemotron 3 Nano демонстрирует прирост скорости в 30-40% по сравнению с запуском через универсальные фреймворки. Это достигается за счёт fused-операций внимания и оптимизированных ядер для MoE-маршрутизации. Модель поставляется в контейнерах NGC с предустановленными конфигурациями для H100, L40S и RTX 5000-й серии.

Бенчмарки Nemotron 3 Nano скромнее, чем у Qwen и Gemma: MMLU 75.3, HumanEval 72.8. Модель уступает в знаниях общего назначения, но выигрывает в специфических сценариях - например, в задачах с жёсткими требованиями к задержке, где важнее скорость, чем абсолютное качество ответа.

Практическая рекомендация: если ваш стек построен на NVIDIA AI Enterprise и вы используете Triton Inference Server, Nemotron 3 Nano даст лучшую утилизацию оборудования. В остальных случаях Qwen или Gemma предпочтительнее по соотношению качество/ресурсы.

DeepSeek v4 Flash: модель на границе класса

DeepSeek v4 Flash с 284B общих параметров и 13B активных формально превышает лимит средних MoE. Однако модель активно используется в том же сегменте задач, что и Qwen 3.5 35B, и часто сравнивается с ней напрямую. Причина - агрессивное квантование: в формате mxfp4 модель укладывается в 48 ГБ VRAM, что соответствует двум потребительским GPU.

Архитектурно DeepSeek v4 Flash наследует подходы флагманской DeepSeek v4: мультиголовое латентное внимание, глубокая MoE-структура с 64 экспертами, разделение на shared и routed experts. 13B активных параметров - больше, чем у Qwen 3.5 35B, что даёт преимущество в задачах, требующих широких знаний.

Сравнение производительности: на MMLU DeepSeek v4 Flash набирает 84.1 против 82.4 у Qwen, на HumanEval - 87.3 против 85.2. Разрыв в 2-3 пункта стабильно воспроизводится на большинстве бенчмарков. Плата за это - на 20-30% более низкая скорость генерации и повышенные требования к пропускной способности памяти.

Если у вас есть доступ к двум GPU с 24 ГБ VRAM каждый, DeepSeek v4 Flash становится практичным выбором. Для конфигураций с одной картой Qwen 3.5 35B остаётся оптимальным вариантом. Альтернативы с нестандартными архитектурами вроде Looped Transformer могут быть интересны для специфических агентных задач, но по универсальности уступают DeepSeek.

Практическое руководство: как выбрать и запустить среднюю MoE-модель

Выбор модели сводится к трём переменным: доступное железо, приоритет качества или скорости, специфика задач. Начните с инвентаризации VRAM - это главный ограничитель. Затем определите, что критичнее: минимальная задержка или максимальное качество ответа. И наконец, посмотрите на бенчмарки, релевантные вашим задачам: код, математика, общие знания.

Сравнительная таблица моделей

МодельАктивные параметрыКонтекстMMLUСкорость (t/s)*VRAM (FP8)
Qwen 3.5 35B~3B128K82.435-4520 ГБ
Gemma 4 A4B4B32K78.145-5514 ГБ
Nemotron 3 Nano~3B64K75.350-65**16 ГБ
DeepSeek v4 Flash13B128K84.125-3532 ГБ

* Скорость генерации на RTX 4090, batch size 1, FP8.
** На GPU NVIDIA с TensorRT-LLM, на универсальных фреймворках - 35-45 t/s.

Примеры кода для запуска

Qwen 3.5 35B через vLLM:

from vllm import LLM, SamplingParams

llm = LLM(
    model="Qwen/Qwen3.5-35B-A3B",
    dtype="float8",
    max_model_len=32768,
    gpu_memory_utilization=0.90,
    tensor_parallel_size=1
)

sampling_params = SamplingParams(
    temperature=0.7,
    top_p=0.9,
    max_tokens=2048
)

outputs = llm.generate(["Напиши функцию сортировки слиянием на Python"], sampling_params)
print(outputs[0].outputs[0].text)

Gemma 4 A4B через Hugging Face Transformers:

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model = AutoModelForCausalLM.from_pretrained(
    "google/gemma-4-26b-a4b",
    torch_dtype=torch.bfloat16,
    device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained("google/gemma-4-26b-a4b")

inputs = tokenizer("Объясни разницу между float8 и mxfp4", return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Nemotron 3 Nano через TensorRT-LLM:

# Предварительно собранный Docker-контейнер NGC
docker run --gpus all -it --rm \
  nvcr.io/nvidia/tritonserver:24.06-trtllm-python-py3 \
  tritonserver --model-repository=/models/nemotron3_nano

Квантизация - ключевой рычаг для запуска средних MoE на ограниченном железе. Формат mxfp4 предпочтительнее целочисленного 4-битного: он сохраняет динамический диапазон и меньше режет точность на задачах рассуждения. Для Qwen 3.5 35B переход с float8 на mxfp4 снижает VRAM с 20 до 12 ГБ при падении MMLU всего на 1.2 пункта. Практические тесты MoE-моделей в кодогенерации подтверждают: даже агрессивное квантование сохраняет работоспособность для большинства прикладных задач.

Оптимизация инференса: используйте continuous batching в vLLM для обслуживания множества одновременных запросов. Настройте prefix caching, если ваши запросы имеют общие системные промпты - это сокращает prefill-фазу на 40-60%. Для одиночных запросов отключите speculative decoding, если он не даёт измеримого прироста на вашем железе.

Будущее средних MoE-моделей: тренды и прогнозы

Три направления определят развитие средних MoE в 2027 году. Первое - дальнейший рост эффективности маршрутизации. Исследовательские лаборатории экспериментируют с динамическим числом активных экспертов в зависимости от сложности токена: простые токены проходят через 1-2 эксперта, сложные - через 4-6. Это снизит среднее количество активных параметров без потери качества.

Второе - аппаратная поддержка mxfp4 на уровне GPU следующего поколения. NVIDIA и AMD анонсировали нативные тензорные ядра для микромасштабируемых форматов, что удвоит эффективную пропускную способность памяти для MoE-моделей. Модели, которые сегодня требуют 20 ГБ VRAM в float8, будут запускаться на 8 ГБ с сохранением скорости.

Третье - расширение контекстных окон до 256K-512K токенов без квадратичного роста KV-кеша. Механизмы вроде Ring Attention и Layer-Specific KV Compression уже демонстрируют линейный рост потребления памяти с длиной контекста. Средние MoE-модели получат возможность обрабатывать целые кодовые базы и многотомные документы на одном GPU.

Ожидаемые модели 2027 года: Qwen 4 с 40B общих и 4B активных параметров, Gemma 5 с улучшенной многоязычностью, Llama 4 MoE от Meta. Готовьтесь к переходу уже сейчас: закладывайте в инфраструктуру поддержку mxfp4 и continuous batching, тестируйте пайплайны на текущем поколении средних MoE, чтобы быстро адаптироваться к новым моделям.

Подписаться на канал