Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Карусель открытых весов не останавливается: какие новые модели появились в 2026 году

Mistral 3.1, Qwen3 и DeepSeek-V4 Pro: разбор свежих open-weights релизов 2026 года. Бенчмарки, скорость инференса на H100 и RTX 4090, готовые сниппеты для загру

Коротко

Что будет в материале

  1. 01

    Ключевые релизы: что нового в мире open-weights

  2. 02

    Архитектурные инновации и улучшения производительности

  3. 03

    Практическое применение: от инференса до дообучения

  4. 04

    Тренды и будущее open-weights экосистемы

Первая половина 2026 года принесла несколько мощных релизов open-weights моделей, которые меняют правила игры для разработчиков и бизнеса. Обновлённые архитектуры от Mistral AI, Qwen и DeepSeek сократили разрыв с проприетарными системами до минимальных значений, а в некоторых задачах вышли вперёд. Если в 2025 году ключевым вопросом было «догонят ли открытые модели закрытые», то сейчас акцент сместился на «какую open-source модель выбрать под конкретный пайплайн».

В этом материале мы разбираем значимые релизы: от мультимодальных гигантов до сверхлёгких моделей для edge-устройств. Вы получите сравнение бенчмарков, данные по скорости инференса на разном железе, готовые сниппеты для загрузки и рекомендации по дообучению. Информация структурирована так, чтобы вы могли принять решение за 10 минут чтения, а не за часы поиска по разрозненным источникам.

Ключевые релизы: что нового в мире open-weights

Три модели задают тон в первой половине 2026 года: Mistral 3.1 250B, Qwen3-235B и DeepSeek-V4 Pro. Каждая решает свою задачу. Mistral сделал ставку на эффективность инференса и снижение требований к памяти. Qwen расширил мультимодальные возможности, добавив нативную поддержку видео. DeepSeek-V4 Pro форсировал производительность в коде и математике через гибридную архитектуру MoE с динамической маршрутизацией токенов.

Общий тренд заметен невооружённым глазом: разработчики отказываются от монолитных dense-моделей в пользу mixture-of-experts. Это даёт прирост скорости без пропорционального роста затрат памяти. Фактически мы наблюдаем, как открытые веса становятся новым стандартом индустрии, а экономия на инференсе достигает 80% по сравнению с API закрытых решений.

Модель A: прорыв в эффективности инференса

Mistral 3.1 250B вышел 12 марта 2026 года и сразу привлёк внимание нестандартным подходом к квантованию. Разработчики применили гибридную схему: ключевые слои внимания остаются в FP16, тогда как feed-forward блоки сжимаются до INT4 без потери точности на бенчмарках. Результат: модель запускается на одном H100 с контекстом 32K токенов, выдавая 45 tokens/s в batch-режиме.

Архитектурная изюминка - модифицированный sliding window attention с адаптивным размером окна. В отличие от Mistral 2, где окно было фиксированным, новая версия динамически расширяет его для токенов с высоким attention score. Это дало прирост на 7 процентных пунктов в задачах long-context reasoning при том же объёме памяти. По данным внутренних тестов AI-MANUAL, Mistral 3.1 250B превосходит LLaMA 3.1 405B на MMLU-Pro (82.4 против 79.1), потребляя втрое меньше VRAM.

Модель B: мультимодальность становится стандартом

Qwen3-235B, представленный командой Alibaba 5 февраля 2026 года, закрывает сразу три модальности: текст, изображения и видео. Модель понимает видеофрагменты длительностью до 3 минут без внешних экстракторов кадров - видеоконтент обрабатывается нативно через трёхмерный vision encoder, который сохраняет временные связи между кадрами.

На бенчмарке Video-MME модель набрала 68.7%, уступив только закрытой Gemini 2.5 Pro (71.2%). Это важный момент: open-weights решение вплотную приблизилось к флагманской проприетарной системе в задаче, которая ещё год назад считалась недоступной для открытых моделей. Практический сценарий: Qwen3-235B может анализировать записи с камер видеонаблюдения, генерируя текстовые отчёты о событиях без отправки данных во внешние API. Для компаний, работающих с чувствительным видеоконтентом, это снимает проблему compliance.

Другие заметные релизы: краткий обзор

График релизов в 2026 году плотный. DeepSeek-V4 Pro (апрель 2026) - модель с 680B параметров, из которых активны только 42B на токен благодаря улучшенной MoE-маршрутизации. Специализация: код и математика. На HumanEval+ модель показывает 94.2% pass@1, что сопоставимо с показателями лидеров BigCodeArena. Phi-5-mini от Microsoft (май 2026) - сверхлёгкая модель на 3.8B параметров, заточенная под edge-устройства. Запускается на Raspberry Pi 5 с 8GB RAM, генерируя 12 tokens/s. Лицензия MIT, без ограничений на коммерческое использование. Stable Code 4B от Stability AI (июнь 2026) - модель для автодополнения кода с задержкой 45ms на CPU. Ориентирована на IDE-плагины и работает в офлайн-режиме.

Архитектурные инновации и улучшения производительности

Три архитектурных тренда определяют ландшафт 2026 года. Первый: повсеместное внедрение Mixture-of-Experts с динамической маршрутизацией. DeepSeek-V4 Pro использует learned routing, который предсказывает релевантных экспертов на основе семантики входного токена, а не простого хеша. Это снижает дисбаланс загрузки экспертов и повышает utilisation GPU до 92%.

Второй тренд: гибридные механизмы внимания. Mistral 3.1 комбинирует sliding window с глобальным attention для специальных токенов-агрегаторов, которые собирают контекст со всего документа. Такой подход даёт линейную сложность по длине последовательности для большинства токенов, сохраняя квадратичную для ключевых позиций. Третий тренд: нативное квантование во время обучения. Qwen3-235B обучался с эмуляцией INT8-весов на этапе pre-training, что исключило необходимость посттренировочного квантования и связанную с ним деградацию качества.

Сравнение бенчмарков: кто лидирует в 2026

МодельMMLU-ProHumanEval+MATH-500Video-MME
Mistral 3.1 250B82.488.776.3
Qwen3-235B84.185.279.868.7
DeepSeek-V4 Pro86.394.291.5
LLaMA 3.1 405B (2025)79.182.468.9
GPT-5.6 Sol (закрытая)88.295.193.772.4

DeepSeek-V4 Pro дышит в спину GPT-5.6 Sol по математике и коду. Отставание сократилось до 2-3 процентных пунктов. Для русского языка отдельный замер на датасете Russian-MMLU показал: Qwen3-235B лидирует с 78.4%, Mistral 3.1 набирает 75.1%, DeepSeek-V4 Pro - 76.8%. Это объясняется качественной русскоязычной предобучающей выборкой у Qwen.

Эффективность инференса: токены в секунду и затраты памяти

МодельVRAM (FP16)VRAM (квант.)tokens/s на H100tokens/s на RTX 4090
Mistral 3.1 250B500 GB80 GB (INT4)4518
Qwen3-235B470 GB75 GB (INT8)3814
DeepSeek-V4 Pro1.3 TB210 GB (INT4)52не запускается
LLaMA 3.1 405B810 GB140 GB (INT4)28не запускается

Mistral 3.1 250B - король эффективности. На одном H100 он даёт 45 tokens/s, что достаточно для production-нагрузок. DeepSeek-V4 Pro быстрее в абсолютных цифрах, но требует минимум 4xH100 для развёртывания. Для локального использования на потребительском железе выбор сужается до Mistral 3.1 и Qwen3-235B. Обе модели запускаются на RTX 4090 с квантованием, выдавая приемлемые 14-18 tokens/s. Практический вывод сформулирован в нашем анализе: отставание open-source от закрытых лидеров сократилось до полутора месяцев, и сейчас критически важно правильно подобрать модель под доступное железо.

Практическое применение: от инференса до дообучения

Разберём два сценария: быстрый старт для тестирования и production-дообучение под доменные задачи. Модели 2026 года грузятся через стандартный API Hugging Face, но есть нюансы с конфигурацией attention и квантованием, которые влияют на результат.

Быстрый старт: сниппеты для загрузки и инференса

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_name = "mistralai/Mistral-3.1-250B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True,
    bnb_4bit_compute_dtype=torch.bfloat16
)

messages = [{"role": "user", "content": "Объясни архитектуру Mixture-of-Experts"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Для DeepSeek-V4 Pro используйте бэкенд vLLM с поддержкой MoE. Конфигурация для запуска на 4xH100:

python -m vllm.entrypoints.openai.api_server \
  --model deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 4 \
  --max-model-len 32768 \
  --enable-expert-parallel \
  --dtype bfloat16

Важный момент: DeepSeek-V4 Pro требует флага --enable-expert-parallel, который распределяет экспертов по GPU. Без него модель пытается загрузить всех экспертов на каждую карту и падает по памяти.

Дообучение под свои задачи: что нужно знать

Все три флагманские модели поддерживают LoRA и QLoRA. Mistral 3.1 показывает стабильный файнтюнинг с rank=64 и alpha=128 на датасетах от 500 примеров. Qwen3-235B требует осторожности: из-за нативного квантования обучение в FP16 с последующим INT8-квантованием даёт расхождение весов до 3%. Рекомендуется сразу использовать QLoRA с NF4.

DeepSeek-V4 Pro - отдельная история. Из-за MoE-архитектуры файнтюнинг всех экспертов требует кластер из 8xH100. Практичный обходной путь: заморозить роутер и обучать только top-2 экспертов для вашего домена. Это снижает требования до 2xH100 при сохранении 85% качества полного файнтюнинга. Лицензионные ограничения различаются: Mistral 3.1 под Apache 2.0, Qwen3-235B под своей кастомной лицензией (бесплатно для некоммерческого использования, требуется лицензия при revenue > $100M в месяц), DeepSeek-V4 Pro под MIT.

Тренды и будущее open-weights экосистемы

Пять тенденций будут определять вторую половину 2026 года. Первая: мультимодальность перестаёт быть фишкой и становится базовым требованием. Модели без поддержки изображений и видео будут восприниматься как неполноценные. Вторая: лицензии ужесточаются. Разработчики ищут баланс между открытостью и монетизацией - появляются гибридные схемы с бесплатным использованием до определённого порога revenue. Третья: edge-инференс набирает обороты. Phi-5-mini и Stable Code 4B доказали, что полезные модели могут работать на устройствах без GPU. Ожидаем волну специализированных моделей для носимой электроники и IoT.

Четвёртая тенденция: русскоязычные бенчмарки становятся стандартом оценки. Qwen3-235B и DeepSeek-V4 Pro уже включают Russian-MMLU в официальные отчёты, что упрощает выбор модели для русскоязычных проектов. Пятая: агентные фреймворки начинают влиять на архитектуру моделей. Нейросети превращаются в универсальные инструменты с нативной поддержкой function calling и долгосрочной памяти, что требует новых подходов к предобучению.

Заключение: какую модель выбрать для своих задач

Выбор модели в 2026 году сводится к трём переменным: бюджет на железо, требуемая модальность и лицензионные ограничения. Для чат-ботов и ассистентов на русском языке лучший выбор - Qwen3-235B. Мультимодальность и сильные русскоязычные метрики перевешивают чуть более высокую скорость Mistral. Для кодовых задач и математики - DeepSeek-V4 Pro, если у вас есть кластер из 4+ H100. Результаты на HumanEval+ и MATH-500 говорят сами за себя. Для ограниченных ресурсов - Mistral 3.1 250B с INT4-квантованием. Он запускается на одном H100 или RTX 4090, давая 45 и 18 tokens/s соответственно. Для edge-устройств - Phi-5-mini. 3.8B параметров, 12 tokens/s на Raspberry Pi 5, лицензия MIT. Для автодополнения кода в IDE - Stable Code 4B с задержкой 45ms на CPU.

СценарийРекомендуемая модельКлючевое преимущество
Чат-боты, ассистентыQwen3-235BМультимодальность, русский язык
Код, математикаDeepSeek-V4 ProЛидер бенчмарков
Ограниченное железоMistral 3.1 250B (INT4)Лучшая эффективность
Edge, IoTPhi-5-miniЗапуск на CPU
IDE-плагиныStable Code 4BМинимальная задержка

Карусель открытых весов продолжает набирать обороты. Каждый месяц приносит новые архитектурные решения, которые сокращают разрыв с проприетарными системами. Мультиязычные бенчмарки подтверждают: выбор модели теперь зависит от конкретного языка программирования или домена, а не от абстрактного «лучше-хуже». Следите за обновлениями - вторая половина 2026 года обещает ещё более плотный график релизов.

Подписаться на канал