Первая половина 2026 года принесла несколько мощных релизов open-weights моделей, которые меняют правила игры для разработчиков и бизнеса. Обновлённые архитектуры от Mistral AI, Qwen и DeepSeek сократили разрыв с проприетарными системами до минимальных значений, а в некоторых задачах вышли вперёд. Если в 2025 году ключевым вопросом было «догонят ли открытые модели закрытые», то сейчас акцент сместился на «какую open-source модель выбрать под конкретный пайплайн».
В этом материале мы разбираем значимые релизы: от мультимодальных гигантов до сверхлёгких моделей для edge-устройств. Вы получите сравнение бенчмарков, данные по скорости инференса на разном железе, готовые сниппеты для загрузки и рекомендации по дообучению. Информация структурирована так, чтобы вы могли принять решение за 10 минут чтения, а не за часы поиска по разрозненным источникам.
Ключевые релизы: что нового в мире open-weights
Три модели задают тон в первой половине 2026 года: Mistral 3.1 250B, Qwen3-235B и DeepSeek-V4 Pro. Каждая решает свою задачу. Mistral сделал ставку на эффективность инференса и снижение требований к памяти. Qwen расширил мультимодальные возможности, добавив нативную поддержку видео. DeepSeek-V4 Pro форсировал производительность в коде и математике через гибридную архитектуру MoE с динамической маршрутизацией токенов.
Общий тренд заметен невооружённым глазом: разработчики отказываются от монолитных dense-моделей в пользу mixture-of-experts. Это даёт прирост скорости без пропорционального роста затрат памяти. Фактически мы наблюдаем, как открытые веса становятся новым стандартом индустрии, а экономия на инференсе достигает 80% по сравнению с API закрытых решений.
Модель A: прорыв в эффективности инференса
Mistral 3.1 250B вышел 12 марта 2026 года и сразу привлёк внимание нестандартным подходом к квантованию. Разработчики применили гибридную схему: ключевые слои внимания остаются в FP16, тогда как feed-forward блоки сжимаются до INT4 без потери точности на бенчмарках. Результат: модель запускается на одном H100 с контекстом 32K токенов, выдавая 45 tokens/s в batch-режиме.
Архитектурная изюминка - модифицированный sliding window attention с адаптивным размером окна. В отличие от Mistral 2, где окно было фиксированным, новая версия динамически расширяет его для токенов с высоким attention score. Это дало прирост на 7 процентных пунктов в задачах long-context reasoning при том же объёме памяти. По данным внутренних тестов AI-MANUAL, Mistral 3.1 250B превосходит LLaMA 3.1 405B на MMLU-Pro (82.4 против 79.1), потребляя втрое меньше VRAM.
Модель B: мультимодальность становится стандартом
Qwen3-235B, представленный командой Alibaba 5 февраля 2026 года, закрывает сразу три модальности: текст, изображения и видео. Модель понимает видеофрагменты длительностью до 3 минут без внешних экстракторов кадров - видеоконтент обрабатывается нативно через трёхмерный vision encoder, который сохраняет временные связи между кадрами.
На бенчмарке Video-MME модель набрала 68.7%, уступив только закрытой Gemini 2.5 Pro (71.2%). Это важный момент: open-weights решение вплотную приблизилось к флагманской проприетарной системе в задаче, которая ещё год назад считалась недоступной для открытых моделей. Практический сценарий: Qwen3-235B может анализировать записи с камер видеонаблюдения, генерируя текстовые отчёты о событиях без отправки данных во внешние API. Для компаний, работающих с чувствительным видеоконтентом, это снимает проблему compliance.
Другие заметные релизы: краткий обзор
График релизов в 2026 году плотный. DeepSeek-V4 Pro (апрель 2026) - модель с 680B параметров, из которых активны только 42B на токен благодаря улучшенной MoE-маршрутизации. Специализация: код и математика. На HumanEval+ модель показывает 94.2% pass@1, что сопоставимо с показателями лидеров BigCodeArena. Phi-5-mini от Microsoft (май 2026) - сверхлёгкая модель на 3.8B параметров, заточенная под edge-устройства. Запускается на Raspberry Pi 5 с 8GB RAM, генерируя 12 tokens/s. Лицензия MIT, без ограничений на коммерческое использование. Stable Code 4B от Stability AI (июнь 2026) - модель для автодополнения кода с задержкой 45ms на CPU. Ориентирована на IDE-плагины и работает в офлайн-режиме.
Архитектурные инновации и улучшения производительности
Три архитектурных тренда определяют ландшафт 2026 года. Первый: повсеместное внедрение Mixture-of-Experts с динамической маршрутизацией. DeepSeek-V4 Pro использует learned routing, который предсказывает релевантных экспертов на основе семантики входного токена, а не простого хеша. Это снижает дисбаланс загрузки экспертов и повышает utilisation GPU до 92%.
Второй тренд: гибридные механизмы внимания. Mistral 3.1 комбинирует sliding window с глобальным attention для специальных токенов-агрегаторов, которые собирают контекст со всего документа. Такой подход даёт линейную сложность по длине последовательности для большинства токенов, сохраняя квадратичную для ключевых позиций. Третий тренд: нативное квантование во время обучения. Qwen3-235B обучался с эмуляцией INT8-весов на этапе pre-training, что исключило необходимость посттренировочного квантования и связанную с ним деградацию качества.
Сравнение бенчмарков: кто лидирует в 2026
| Модель | MMLU-Pro | HumanEval+ | MATH-500 | Video-MME |
|---|---|---|---|---|
| Mistral 3.1 250B | 82.4 | 88.7 | 76.3 | — |
| Qwen3-235B | 84.1 | 85.2 | 79.8 | 68.7 |
| DeepSeek-V4 Pro | 86.3 | 94.2 | 91.5 | — |
| LLaMA 3.1 405B (2025) | 79.1 | 82.4 | 68.9 | — |
| GPT-5.6 Sol (закрытая) | 88.2 | 95.1 | 93.7 | 72.4 |
DeepSeek-V4 Pro дышит в спину GPT-5.6 Sol по математике и коду. Отставание сократилось до 2-3 процентных пунктов. Для русского языка отдельный замер на датасете Russian-MMLU показал: Qwen3-235B лидирует с 78.4%, Mistral 3.1 набирает 75.1%, DeepSeek-V4 Pro - 76.8%. Это объясняется качественной русскоязычной предобучающей выборкой у Qwen.
Эффективность инференса: токены в секунду и затраты памяти
| Модель | VRAM (FP16) | VRAM (квант.) | tokens/s на H100 | tokens/s на RTX 4090 |
|---|---|---|---|---|
| Mistral 3.1 250B | 500 GB | 80 GB (INT4) | 45 | 18 |
| Qwen3-235B | 470 GB | 75 GB (INT8) | 38 | 14 |
| DeepSeek-V4 Pro | 1.3 TB | 210 GB (INT4) | 52 | не запускается |
| LLaMA 3.1 405B | 810 GB | 140 GB (INT4) | 28 | не запускается |
Mistral 3.1 250B - король эффективности. На одном H100 он даёт 45 tokens/s, что достаточно для production-нагрузок. DeepSeek-V4 Pro быстрее в абсолютных цифрах, но требует минимум 4xH100 для развёртывания. Для локального использования на потребительском железе выбор сужается до Mistral 3.1 и Qwen3-235B. Обе модели запускаются на RTX 4090 с квантованием, выдавая приемлемые 14-18 tokens/s. Практический вывод сформулирован в нашем анализе: отставание open-source от закрытых лидеров сократилось до полутора месяцев, и сейчас критически важно правильно подобрать модель под доступное железо.
Практическое применение: от инференса до дообучения
Разберём два сценария: быстрый старт для тестирования и production-дообучение под доменные задачи. Модели 2026 года грузятся через стандартный API Hugging Face, но есть нюансы с конфигурацией attention и квантованием, которые влияют на результат.
Быстрый старт: сниппеты для загрузки и инференса
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_name = "mistralai/Mistral-3.1-250B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype=torch.bfloat16,
device_map="auto",
load_in_4bit=True,
bnb_4bit_compute_dtype=torch.bfloat16
)
messages = [{"role": "user", "content": "Объясни архитектуру Mixture-of-Experts"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))Для DeepSeek-V4 Pro используйте бэкенд vLLM с поддержкой MoE. Конфигурация для запуска на 4xH100:
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-V4-Pro \
--tensor-parallel-size 4 \
--max-model-len 32768 \
--enable-expert-parallel \
--dtype bfloat16Важный момент: DeepSeek-V4 Pro требует флага --enable-expert-parallel, который распределяет экспертов по GPU. Без него модель пытается загрузить всех экспертов на каждую карту и падает по памяти.
Дообучение под свои задачи: что нужно знать
Все три флагманские модели поддерживают LoRA и QLoRA. Mistral 3.1 показывает стабильный файнтюнинг с rank=64 и alpha=128 на датасетах от 500 примеров. Qwen3-235B требует осторожности: из-за нативного квантования обучение в FP16 с последующим INT8-квантованием даёт расхождение весов до 3%. Рекомендуется сразу использовать QLoRA с NF4.
DeepSeek-V4 Pro - отдельная история. Из-за MoE-архитектуры файнтюнинг всех экспертов требует кластер из 8xH100. Практичный обходной путь: заморозить роутер и обучать только top-2 экспертов для вашего домена. Это снижает требования до 2xH100 при сохранении 85% качества полного файнтюнинга. Лицензионные ограничения различаются: Mistral 3.1 под Apache 2.0, Qwen3-235B под своей кастомной лицензией (бесплатно для некоммерческого использования, требуется лицензия при revenue > $100M в месяц), DeepSeek-V4 Pro под MIT.
Тренды и будущее open-weights экосистемы
Пять тенденций будут определять вторую половину 2026 года. Первая: мультимодальность перестаёт быть фишкой и становится базовым требованием. Модели без поддержки изображений и видео будут восприниматься как неполноценные. Вторая: лицензии ужесточаются. Разработчики ищут баланс между открытостью и монетизацией - появляются гибридные схемы с бесплатным использованием до определённого порога revenue. Третья: edge-инференс набирает обороты. Phi-5-mini и Stable Code 4B доказали, что полезные модели могут работать на устройствах без GPU. Ожидаем волну специализированных моделей для носимой электроники и IoT.
Четвёртая тенденция: русскоязычные бенчмарки становятся стандартом оценки. Qwen3-235B и DeepSeek-V4 Pro уже включают Russian-MMLU в официальные отчёты, что упрощает выбор модели для русскоязычных проектов. Пятая: агентные фреймворки начинают влиять на архитектуру моделей. Нейросети превращаются в универсальные инструменты с нативной поддержкой function calling и долгосрочной памяти, что требует новых подходов к предобучению.
Заключение: какую модель выбрать для своих задач
Выбор модели в 2026 году сводится к трём переменным: бюджет на железо, требуемая модальность и лицензионные ограничения. Для чат-ботов и ассистентов на русском языке лучший выбор - Qwen3-235B. Мультимодальность и сильные русскоязычные метрики перевешивают чуть более высокую скорость Mistral. Для кодовых задач и математики - DeepSeek-V4 Pro, если у вас есть кластер из 4+ H100. Результаты на HumanEval+ и MATH-500 говорят сами за себя. Для ограниченных ресурсов - Mistral 3.1 250B с INT4-квантованием. Он запускается на одном H100 или RTX 4090, давая 45 и 18 tokens/s соответственно. Для edge-устройств - Phi-5-mini. 3.8B параметров, 12 tokens/s на Raspberry Pi 5, лицензия MIT. Для автодополнения кода в IDE - Stable Code 4B с задержкой 45ms на CPU.
| Сценарий | Рекомендуемая модель | Ключевое преимущество |
|---|---|---|
| Чат-боты, ассистенты | Qwen3-235B | Мультимодальность, русский язык |
| Код, математика | DeepSeek-V4 Pro | Лидер бенчмарков |
| Ограниченное железо | Mistral 3.1 250B (INT4) | Лучшая эффективность |
| Edge, IoT | Phi-5-mini | Запуск на CPU |
| IDE-плагины | Stable Code 4B | Минимальная задержка |
Карусель открытых весов продолжает набирать обороты. Каждый месяц приносит новые архитектурные решения, которые сокращают разрыв с проприетарными системами. Мультиязычные бенчмарки подтверждают: выбор модели теперь зависит от конкретного языка программирования или домена, а не от абстрактного «лучше-хуже». Следите за обновлениями - вторая половина 2026 года обещает ещё более плотный график релизов.