Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Solar Open 2 против DeepSeek V4 Flash: детальный разбор бенчмарков новой MoE-модели от Upstage

Solar Open 2 (250B-A15B) от Upstage против DeepSeek V4 Flash: сравниваем шесть моделей по MMLU-Pro, GPQA-Diamond, LiveCodeBench v6, SWE-Bench Verified и агентны

Коротко

Что будет в материале

  1. 01

    Ключевые результаты: Solar Open 2 догоняет флагманов

  2. 02

    Архитектура Solar Open 2: почему MoE - это эффективно

  3. 03

    Бенчмарки знаний и рассуждений: MMLU-Pro, GPQA-Diamond, AIME2026

  4. 04

    Кодинг: LiveCodeBench v6 и SWE-Bench Verified

Южнокорейская компания Upstage выпустила открытую модель Solar Open 2 с архитектурой Mixture-of-Experts. 250 миллиардов общих параметров, 15 миллиардов активных на токен - и результаты, которые по ряду бенчмарков вплотную приближаются к флагманской DeepSeek V4 Flash (284B-A13B). Это не просто ещё одна LLM в копилку open-source сообщества. Это прямой конкурент закрытым решениям с открытыми весами и поддержкой русского языка.

Мы собрали детальное сравнение шести моделей: Solar Open 2, DeepSeek V4 Flash, Command A+, Mistral Medium 3.5, MiMo-V2.5 и других. Задачи знаний и рассуждений (MMLU-Pro, GPQA-Diamond, AIME2026), кодинг (LiveCodeBench v6, SWE-Bench Verified), агентные сценарии (Terminal Bench Hard, τ³ banking). Разбираем архитектурные решения, которые позволили Solar Open 2 выйти на этот уровень, и даём практические рекомендации для русскоязычных разработчиков.

Ключевые результаты: Solar Open 2 догоняет флагманов

Solar Open 2 показывает результаты, сопоставимые с топовыми проприетарными моделями. На MMLU-Pro модель набирает 78.4%, уступая DeepSeek V4 Flash всего 1.2 процентных пункта. В GPQA-Diamond разрыв чуть больше - 4.3 п.п., но это уровень, который ещё год назад был недостижим для открытых MoE-архитектур. LiveCodeBench v6 фиксирует паритет: 67.1% у Solar Open 2 против 68.9% у DeepSeek V4 Flash.

Модель открыта, работает на русском языке и доступна для локального развёртывания. Это ключевое отличие от DeepSeek V4 Flash, чьи веса также открыты, но инфраструктурные требования и лицензионные ограничения создают барьеры для коммерческого использования в ряде юрисдикций.

МодельMMLU-ProGPQA-DiamondLiveCodeBench v6
Solar Open 2 (250B-A15B)78.4%62.1%67.1%
DeepSeek V4 Flash (284B-A13B)79.6%66.4%68.9%
Command A+74.2%58.7%63.5%
Mistral Medium 3.572.8%55.3%61.2%
MiMo-V2.570.1%52.9%59.8%

Цифры подтверждают: Solar Open 2 уверенно обходит Command A+, Mistral Medium 3.5 и MiMo-V2.5 по всем ключевым метрикам. Отставание от DeepSeek V4 Flash минимально, а в агентных сценариях модель показывает неожиданно сильные результаты.

Архитектура Solar Open 2: почему MoE - это эффективно

Mixture-of-Experts разделяет модель на множество специализированных подсетей-экспертов. На каждый токен активируется лишь часть из них. Solar Open 2 содержит 250 миллиардов параметров, но в работе участвуют только 15 миллиардов. Результат: качество большой модели при вычислительных затратах маленькой.

DeepSeek V4 Flash использует схожий подход - 284 миллиарда общих параметров и 13 миллиардов активных. Разница в соотношении активных к общим параметрам даёт Solar Open 2 небольшое преимущество в скорости инференса при сопоставимом качестве. Меньше активных параметров - меньше вычислений на токен - выше пропускная способность при пакетной обработке.

Сравнение параметров: Solar Open 2 vs DeepSeek V4 Flash

ХарактеристикаSolar Open 2DeepSeek V4 Flash
Общие параметры250B284B
Активные параметры15B13B
АрхитектураMoE с гибридным вниманиемMoE с MLA
Контекстное окно1M токенов128K токенов
Открытые весаДа (Apache 2.0)Да (с ограничениями)

Контекстное окно в 1 миллион токенов - одно из главных архитектурных преимуществ Solar Open 2. Гибридное внимание чередует три слоя линейного внимания с одним слоем softmax-внимания. Это снимает ограничение RoPE-экстраполяции и позволяет работать с длинными документами без позиционного кодирования. KV-кэш сокращается до четверти от объёма полной softmax-модели: только 12 из 48 слоёв требуют кэширования.

Эффективность обучения также заслуживает внимания. Upstage перенесла лишь 2.3% весов из предыдущей модели Solar Open 1 (102B), что резко ускорило сходимость при масштабировании до 250B. Результат: модель обучается быстрее и дешевле конкурентов при сопоставимом качестве.

Бенчмарки знаний и рассуждений: MMLU-Pro, GPQA-Diamond, AIME2026

Тесты знаний и рассуждений проверяют способность модели к фактологическому ответу и логическим выводам. Solar Open 2 прошла все три бенчмарка на уровне, который позволяет рекомендовать её для промышленного использования в чат-ботах, образовательных сервисах и аналитических системах.

MMLU-Pro: широкий кругозор модели

MMLU-Pro содержит мультидисциплинарные вопросы повышенной сложности: право, медицина, физика, computer science. Solar Open 2 набирает 78.4%. Это на 4.2 п.п. выше Command A+ и на 5.6 п.п. выше Mistral Medium 3.5. Отставание от DeepSeek V4 Flash составляет 1.2 п.п. - величина, которая на практике незаметна в диалоговых сценариях.

Для русскоязычных пользователей важен факт: модель обучалась на мультиязычном корпусе, включающем русский язык. Качество ответов на русском не деградирует, как это часто бывает у моделей, оптимизированных под английский.

GPQA-Diamond: экспертный уровень рассуждений

GPQA-Diamond содержит вопросы уровня PhD по биологии, физике и химии. Solar Open 2 показывает 62.1% против 66.4% у DeepSeek V4 Flash. Разрыв в 4.3 п.п. указывает на то, что в задачах, требующих глубокого экспертного знания, флагман DeepSeek сохраняет лидерство.

С практической точки зрения 62.1% на GPQA-Diamond означает, что модель способна помогать в исследовательской работе: анализировать научные статьи, формулировать гипотезы, проверять логические цепочки. Для большинства бизнес-задач этот уровень избыточен, но для R&D-подразделений - критически важен.

AIME2026: математика и алгоритмическое мышление

AIME2026 тестирует способность решать олимпиадные математические задачи. Solar Open 2 набирает 54.7%, DeepSeek V4 Flash - 58.2%. Обе модели показывают уровень выше среднего студента технического вуза.

Результат Solar Open 2 на AIME2026 открывает сценарии использования в образовательных платформах и системах автоматической проверки решений. Модель не просто выдаёт ответ, но и способна объяснить ход решения - это подтверждается качественным анализом выходных данных.

Кодинг: LiveCodeBench v6 и SWE-Bench Verified

Задачи кодинга - основной практический интерес для разработчиков. Solar Open 2 тестировалась на двух ключевых бенчмарках: соревновательное программирование и решение реальных issues из open-source проектов. Результаты подтверждают пригодность модели для использования в IDE-ассистентах и системах автоматического ревью кода.

LiveCodeBench v6: соревновательное программирование

LiveCodeBench v6 оценивает способность генерировать корректный код в условиях, приближенных к соревнованиям: ограниченное время, алгоритмическая сложность, неочевидные граничные условия. Solar Open 2 набирает 67.1% - всего на 1.8 п.п. ниже DeepSeek V4 Flash.

Этот результат означает, что модель можно использовать как AI-ассистента в IDE. Она справляется с генерацией функций по описанию, поиском оптимального алгоритма и обработкой краевых случаев. В связке с BigCodeArena, где модели оцениваются через реальный запуск кода в песочницах, Solar Open 2 показывает стабильные результаты на Python и JavaScript.

SWE-Bench Verified: решение реальных задач из open-source

SWE-Bench Verified тестирует способность находить и исправлять баги в реальных GitHub-репозиториях. Solar Open 2 решает 52.3% issues, DeepSeek V4 Flash - 55.1%. Разница в 2.8 п.п. незначительна для большинства сценариев автоматизации code review.

Модель успешно справляется с задачами, требующими понимания контекста проекта: анализ кодовой базы, поиск зависимостей, исправление с учётом обратной совместимости. Для русскоязычных команд это означает возможность автоматизировать рутинные операции по рефакторингу и исправлению типовых ошибок без привлечения дорогих проприетарных API.

Агентные сценарии: Terminal Bench Hard и τ³ banking

Агентные сценарии - главный тренд 2025-2026 годов. Модель должна планировать многошаговые действия, взаимодействовать с окружением и минимизировать ошибки. Solar Open 2 показывает результаты, которые делают её сильным кандидатом для построения AI-агентов.

Terminal Bench Hard: автономная работа в shell

Terminal Bench Hard тестирует способность модели работать в командной строке: навигация по файловой системе, запуск утилит, обработка вывода, исправление ошибок. Solar Open 2 набирает 71.8% - на 2.4 п.п. выше DeepSeek V4 Flash.

Это неожиданный результат. Модель от Upstage обходит флагмана в задачах, требующих практического взаимодействия с системой. Она успешно выполняет сложные цепочки команд, обрабатывает нестандартные ситуации и восстанавливается после ошибок. Для DevOps-инженеров и системных администраторов это означает возможность делегировать рутинные операции AI-агенту.

Стоит отметить, что Laguna S 2.1 также показывает сильные результаты на Terminal-Bench, но Solar Open 2 выигрывает за счёт большего контекстного окна и открытой лицензии.

τ³ banking: надёжность в финансовых операциях

τ³ banking моделирует работу с финансовыми транзакциями: проверка баланса, переводы, обработка выписок. Solar Open 2 набирает 89.2% при допустимом уровне ошибок не более 0.5%. DeepSeek V4 Flash показывает 91.7%.

Высокий результат Solar Open 2 в финансовом бенчмарке подтверждает: модель готова к ответственным агентным сценариям. Низкий уровень ошибок критически важен для автоматизации банковских операций, бухгалтерского учёта и compliance-проверок. Открытая лицензия позволяет встраивать модель в агентные фреймворки без риска нарушения условий использования.

Что это значит для русскоязычных разработчиков: доступность и сценарии использования

Solar Open 2 - открытая модель с лицензией Apache 2.0. Веса доступны на Hugging Face, модель можно запустить локально или в облаке. Поддержка русского языка на уровне, сопоставимом с английским, делает её практичным выбором для проектов, ориентированных на русскоязычную аудиторию.

Запуск Solar Open 2 локально и в облаке

Минимальные требования к железу: 48 ГБ VRAM для полной модели в FP16, 24 ГБ для 4-битной квантизации. На практике это означает запуск на одной A6000 или двух RTX 3090. Для инференса рекомендуется использовать vLLM или Hugging Face Transformers с поддержкой MoE.

Пример конфигурации для vLLM: модель загружается с Hugging Face, активируется режим tensor-parallel для распределения по GPU. При пакетной обработке коротких запросов скорость достигает 200-300 токенов в секунду на одной A100. Для сравнения: DeepSeek V4 Flash при схожих условиях показывает 250-350 токенов в секунду, но требует более сложной настройки MoE-бэкенда.

Сравнение стоимости: Solar Open 2 vs DeepSeek V4 Flash

Стоимость инференса - ключевой фактор при выборе модели для production. Solar Open 2, будучи открытой моделью, не требует платы за API. Затраты сводятся к аренде GPU: примерно $1.2-1.5 в час на A100 в облаке. При средней скорости 250 токенов в секунду это даёт стоимость около $0.15 за миллион токенов.

DeepSeek V4 Flash через API стоит $0.28 за миллион входных и $0.56 за миллион выходных токенов. При локальном развёртывании затраты сопоставимы, но лицензионные ограничения DeepSeek создают риски для коммерческого использования в ряде стран. Solar Open 2 с Apache 2.0 таких ограничений не имеет.

Итоговые рекомендации: какую модель выбрать для ваших задач

Выбор модели зависит от конкретного сценария. Solar Open 2 выигрывает в задачах, где важны открытость, длинный контекст и низкая стоимость инференса. DeepSeek V4 Flash сохраняет лидерство в экспертных рассуждениях и математике. Остальные модели занимают промежуточные позиции.

СценарийРекомендуемая модельПричина
Чат-боты и поддержка на русскомSolar Open 2Открытая лицензия, качество русского языка, низкая стоимость
Агенты автоматизации (shell, DevOps)Solar Open 2Лидер Terminal Bench Hard, контекст 1M токенов
Экспертный анализ и R&DDeepSeek V4 FlashВыше на GPQA-Diamond и AIME2026
Соревновательное программированиеDeepSeek V4 FlashНебольшое преимущество на LiveCodeBench v6
Финансовые агентыОбе моделиСопоставимые результаты на τ³ banking
Дообучение под свои задачиSolar Open 2Apache 2.0, полный доступ к весам, документация

Solar Open 2 сокращает разрыв между открытыми и проприетарными моделями до минимума. Для русскоязычных разработчиков это возможность строить production-решения на уровне мировых стандартов без привязки к закрытым API и с полным контролем над инфраструктурой. Модель от Upstage - сильный конкурент, который меняет правила игры на рынке MoE-архитектур.

Подписаться на канал