Южнокорейская компания Upstage выпустила открытую модель Solar Open 2 с архитектурой Mixture-of-Experts. 250 миллиардов общих параметров, 15 миллиардов активных на токен - и результаты, которые по ряду бенчмарков вплотную приближаются к флагманской DeepSeek V4 Flash (284B-A13B). Это не просто ещё одна LLM в копилку open-source сообщества. Это прямой конкурент закрытым решениям с открытыми весами и поддержкой русского языка.
Мы собрали детальное сравнение шести моделей: Solar Open 2, DeepSeek V4 Flash, Command A+, Mistral Medium 3.5, MiMo-V2.5 и других. Задачи знаний и рассуждений (MMLU-Pro, GPQA-Diamond, AIME2026), кодинг (LiveCodeBench v6, SWE-Bench Verified), агентные сценарии (Terminal Bench Hard, τ³ banking). Разбираем архитектурные решения, которые позволили Solar Open 2 выйти на этот уровень, и даём практические рекомендации для русскоязычных разработчиков.
Ключевые результаты: Solar Open 2 догоняет флагманов
Solar Open 2 показывает результаты, сопоставимые с топовыми проприетарными моделями. На MMLU-Pro модель набирает 78.4%, уступая DeepSeek V4 Flash всего 1.2 процентных пункта. В GPQA-Diamond разрыв чуть больше - 4.3 п.п., но это уровень, который ещё год назад был недостижим для открытых MoE-архитектур. LiveCodeBench v6 фиксирует паритет: 67.1% у Solar Open 2 против 68.9% у DeepSeek V4 Flash.
Модель открыта, работает на русском языке и доступна для локального развёртывания. Это ключевое отличие от DeepSeek V4 Flash, чьи веса также открыты, но инфраструктурные требования и лицензионные ограничения создают барьеры для коммерческого использования в ряде юрисдикций.
| Модель | MMLU-Pro | GPQA-Diamond | LiveCodeBench v6 |
|---|---|---|---|
| Solar Open 2 (250B-A15B) | 78.4% | 62.1% | 67.1% |
| DeepSeek V4 Flash (284B-A13B) | 79.6% | 66.4% | 68.9% |
| Command A+ | 74.2% | 58.7% | 63.5% |
| Mistral Medium 3.5 | 72.8% | 55.3% | 61.2% |
| MiMo-V2.5 | 70.1% | 52.9% | 59.8% |
Цифры подтверждают: Solar Open 2 уверенно обходит Command A+, Mistral Medium 3.5 и MiMo-V2.5 по всем ключевым метрикам. Отставание от DeepSeek V4 Flash минимально, а в агентных сценариях модель показывает неожиданно сильные результаты.
Архитектура Solar Open 2: почему MoE - это эффективно
Mixture-of-Experts разделяет модель на множество специализированных подсетей-экспертов. На каждый токен активируется лишь часть из них. Solar Open 2 содержит 250 миллиардов параметров, но в работе участвуют только 15 миллиардов. Результат: качество большой модели при вычислительных затратах маленькой.
DeepSeek V4 Flash использует схожий подход - 284 миллиарда общих параметров и 13 миллиардов активных. Разница в соотношении активных к общим параметрам даёт Solar Open 2 небольшое преимущество в скорости инференса при сопоставимом качестве. Меньше активных параметров - меньше вычислений на токен - выше пропускная способность при пакетной обработке.
Сравнение параметров: Solar Open 2 vs DeepSeek V4 Flash
| Характеристика | Solar Open 2 | DeepSeek V4 Flash |
|---|---|---|
| Общие параметры | 250B | 284B |
| Активные параметры | 15B | 13B |
| Архитектура | MoE с гибридным вниманием | MoE с MLA |
| Контекстное окно | 1M токенов | 128K токенов |
| Открытые веса | Да (Apache 2.0) | Да (с ограничениями) |
Контекстное окно в 1 миллион токенов - одно из главных архитектурных преимуществ Solar Open 2. Гибридное внимание чередует три слоя линейного внимания с одним слоем softmax-внимания. Это снимает ограничение RoPE-экстраполяции и позволяет работать с длинными документами без позиционного кодирования. KV-кэш сокращается до четверти от объёма полной softmax-модели: только 12 из 48 слоёв требуют кэширования.
Эффективность обучения также заслуживает внимания. Upstage перенесла лишь 2.3% весов из предыдущей модели Solar Open 1 (102B), что резко ускорило сходимость при масштабировании до 250B. Результат: модель обучается быстрее и дешевле конкурентов при сопоставимом качестве.
Бенчмарки знаний и рассуждений: MMLU-Pro, GPQA-Diamond, AIME2026
Тесты знаний и рассуждений проверяют способность модели к фактологическому ответу и логическим выводам. Solar Open 2 прошла все три бенчмарка на уровне, который позволяет рекомендовать её для промышленного использования в чат-ботах, образовательных сервисах и аналитических системах.
MMLU-Pro: широкий кругозор модели
MMLU-Pro содержит мультидисциплинарные вопросы повышенной сложности: право, медицина, физика, computer science. Solar Open 2 набирает 78.4%. Это на 4.2 п.п. выше Command A+ и на 5.6 п.п. выше Mistral Medium 3.5. Отставание от DeepSeek V4 Flash составляет 1.2 п.п. - величина, которая на практике незаметна в диалоговых сценариях.
Для русскоязычных пользователей важен факт: модель обучалась на мультиязычном корпусе, включающем русский язык. Качество ответов на русском не деградирует, как это часто бывает у моделей, оптимизированных под английский.
GPQA-Diamond: экспертный уровень рассуждений
GPQA-Diamond содержит вопросы уровня PhD по биологии, физике и химии. Solar Open 2 показывает 62.1% против 66.4% у DeepSeek V4 Flash. Разрыв в 4.3 п.п. указывает на то, что в задачах, требующих глубокого экспертного знания, флагман DeepSeek сохраняет лидерство.
С практической точки зрения 62.1% на GPQA-Diamond означает, что модель способна помогать в исследовательской работе: анализировать научные статьи, формулировать гипотезы, проверять логические цепочки. Для большинства бизнес-задач этот уровень избыточен, но для R&D-подразделений - критически важен.
AIME2026: математика и алгоритмическое мышление
AIME2026 тестирует способность решать олимпиадные математические задачи. Solar Open 2 набирает 54.7%, DeepSeek V4 Flash - 58.2%. Обе модели показывают уровень выше среднего студента технического вуза.
Результат Solar Open 2 на AIME2026 открывает сценарии использования в образовательных платформах и системах автоматической проверки решений. Модель не просто выдаёт ответ, но и способна объяснить ход решения - это подтверждается качественным анализом выходных данных.
Кодинг: LiveCodeBench v6 и SWE-Bench Verified
Задачи кодинга - основной практический интерес для разработчиков. Solar Open 2 тестировалась на двух ключевых бенчмарках: соревновательное программирование и решение реальных issues из open-source проектов. Результаты подтверждают пригодность модели для использования в IDE-ассистентах и системах автоматического ревью кода.
LiveCodeBench v6: соревновательное программирование
LiveCodeBench v6 оценивает способность генерировать корректный код в условиях, приближенных к соревнованиям: ограниченное время, алгоритмическая сложность, неочевидные граничные условия. Solar Open 2 набирает 67.1% - всего на 1.8 п.п. ниже DeepSeek V4 Flash.
Этот результат означает, что модель можно использовать как AI-ассистента в IDE. Она справляется с генерацией функций по описанию, поиском оптимального алгоритма и обработкой краевых случаев. В связке с BigCodeArena, где модели оцениваются через реальный запуск кода в песочницах, Solar Open 2 показывает стабильные результаты на Python и JavaScript.
SWE-Bench Verified: решение реальных задач из open-source
SWE-Bench Verified тестирует способность находить и исправлять баги в реальных GitHub-репозиториях. Solar Open 2 решает 52.3% issues, DeepSeek V4 Flash - 55.1%. Разница в 2.8 п.п. незначительна для большинства сценариев автоматизации code review.
Модель успешно справляется с задачами, требующими понимания контекста проекта: анализ кодовой базы, поиск зависимостей, исправление с учётом обратной совместимости. Для русскоязычных команд это означает возможность автоматизировать рутинные операции по рефакторингу и исправлению типовых ошибок без привлечения дорогих проприетарных API.
Агентные сценарии: Terminal Bench Hard и τ³ banking
Агентные сценарии - главный тренд 2025-2026 годов. Модель должна планировать многошаговые действия, взаимодействовать с окружением и минимизировать ошибки. Solar Open 2 показывает результаты, которые делают её сильным кандидатом для построения AI-агентов.
Terminal Bench Hard: автономная работа в shell
Terminal Bench Hard тестирует способность модели работать в командной строке: навигация по файловой системе, запуск утилит, обработка вывода, исправление ошибок. Solar Open 2 набирает 71.8% - на 2.4 п.п. выше DeepSeek V4 Flash.
Это неожиданный результат. Модель от Upstage обходит флагмана в задачах, требующих практического взаимодействия с системой. Она успешно выполняет сложные цепочки команд, обрабатывает нестандартные ситуации и восстанавливается после ошибок. Для DevOps-инженеров и системных администраторов это означает возможность делегировать рутинные операции AI-агенту.
Стоит отметить, что Laguna S 2.1 также показывает сильные результаты на Terminal-Bench, но Solar Open 2 выигрывает за счёт большего контекстного окна и открытой лицензии.
τ³ banking: надёжность в финансовых операциях
τ³ banking моделирует работу с финансовыми транзакциями: проверка баланса, переводы, обработка выписок. Solar Open 2 набирает 89.2% при допустимом уровне ошибок не более 0.5%. DeepSeek V4 Flash показывает 91.7%.
Высокий результат Solar Open 2 в финансовом бенчмарке подтверждает: модель готова к ответственным агентным сценариям. Низкий уровень ошибок критически важен для автоматизации банковских операций, бухгалтерского учёта и compliance-проверок. Открытая лицензия позволяет встраивать модель в агентные фреймворки без риска нарушения условий использования.
Что это значит для русскоязычных разработчиков: доступность и сценарии использования
Solar Open 2 - открытая модель с лицензией Apache 2.0. Веса доступны на Hugging Face, модель можно запустить локально или в облаке. Поддержка русского языка на уровне, сопоставимом с английским, делает её практичным выбором для проектов, ориентированных на русскоязычную аудиторию.
Запуск Solar Open 2 локально и в облаке
Минимальные требования к железу: 48 ГБ VRAM для полной модели в FP16, 24 ГБ для 4-битной квантизации. На практике это означает запуск на одной A6000 или двух RTX 3090. Для инференса рекомендуется использовать vLLM или Hugging Face Transformers с поддержкой MoE.
Пример конфигурации для vLLM: модель загружается с Hugging Face, активируется режим tensor-parallel для распределения по GPU. При пакетной обработке коротких запросов скорость достигает 200-300 токенов в секунду на одной A100. Для сравнения: DeepSeek V4 Flash при схожих условиях показывает 250-350 токенов в секунду, но требует более сложной настройки MoE-бэкенда.
Сравнение стоимости: Solar Open 2 vs DeepSeek V4 Flash
Стоимость инференса - ключевой фактор при выборе модели для production. Solar Open 2, будучи открытой моделью, не требует платы за API. Затраты сводятся к аренде GPU: примерно $1.2-1.5 в час на A100 в облаке. При средней скорости 250 токенов в секунду это даёт стоимость около $0.15 за миллион токенов.
DeepSeek V4 Flash через API стоит $0.28 за миллион входных и $0.56 за миллион выходных токенов. При локальном развёртывании затраты сопоставимы, но лицензионные ограничения DeepSeek создают риски для коммерческого использования в ряде стран. Solar Open 2 с Apache 2.0 таких ограничений не имеет.
Итоговые рекомендации: какую модель выбрать для ваших задач
Выбор модели зависит от конкретного сценария. Solar Open 2 выигрывает в задачах, где важны открытость, длинный контекст и низкая стоимость инференса. DeepSeek V4 Flash сохраняет лидерство в экспертных рассуждениях и математике. Остальные модели занимают промежуточные позиции.
| Сценарий | Рекомендуемая модель | Причина |
|---|---|---|
| Чат-боты и поддержка на русском | Solar Open 2 | Открытая лицензия, качество русского языка, низкая стоимость |
| Агенты автоматизации (shell, DevOps) | Solar Open 2 | Лидер Terminal Bench Hard, контекст 1M токенов |
| Экспертный анализ и R&D | DeepSeek V4 Flash | Выше на GPQA-Diamond и AIME2026 |
| Соревновательное программирование | DeepSeek V4 Flash | Небольшое преимущество на LiveCodeBench v6 |
| Финансовые агенты | Обе модели | Сопоставимые результаты на τ³ banking |
| Дообучение под свои задачи | Solar Open 2 | Apache 2.0, полный доступ к весам, документация |
Solar Open 2 сокращает разрыв между открытыми и проприетарными моделями до минимума. Для русскоязычных разработчиков это возможность строить production-решения на уровне мировых стандартов без привязки к закрытым API и с полным контролем над инфраструктурой. Модель от Upstage - сильный конкурент, который меняет правила игры на рынке MoE-архитектур.