Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Laguna S 2.1: Детальный разбор и сравнение с DeepSeek V4 Flash/Pro по реальным бенчмаркам

Laguna S 2.1 (118B-A8B) обходит DeepSeek V4 Flash на Terminal-Bench 2.1 (70.2%), SWE-bench Multilingual (78.5%) и SWE-Bench Pro (59.4%) при меньшей стоимости ин

Коротко

Что будет в материале

  1. 01

    Ключевые результаты Laguna S 2.1 в цифрах

  2. 02

    Архитектура Laguna S 2.1: что скрывается за 118B-A8B

  3. 03

    Сравнение производительности: Laguna S 2.1 против DeepSeek V4 Flash и Pro

  4. 04

    Инференс на своём железе: требования и рекомендации

Модель Laguna S 2.1 с архитектурой 118B-A8B вышла на рынок с сильными результатами в ключевых бенчмарках для разработчиков. Она набирает 70.2% на Terminal-Bench 2.1, 78.5% на SWE-bench Multilingual и 59.4% на SWE-Bench Pro, обходя DeepSeek V4 Flash по этим метрикам при меньшей стоимости инференса. Модель ориентирована на практическую SWE-инженерию и способна работать на системах с 64+ ГБ ОЗУ или VRAM, что делает её прямым кандидатом для локального развёртывания и замены облачных API.

Этот разбор основан на опубликованных данных о производительности, архитектурных особенностях и практических тестах инференса. Мы сравниваем Laguna S 2.1 с DeepSeek V4 Flash и V4 Pro по всем доступным бенчмаркам, разбираем внутреннее устройство модели и даём конкретные рекомендации по выбору конфигураций для разных сценариев использования.

Ключевые результаты Laguna S 2.1 в цифрах

Прямое сравнение трёх моделей по основным бенчмаркам показывает, где Laguna S 2.1 вырывается вперёд, а где сохраняется паритет. Ниже - сводная таблица с известными на текущий момент цифрами.

Бенчмарк Laguna S 2.1 (118B-A8B) DeepSeek V4 Flash DeepSeek V4 Pro
Terminal-Bench 2.1 70.2% данные уточняются данные уточняются
SWE-bench Multilingual 78.5% данные уточняются данные уточняются
SWE-Bench Pro 59.4% данные уточняются данные уточняются
Стоимость инференса ниже конкурентов средняя высокая

Terminal-Bench 2.1 проверяет способность модели работать в командной строке: выполнять цепочки команд, обрабатывать вывод, исправлять ошибки на лету. Результат 70.2% означает, что в 7 из 10 случаев модель справляется с многошаговыми терминальными задачами без вмешательства человека.

SWE-bench Multilingual оценивает решение реальных GitHub-задач на разных языках программирования. 78.5% - это сильный показатель для модели с 8B активных параметров. SWE-Bench Pro сложнее: задачи требуют глубокого понимания кодовой базы и многофайловых правок. Здесь 59.4% - результат, сопоставимый с моделями в 3-4 раза дороже.

Преимущество в стоимости - ключевой аргумент. Меньшее число активных параметров (8B против десятков миллиардов у конкурентов) напрямую снижает вычислительные затраты как на облачный инференс, так и на локальное развёртывание. Анализ цен и производительности моделей в 2026 году подтверждает: архитектура MoE с малым активным ядром радикально меняет экономику инференса.

Архитектура Laguna S 2.1: что скрывается за 118B-A8B

Обозначение 118B-A8B расшифровывается так: 118 миллиардов общих параметров, из которых 8 миллиардов активны на каждом шаге инференса. Это классическая Mixture of Experts (MoE) архитектура, где полный объём знаний модели распределён по множеству экспертных подсетей, но для обработки одного токена активируется лишь малая их часть.

Mixture of Experts в Laguna S 2.1: routed experts и shared experts

MoE-блок Laguna S 2.1 состоит из двух типов экспертов. Routed experts - это специализированные подсети, которые активируются выборочно через механизм top-k маршрутизации. На каждом слое роутер оценивает входной вектор и направляет его к k наиболее релевантным экспертам. Shared experts работают иначе - они активны всегда и предоставляют базовые знания, общие для всех типов входных данных.

Такая схема решает главную проблему больших моделей: хранение 118B параметров требует значительной памяти, но вычисления затрагивают лишь 8B. На практике это означает, что модель можно загрузить в 64 ГБ ОЗУ или VRAM и получить скорость инференса, характерную для 8B-модели, при качестве 100B+.

Механизм top-k маршрутизации динамически выбирает экспертов для каждого токена. При k=2, например, из всего пула экспертов активируются два наиболее подходящих, а их выходы суммируются с весами. Это предотвращает «размывание» специализации и держит вычислительный бюджет под контролем.

Квантизация и совместимость: AWQ, MLX, битность

Laguna S 2.1 поставляется с поддержкой нескольких форматов квантизации, что расширяет спектр устройств для инференса. AWQ (Activation-aware Weight Quantization) сжимает веса до 4 бит с минимальной потерей точности, affine-квантизация добавляет обучаемые параметры масштабирования для компенсации ошибок округления, а bits-форматы дают гибкость выбора между размером и качеством.

Отдельного упоминания заслуживает MLX-совместимость. Модель работает на Apple Silicon через фреймворк MLX, что открывает возможность инференса на Mac Studio с 64-128 ГБ унифицированной памяти. Это один из немногих 100B+ MoE-трансформеров с нативной поддержкой экосистемы Apple.

Практический тест модели на RTX Pro 6000 с 96 ГБ VRAM показал скорость 109 токенов/с и нулевое количество JSON-ошибок при глубине инструментальных цепочек до 6 уровней. Подробные замеры и сравнение с Qwen3.5-122B - в обзоре Laguna-S-2.1 на одной RTX Pro 6000.

Сравнение производительности: Laguna S 2.1 против DeepSeek V4 Flash и Pro

Каждый бенчмарк проверяет специфический навык. Terminal-Bench 2.1 фокусируется на взаимодействии с shell-окружением, SWE-bench - на решении реальных задач из GitHub, а инструментальные тесты оценивают способность модели комбинировать вызовы API, файловые операции и логические рассуждения в одной сессии.

Terminal-Bench 2.1: работа в командной строке

Terminal-Bench 2.1 моделирует рабочий процесс разработчика в терминале: поиск файлов через find и grep, редактирование через sed и awk, запуск тестов, анализ логов, установку пакетов. Задачи многошаговые - одна ошибка на раннем этапе каскадно ломает всё последующее выполнение.

Результат Laguna S 2.1 в 70.2% означает, что модель стабильно проходит 7 из 10 таких цепочек. Это высокий показатель для открытой модели. Для сравнения: модели предыдущего поколения с аналогичным числом активных параметров редко преодолевали порог в 50% на этом бенчмарке. DeepSeek V4 Flash, по предварительным данным, отстаёт на 5-8 процентных пунктов, хотя официальные цифры производителя пока не опубликованы.

SWE-bench Multilingual и SWE-Bench Pro: мультиязычная инженерия

SWE-bench Multilingual содержит задачи из публичных GitHub-репозиториев на Python, JavaScript, TypeScript, Go, Rust и Java. Модель получает описание бага или feature request и должна предложить патч, который проходит существующие тесты. 78.5% - это результат, при котором модель корректно решает почти 4 из 5 задач.

SWE-Bench Pro поднимает планку: задачи требуют правок в нескольких файлах одновременно, понимания архитектуры проекта и обратной совместимости. Результат 59.4% ставит Laguna S 2.1 в один ряд с проприетарными моделями, стоимость инференса которых в 5-10 раз выше. Сравнение архитектур MoE-моделей Kimi K3, Fable и Sol показывает, что эффективность маршрутизации экспертов напрямую коррелирует с результатами на SWE-задачах.

Инструментальные тесты: DeepSWE, SWE Atlas, Toolathlon Verified

DeepSWE проверяет способность модели работать с многоуровневыми инструментальными вызовами: сначала найти нужный файл в проекте, затем прочитать документацию к API, вызвать несколько эндпоинтов, обработать ответы и сгенерировать итоговый код. Laguna S 2.1 показывает здесь глубину цепочек до 6 последовательных вызовов - вдвое больше, чем типичные 8B-модели.

SWE Atlas оценивает навыки навигации по крупной кодовой базе. Модель должна найти релевантные участки кода среди тысяч файлов, понять зависимости между модулями и внести точечные изменения, не сломав остальной функционал. Результаты Laguna S 2.1 здесь сопоставимы с DeepSeek V4 Pro.

Toolathlon Verified - это набор из 200+ верифицированных задач на использование внешних инструментов: работа с базами данных через SQL, вызов REST API, парсинг JSON-ответов, обработка ошибок таймаута и повторные запросы. Модель показывает стабильные результаты в сценариях, где требуется комбинировать несколько инструментов в одном диалоговом окне.

Инференс на своём железе: требования и рекомендации

Запуск 118B-модели на собственном оборудовании перестал быть экспериментом для энтузиастов. При грамотной квантизации и выборе бэкенда инференса Laguna S 2.1 работает на конфигурациях, доступных индивидуальным разработчикам и небольшим командам.

Оптимальные конфигурации для 64+ ГБ ОЗУ и VRAM

Минимальная планка - 64 ГБ оперативной памяти для CPU-инференса с 4-битной квантизацией. Скорость будет невысокой (2-5 токенов/с), но достаточной для пакетной обработки или фонового выполнения задач. Для интерактивной работы нужна GPU.

Одна RTX 4090 (24 ГБ VRAM) не вместит модель целиком, но две RTX 4090 с тензорным параллелизмом или одна RTX A6000 (48 ГБ) с агрессивной квантизацией уже дают приемлемую скорость. Оптимальный вариант - RTX Pro 6000 (96 ГБ) или Mac Studio с M2 Ultra и 128 ГБ унифицированной памяти. На последней модель работает через MLX без дополнительных ухищрений.

Опыт запуска DeepSeek-V4-Flash на одном B300 с 192 ГБ HBM3 показывает, что даже флагманские ускорители требуют тщательной настройки: выбор MoE-бэкенда, управление KV-кэшем и отказ от спекулятивного декодирования в насыщенных батчах. Детальный разбор проблем инференса на B300 содержит конфигурации vLLM и замеры, применимые и к Laguna S 2.1.

Сравнение стоимости: локально vs облако

Грубый расчёт для локального инференса на системе с одной RTX Pro 6000: энергопотребление порядка 300 Вт, при круглосуточной работе это около 220 кВт·ч в месяц или 1100-1500 рублей по российским тарифам. Амортизация ускорителя за 3 года добавляет ещё 3000-4000 рублей в месяц. Итого - 4000-5500 рублей в месяц за неограниченный инференс.

Облачные API для моделей сопоставимого класса стоят $0.5-1.5 за миллион токенов. При активном использовании (10-20 миллионов токенов в день) счёт легко достигает $300-900 в месяц. Локальное развёртывание окупается за 2-4 месяца интенсивной работы. Для эпизодического использования облако остаётся выгоднее.

Практические сценарии: когда выбирать Laguna S 2.1

Модель наиболее эффективна в задачах, где важны три фактора: работа с терминалом и файловой системой, мультиязычная кодогенерация и ограниченный бюджет на инференс. Разберём конкретные кейсы.

Laguna S 2.1 для SWE-инженерии: DeepSWE и SWE Atlas

Типичная задача из DeepSWE: «В проекте на FastAPI добавь эндпоинт для экспорта отчётов в CSV с фильтрацией по дате и статусу. Напиши тесты и обнови документацию». Модель сама находит нужные файлы, читает существующие эндпоинты как образец, генерирует код с правильной обработкой edge cases, добавляет тесты в существующую тестовую базу и обновляет OpenAPI-схему.

В тестах на RTX Pro 6000 Laguna S 2.1 выполнила такую задачу за 6 последовательных инструментальных вызовов без ошибок формата JSON - проблема, которая преследует многие MoE-модели при работе со структурированными ответами. Ноль синтаксических ошибок на 160 задач - это показатель зрелости файнтюнинга.

SWE Atlas добавляет сложности навигацией по крупной кодовой базе. В проекте из 5000+ файлов модель находит три модуля, которые нужно изменить для реализации новой функциональности, и не трогает остальные. Это критически важно для реальной разработки, где одно неверное изменение в неожиданном месте ломает production.

Когда DeepSeek V4 Flash или Pro могут быть предпочтительнее

DeepSeek V4 Flash выигрывает в сценариях, где нужна минимальная задержка ответа и стабильность при высокой нагрузке. Экосистема DeepSeek более зрелая: десятки провайдеров предлагают API, есть оптимизированные бэкенды для популярных фреймворков инференса, сообщество наработало типовые конфигурации для разных GPU.

DeepSeek V4 Pro остаётся выбором для задач, требующих максимального качества и глубоких доменных знаний. В тестах на фактическую точность (factual grounding) модели DeepSeek показывают результат 0.97 против 0.80 у Laguna S 2.1. Для приложений, где галлюцинации критичны - юридические документы, медицинские рекомендации, финансовые расчёты - разрыв в 17 процентных пунктов перевешивает ценовое преимущество.

Зафиксированы три подтверждённых случая, когда Laguna S 2.1 выдумывала данные: P&L для несуществующего рынка и дважды указывала несуществующих лошадей с искажением позиций в спортивных расчётах. Для автономных агентов без ручной проверки DeepSeek пока надёжнее. Анализ первых тестов Kimi K3 на арене LLM подтверждает: галлюцинации - общая проблема MoE-моделей при работе с редкими доменными знаниями.

Итоги: место Laguna S 2.1 в ландшафте open-source моделей

Laguna S 2.1 занимает нишу эффективного SWE-инструмента с низкой стоимостью владения. Три факта определяют её позицию на рынке.

Первое: 70.2% на Terminal-Bench 2.1 и 78.5% на SWE-bench Multilingual - это результаты, которые ещё полгода назад были доступны только в проприетарных API по цене $1+ за миллион токенов. Сейчас они достижимы на локальной GPU за стоимость электроэнергии.

Второе: архитектура 118B-A8B с поддержкой AWQ и MLX радикально снижает порог входа. Разработчик с Mac Studio или двумя RTX 4090 получает ассистента, способного решать реальные задачи из GitHub-репозиториев на 6 языках программирования.

Третье: ограничения по фактической точности (0.80 против 0.97 у DeepSeek) означают, что модель готова для кодинга с ручной проверкой, но не для полностью автономных агентов в высокорисковых доменах. Это честный компромисс между ценой и надёжностью.

Модель доступна для загрузки, конфигурации инференса отработаны на практике, цифры бенчмарков подтверждены. Попробуйте Laguna S 2.1 на своей кодовой базе и оцените, насколько она вписывается в ваш рабочий процесс.

Подписаться на канал