Ключевые результаты тестирования: Laguna-S-2.1 против Qwen3.5-122B
Laguna-S-2.1 118B - это Mixture-of-Experts модель, заточенная под агентный кодинг. Мы прогнали её через 160 задач на одной RTX Pro 6000 (96GB) через vLLM 0.25.1 и сравнили с Qwen3.5-122B. Результат неоднозначный.
Laguna вырывается вперёд по скорости инференса: 109 токенов/с против 103 у Qwen. Она строит самые глубокие цепочки инструментов - до 6 уровней - и ни разу не ошиблась в JSON-форматировании. Для задач, где важна скорость и структурная сложность, это сильный кандидат.
Но есть и обратная сторона. Фактологическая точность Laguna - 0.80, тогда как Qwen держит 0.97. В доменных знаниях разрыв ещё заметнее: 0.80 против 1.00 на задачах по спорту и расчёту коэффициентов. Мы зафиксировали три подтверждённых случая выдумки данных: модель придумала P&L для отсутствующего рынка и дважды указала несуществующих лошадей с искажением позиций. Для автономных агентов Qwen надёжнее. Laguna-S-2.1 - инструмент для кодинга с обязательной ручной проверкой.
Архитектура Laguna-S-2.1: почему она такая быстрая и глубокая
Секрет скорости Laguna-S-2.1 кроется в архитектуре Mixture of Experts. Модель содержит 118 миллиардов параметров, но активирует лишь около 8 миллиардов на каждый токен. Это достигается за счёт 256 маршрутизируемых экспертов, из которых для каждой операции выбираются топ-10 плюс один общий эксперт. При 48 слоях и контекстном окне в 1 миллион токенов модель сохраняет высокую пропускную способность даже на сложных многошаговых задачах.
Измеренная производительность на M5 Max со 128 ГБ памяти - 33-44 токен/с в режиме greedy. На RTX Pro 6000 с vLLM 0.25.1 скорость поднимается до 109 токен/с. Разреженная активация экспертов снижает вычислительную нагрузку и позволяет модели быстро переключаться между инструментами, не теряя контекст. Отсюда и рекордная глубина цепочек - 6 уровней.
Сравнение архитектур: Laguna-S-2.1 и Qwen3.5-122B
Qwen3.5-122B использует другую реализацию MoE. При большем общем числе параметров она активирует иной объём вычислений на токен, что даёт прирост фактологической точности ценой скорости. Laguna жертвует плотностью знаний в пользу быстродействия: 256 экспертов с выбором топ-10 обеспечивают высокую специализацию, но разреженная активация может пропускать факты, которые плотная модель удержала бы.
Это фундаментальный компромисс. Если ваша задача - генерация кода с последующей верификацией, архитектура Laguna даёт преимущество. Если нужна автономная работа с фактическими данными без контроля человека, Qwen3.5-122B - более безопасный выбор. Подробный разбор архитектурных различий и их влияния на качество ответов мы давали в тестировании Qwen3.5 122B против Qwen3 Next 80B на 64 ГБ RAM - там же описаны узкие места CPU-инференса для MoE-моделей.
Методология тестирования: как мы оценивали агентный кодинг
Тесты проводились на RTX Pro 6000 с 96 ГБ видеопамяти, среда выполнения - vLLM 0.25.1. Набор из 160 задач покрывал три домена: генерация и отладка кода, расчёт спортивных коэффициентов, работа с финансовыми данными. Каждая задача прогонялась трижды для обеих моделей, чтобы исключить случайные выбросы.
Собирались пять метрик:
- Скорость инференса в токенах в секунду.
- Максимальная глубина цепочки вызовов инструментов.
- Количество JSON-ошибок при формировании вызовов.
- Фактологическая точность - соответствие выданных данных реальным.
- Доменные знания - корректность ответов в узких предметных областях.
Задачи на кодинг включали многошаговые сценарии: получить данные через один инструмент, трансформировать через второй, записать результат через третий. Задачи на факты требовали точного воспроизведения реальных показателей - имён, позиций, финансовых метрик. Именно на них проявились галлюцинации Laguna.
Галлюцинации под давлением: три подтверждённых случая выдумки данных
Три случая - три разных механизма ошибки. Первый: модель сгенерировала отчёт о прибылях и убытках для рынка, которого не существует в тестовом наборе данных. Она не просто ошиблась в цифрах - она придумала целый рынок с детализированными показателями. Второй и третий случаи: Laguna дважды указала несуществующих лошадей в результатах забегов, причём с искажением позиций реальных участников. Модель уверенно называла имена и места, которых не было в исходных данных.
Qwen3.5-122B в тех же задачах либо отказывалась отвечать при нехватке данных, либо выдавала корректную информацию. Разница в поведении принципиальна: Laguna склонна заполнять пробелы правдоподобной выдумкой, Qwen - сигнализировать о неопределённости.
Почему Laguna-S-2.1 галлюцинирует: анализ ограничений MoE-архитектуры
Корень проблемы - в разреженной активации экспертов. Когда модель сталкивается с узким доменом, за который отвечает ограниченное число экспертов, а контекст давит требованием выдать результат, активированные эксперты могут не иметь достаточных знаний. Вместо отказа они компилируют правдоподобный ответ из соседних доменов. Плотные модели распределяют знания равномернее, поэтому реже попадают в эту ловушку.
Laguna-S-2.1 с 256 экспертами и выбором топ-10 имеет высокую специализацию, но платит за неё фрагментацией знаний. В задачах, где пересекаются несколько доменов, модель может активировать экспертов, не владеющих полной картиной, и синтезировать ложную информацию. Это не баг конкретной реализации - это свойство архитектуры, которое проявляется при высоком давлении контекста.
Сравнение с Qwen3.5-122B: когда скорость важнее точности
Сведём ключевые метрики в таблицу.
| Метрика | Laguna-S-2.1 118B | Qwen3.5-122B |
|---|---|---|
| Скорость инференса | 109 токен/с | 103 токен/с |
| Глубина цепочек инструментов | 6 уровней | 4 уровня |
| JSON-ошибки | 0 | 2 |
| Фактологическая точность | 0.80 | 0.97 |
| Доменные знания | 0.80 | 1.00 |
Выбор модели сводится к сценарию использования. Автономные агенты, работающие без контроля человека - только Qwen3.5-122B. Цена ошибки в фактических данных слишком высока. Кодинг с ручной проверкой - здесь Laguna-S-2.1 выигрывает за счёт скорости и глубины. Разработчик пишет запрос, модель генерирует сложную цепочку вызовов, разработчик верифицирует результат. Нулевое число JSON-ошибок означает, что проверка сводится к логике и фактам, а не к синтаксису.
Задачи с высокими требованиями к фактам - спорт, финансы, любые домены с жёсткой привязкой к реальным данным - только Qwen. Laguna-S-2.1 не справляется с фактической точностью на уровне, необходимом для автономной работы в таких сценариях. Для сравнения провайдеров и выбора оптимальной конфигурации под кодинг можно обратиться к сравнению провайдеров Qwen и Gemma для кодинга и общения - там разобраны метрики pass@1 и связность ответов для разных хостингов.
Практические рекомендации: как использовать Laguna-S-2.1 в реальных проектах
Laguna-S-2.1 раскрывает потенциал в сценариях, где скорость генерации и структурная сложность важнее абсолютной фактической точности. Генерация кода с последующей верификацией - идеальный кейс. Модель быстро строит многошаговые цепочки: получить данные через API, обработать, записать в базу, сгенерировать отчёт. Разработчик проверяет логику и факты, но не тратит время на написание шаблонного кода и интеграционных вызовов.
Сложные цепочки инструментов - второй сильный сценарий. Шесть уровней глубины позволяют модели координировать несколько сервисов последовательно, не теряя контекст. Для сравнения, Qwen3.5-122B в тех же тестах достигла только четырёх уровней. Если ваша задача требует многошаговой оркестрации, Laguna даёт преимущество.
Автономные системы без контроля человека - противопоказание. Модель выдумывает данные, когда контекст давит, и делает это уверенно. Без ручной верификации такие ошибки могут попасть в продакшен и привести к некорректным решениям.
Настройка окружения: vLLM 0.25.1 и требования к GPU
Минимальная конфигурация для запуска Laguna-S-2.1 через vLLM 0.25.1 - GPU с 96 ГБ видеопамяти, как RTX Pro 6000 в наших тестах. Модель загружается целиком, без квантизации, что обеспечивает максимальную скорость и нулевое число JSON-ошибок. Пример конфигурации запуска:
python -m vllm.entrypoints.openai.api_server \
--model laguna-s-2.1-118b \
--tensor-parallel-size 1 \
--max-model-len 32768 \
--gpu-memory-utilization 0.95
Для M5 Max со 128 ГБ унифицированной памяти модель также работает, хотя и медленнее - 33-44 токен/с в greedy-режиме. Это достаточная скорость для интерактивного кодинга, если не требуется жёстких ограничений по времени ответа. Подробный разбор инференса LLM на компактном железе с замерами производительности и границами применимости есть в тестировании Strix Halo на мини-ПК с Ryzen AI Max+ 395 - там же описаны оптимизации, дающие прирост до 28%.
Итоги: место Laguna-S-2.1 в ландшафте агентных кодинг-моделей
Laguna-S-2.1 118B - рекордсмен по скорости инференса и глубине цепочек инструментов среди протестированных нами моделей. 109 токен/с, 6 уровней вложенности, ноль JSON-ошибок. Для кодинга с ручной проверкой это сильный кандидат, особенно в сценариях, где важна скорость прототипирования и многошаговая оркестрация инструментов.
Главное ограничение - фактологическая точность 0.80 и склонность к галлюцинациям под давлением контекста. Три подтверждённых случая выдумки данных - от несуществующих рынков до вымышленных лошадей - означают, что модель нельзя использовать в автономных системах, где цена ошибки высока. Qwen3.5-122B остаётся надёжнее для таких сценариев.
Перспективы Laguna-S-2.1 зависят от того, смогут ли разработчики улучшить фактологическую точность, сохранив скорость. Если да - модель способна занять лидирующую позицию в классе агентных кодинг-специалистов. Пока же это инструмент с чёткой нишей: быстрый кодинг с обязательной верификацией человеком. Для тех, кто ищет компромисс между скоростью и точностью в других архитектурах, рекомендуем сравнение DeepSeek-V4-Flash на MacBook и 2× DGX Spark - там разобран аналогичный компромисс между квантизацией и точностью.