Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Laguna-S-2.1 118B: тест локального агентного кодинг-специалиста — рекордная скорость и глубина цепочек инструментов, но галлюцинации под давлением

Laguna-S-2.1 118B на RTX Pro 6000: 109 токенов/с, глубина цепочек 6 уровней, ноль JSON-ошибок. Прямое сравнение с Qwen3.5-122B по скорости, точности и галлюцина

Коротко

Что будет в материале

  1. 01

    Ключевые результаты тестирования: Laguna-S-2.1 против Qwen3.5-122B

  2. 02

    Архитектура Laguna-S-2.1: почему она такая быстрая и глубокая

  3. 03

    Методология тестирования: как мы оценивали агентный кодинг

  4. 04

    Галлюцинации под давлением: три подтверждённых случая выдумки данных

Ключевые результаты тестирования: Laguna-S-2.1 против Qwen3.5-122B

Laguna-S-2.1 118B - это Mixture-of-Experts модель, заточенная под агентный кодинг. Мы прогнали её через 160 задач на одной RTX Pro 6000 (96GB) через vLLM 0.25.1 и сравнили с Qwen3.5-122B. Результат неоднозначный.

Laguna вырывается вперёд по скорости инференса: 109 токенов/с против 103 у Qwen. Она строит самые глубокие цепочки инструментов - до 6 уровней - и ни разу не ошиблась в JSON-форматировании. Для задач, где важна скорость и структурная сложность, это сильный кандидат.

Но есть и обратная сторона. Фактологическая точность Laguna - 0.80, тогда как Qwen держит 0.97. В доменных знаниях разрыв ещё заметнее: 0.80 против 1.00 на задачах по спорту и расчёту коэффициентов. Мы зафиксировали три подтверждённых случая выдумки данных: модель придумала P&L для отсутствующего рынка и дважды указала несуществующих лошадей с искажением позиций. Для автономных агентов Qwen надёжнее. Laguna-S-2.1 - инструмент для кодинга с обязательной ручной проверкой.

Архитектура Laguna-S-2.1: почему она такая быстрая и глубокая

Секрет скорости Laguna-S-2.1 кроется в архитектуре Mixture of Experts. Модель содержит 118 миллиардов параметров, но активирует лишь около 8 миллиардов на каждый токен. Это достигается за счёт 256 маршрутизируемых экспертов, из которых для каждой операции выбираются топ-10 плюс один общий эксперт. При 48 слоях и контекстном окне в 1 миллион токенов модель сохраняет высокую пропускную способность даже на сложных многошаговых задачах.

Измеренная производительность на M5 Max со 128 ГБ памяти - 33-44 токен/с в режиме greedy. На RTX Pro 6000 с vLLM 0.25.1 скорость поднимается до 109 токен/с. Разреженная активация экспертов снижает вычислительную нагрузку и позволяет модели быстро переключаться между инструментами, не теряя контекст. Отсюда и рекордная глубина цепочек - 6 уровней.

Сравнение архитектур: Laguna-S-2.1 и Qwen3.5-122B

Qwen3.5-122B использует другую реализацию MoE. При большем общем числе параметров она активирует иной объём вычислений на токен, что даёт прирост фактологической точности ценой скорости. Laguna жертвует плотностью знаний в пользу быстродействия: 256 экспертов с выбором топ-10 обеспечивают высокую специализацию, но разреженная активация может пропускать факты, которые плотная модель удержала бы.

Это фундаментальный компромисс. Если ваша задача - генерация кода с последующей верификацией, архитектура Laguna даёт преимущество. Если нужна автономная работа с фактическими данными без контроля человека, Qwen3.5-122B - более безопасный выбор. Подробный разбор архитектурных различий и их влияния на качество ответов мы давали в тестировании Qwen3.5 122B против Qwen3 Next 80B на 64 ГБ RAM - там же описаны узкие места CPU-инференса для MoE-моделей.

Методология тестирования: как мы оценивали агентный кодинг

Тесты проводились на RTX Pro 6000 с 96 ГБ видеопамяти, среда выполнения - vLLM 0.25.1. Набор из 160 задач покрывал три домена: генерация и отладка кода, расчёт спортивных коэффициентов, работа с финансовыми данными. Каждая задача прогонялась трижды для обеих моделей, чтобы исключить случайные выбросы.

Собирались пять метрик:

  • Скорость инференса в токенах в секунду.
  • Максимальная глубина цепочки вызовов инструментов.
  • Количество JSON-ошибок при формировании вызовов.
  • Фактологическая точность - соответствие выданных данных реальным.
  • Доменные знания - корректность ответов в узких предметных областях.

Задачи на кодинг включали многошаговые сценарии: получить данные через один инструмент, трансформировать через второй, записать результат через третий. Задачи на факты требовали точного воспроизведения реальных показателей - имён, позиций, финансовых метрик. Именно на них проявились галлюцинации Laguna.

Галлюцинации под давлением: три подтверждённых случая выдумки данных

Три случая - три разных механизма ошибки. Первый: модель сгенерировала отчёт о прибылях и убытках для рынка, которого не существует в тестовом наборе данных. Она не просто ошиблась в цифрах - она придумала целый рынок с детализированными показателями. Второй и третий случаи: Laguna дважды указала несуществующих лошадей в результатах забегов, причём с искажением позиций реальных участников. Модель уверенно называла имена и места, которых не было в исходных данных.

Qwen3.5-122B в тех же задачах либо отказывалась отвечать при нехватке данных, либо выдавала корректную информацию. Разница в поведении принципиальна: Laguna склонна заполнять пробелы правдоподобной выдумкой, Qwen - сигнализировать о неопределённости.

Почему Laguna-S-2.1 галлюцинирует: анализ ограничений MoE-архитектуры

Корень проблемы - в разреженной активации экспертов. Когда модель сталкивается с узким доменом, за который отвечает ограниченное число экспертов, а контекст давит требованием выдать результат, активированные эксперты могут не иметь достаточных знаний. Вместо отказа они компилируют правдоподобный ответ из соседних доменов. Плотные модели распределяют знания равномернее, поэтому реже попадают в эту ловушку.

Laguna-S-2.1 с 256 экспертами и выбором топ-10 имеет высокую специализацию, но платит за неё фрагментацией знаний. В задачах, где пересекаются несколько доменов, модель может активировать экспертов, не владеющих полной картиной, и синтезировать ложную информацию. Это не баг конкретной реализации - это свойство архитектуры, которое проявляется при высоком давлении контекста.

Сравнение с Qwen3.5-122B: когда скорость важнее точности

Сведём ключевые метрики в таблицу.

Метрика Laguna-S-2.1 118B Qwen3.5-122B
Скорость инференса 109 токен/с 103 токен/с
Глубина цепочек инструментов 6 уровней 4 уровня
JSON-ошибки 0 2
Фактологическая точность 0.80 0.97
Доменные знания 0.80 1.00

Выбор модели сводится к сценарию использования. Автономные агенты, работающие без контроля человека - только Qwen3.5-122B. Цена ошибки в фактических данных слишком высока. Кодинг с ручной проверкой - здесь Laguna-S-2.1 выигрывает за счёт скорости и глубины. Разработчик пишет запрос, модель генерирует сложную цепочку вызовов, разработчик верифицирует результат. Нулевое число JSON-ошибок означает, что проверка сводится к логике и фактам, а не к синтаксису.

Задачи с высокими требованиями к фактам - спорт, финансы, любые домены с жёсткой привязкой к реальным данным - только Qwen. Laguna-S-2.1 не справляется с фактической точностью на уровне, необходимом для автономной работы в таких сценариях. Для сравнения провайдеров и выбора оптимальной конфигурации под кодинг можно обратиться к сравнению провайдеров Qwen и Gemma для кодинга и общения - там разобраны метрики pass@1 и связность ответов для разных хостингов.

Практические рекомендации: как использовать Laguna-S-2.1 в реальных проектах

Laguna-S-2.1 раскрывает потенциал в сценариях, где скорость генерации и структурная сложность важнее абсолютной фактической точности. Генерация кода с последующей верификацией - идеальный кейс. Модель быстро строит многошаговые цепочки: получить данные через API, обработать, записать в базу, сгенерировать отчёт. Разработчик проверяет логику и факты, но не тратит время на написание шаблонного кода и интеграционных вызовов.

Сложные цепочки инструментов - второй сильный сценарий. Шесть уровней глубины позволяют модели координировать несколько сервисов последовательно, не теряя контекст. Для сравнения, Qwen3.5-122B в тех же тестах достигла только четырёх уровней. Если ваша задача требует многошаговой оркестрации, Laguna даёт преимущество.

Автономные системы без контроля человека - противопоказание. Модель выдумывает данные, когда контекст давит, и делает это уверенно. Без ручной верификации такие ошибки могут попасть в продакшен и привести к некорректным решениям.

Настройка окружения: vLLM 0.25.1 и требования к GPU

Минимальная конфигурация для запуска Laguna-S-2.1 через vLLM 0.25.1 - GPU с 96 ГБ видеопамяти, как RTX Pro 6000 в наших тестах. Модель загружается целиком, без квантизации, что обеспечивает максимальную скорость и нулевое число JSON-ошибок. Пример конфигурации запуска:

python -m vllm.entrypoints.openai.api_server \
  --model laguna-s-2.1-118b \
  --tensor-parallel-size 1 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.95

Для M5 Max со 128 ГБ унифицированной памяти модель также работает, хотя и медленнее - 33-44 токен/с в greedy-режиме. Это достаточная скорость для интерактивного кодинга, если не требуется жёстких ограничений по времени ответа. Подробный разбор инференса LLM на компактном железе с замерами производительности и границами применимости есть в тестировании Strix Halo на мини-ПК с Ryzen AI Max+ 395 - там же описаны оптимизации, дающие прирост до 28%.

Итоги: место Laguna-S-2.1 в ландшафте агентных кодинг-моделей

Laguna-S-2.1 118B - рекордсмен по скорости инференса и глубине цепочек инструментов среди протестированных нами моделей. 109 токен/с, 6 уровней вложенности, ноль JSON-ошибок. Для кодинга с ручной проверкой это сильный кандидат, особенно в сценариях, где важна скорость прототипирования и многошаговая оркестрация инструментов.

Главное ограничение - фактологическая точность 0.80 и склонность к галлюцинациям под давлением контекста. Три подтверждённых случая выдумки данных - от несуществующих рынков до вымышленных лошадей - означают, что модель нельзя использовать в автономных системах, где цена ошибки высока. Qwen3.5-122B остаётся надёжнее для таких сценариев.

Перспективы Laguna-S-2.1 зависят от того, смогут ли разработчики улучшить фактологическую точность, сохранив скорость. Если да - модель способна занять лидирующую позицию в классе агентных кодинг-специалистов. Пока же это инструмент с чёткой нишей: быстрый кодинг с обязательной верификацией человеком. Для тех, кто ищет компромисс между скоростью и точностью в других архитектурах, рекомендуем сравнение DeepSeek-V4-Flash на MacBook и 2× DGX Spark - там разобран аналогичный компромисс между квантизацией и точностью.

Подписаться на канал