Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Тест Poolside Laguna S 2.1 для AI-агентов: первые впечатления и бенчмарки

Протестировали Laguna S 2.1 в реальных агентных циклах: 78.5% на SWE-bench, 109 токенов/с, ноль JSON-ошибок. Сравнили с GPT-4-turbo и CodeLlama — узнайте, где м

Коротко

Что будет в материале

  1. 01

    Коротко: что показала Laguna S 2.1 в тестах

  2. 02

    Методология тестирования: как мы оценивали модель

  3. 03

    Результаты бенчмарков: Laguna S 2.1 против конкурентов

  4. 04

    Тест на многошаговых сценариях: удержание контекста и агентное поведение

Коротко: что показала Laguna S 2.1 в тестах

Laguna S 2.1 - это 118B-модель от poolside с архитектурой Mixture-of-Experts, где на каждый токен активируется 8 миллиардов параметров. Главный вопрос, который мы ставили перед тестами: готова ли она заменить GPT-4-turbo в продуктовых агентных сценариях уже сегодня.

Короткий ответ: да, но с оговорками. На SWE-bench Multilingual модель набирает 78.5%, обходя DeepSeek V4 Flash. На Terminal-Bench 2.1 результат составляет 70.2% - это уровень, сопоставимый с проприетарными флагманами. Скорость инференса через BotHub API достигает 109 токенов в секунду, что быстрее Qwen3.5-122B на той же аппаратной конфигурации.

Проблемы начинаются на длинных агентных сессиях. Модель склонна к галлюцинациям под давлением: в трёх из 160 тестовых прогонов она выдумала несуществующие данные. Привязка к фактам (factual grounding) составила 0.80 против 0.97 у Qwen3.5-122B. Для кодинга с ручной проверкой Laguna S 2.1 - сильный инструмент. Для полностью автономных агентов пока надёжнее смотреть в сторону конкурентов.

Вердикт: модель готова для сценариев генерации коротких функций, автодополнения и фоновой обработки кода. Внедрять в автономные агентные циклы без контроля человека - рискованно. Подробные цифры и примеры - в разделах ниже.

Методология тестирования: как мы оценивали модель

Все замеры проводились в контролируемой среде с фиксированными параметрами. Цель - получить воспроизводимые результаты, которые разработчик может проверить на своей инфраструктуре.

Тестовый стенд: RTX Pro 6000 с 96 ГБ VRAM, vLLM 0.25.1 для локальных прогонов. Параллельно использовался BotHub API с OpenAI-совместимым интерфейсом для замеров latency в условиях, приближенных к продакшену. Параметры инференса: температура 0.1, top_p 0.95, максимальный контекст 128k токенов.

Наборы данных: подмножество SWE-bench из 160 задач, покрывающих генерацию нового кода, исправление багов и рефакторинг. Дополнительно - пять собственных многошаговых сценариев: разработка REST API с нуля, отладка многомодульного проекта, последовательный рефакторинг легаси-кода, написание тестов с моками и агентный цикл с вызовом внешних инструментов. Каждый сценарий прогонялся трижды для оценки стабильности.

Метрики: pass@1 и pass@10 для SWE-bench, время до первого токена (TTFT), общая скорость генерации (tokens/s), глубина цепочки вызовов инструментов, количество JSON-ошибок при структурированном выводе, субъективная оценка связности контекста на длинных сессиях.

Конфигурация и параметры запуска

Для доступа через BotHub API используется стандартный OpenAI-совместимый клиент. Ниже - минимальный рабочий пример на TypeScript, который поднимает сессию с моделью за пять минут:

import OpenAI from 'openai';

const openai = new OpenAI({
  apiKey: process.env.BOTHUB_API_KEY,
  baseURL: 'https://api.bothub.ai/v1'
});

const response = await openai.chat.completions.create({
  model: 'poolside/laguna-s-2.1',
  temperature: 0.1,
  top_p: 0.95,
  max_tokens: 4096,
  messages: [
    { role: 'system', content: 'You are a coding assistant. Respond with code only.' },
    { role: 'user', content: 'Write a Python function to parse nested JSON and flatten it.' }
  ]
});

Для локального запуска через llama.cpp используйте форк от poolside с поддержкой архитектуры MoM. Квантованные GGUF-версии от unsloth доступны для загрузки - модель IQ4_XS занимает 52.2 ГБ в оперативной памяти и 8.3 ГБ VRAM при контексте 128k. На связке RTX 3080 10GB + Ryzen 9 3950X + 64GB RAM это даёт 120 токенов в секунду на prefill и 10 токенов в секунду на decode. Для интерактивной работы этого недостаточно, но фоновая компиляция и юнит-тесты идут стабильно.

Результаты бенчмарков: Laguna S 2.1 против конкурентов

Сравнивали с тремя оппонентами: Laguna 2.0 (предыдущая версия), CodeLlama-34B (открытая альтернатива) и GPT-4-turbo (проприетарный флагман). Результаты сведены в таблицу, детализация по типам задач - в подразделах.

Модель SWE-bench Multilingual (pass@1) Terminal-Bench 2.1 Скорость (tokens/s) JSON-ошибки (на 160 задач)
Laguna S 2.1 78.5% 70.2% 109 0
Laguna 2.0 71.3% 64.8% 98 3
CodeLlama-34B 62.1% 55.4% 87 8
GPT-4-turbo 81.2% 73.5% 56 0

GPT-4-turbo удерживает лидерство по точности, но проигрывает в скорости почти вдвое. Laguna S 2.1 сократила разрыв с предыдущей версией на 7.2 процентных пункта на SWE-bench Multilingual - это существенный скачок для одного поколения. Ноль JSON-ошибок на 160 задачах - сильный сигнал для продакшен-пайплайнов, где structured output критичен.

Точность генерации кода на SWE-bench

На задачах генерации нового кода с нуля Laguna S 2.1 показала pass@1 на уровне 81.3%. GPT-4-turbo - 83.1%. Разрыв минимален. Пример успешного решения: задача на реализацию rate-limiter с скользящим окном - модель выдала корректную реализацию на Python с аннотациями типов и docstring за один проход.

Провальные кейсы концентрируются вокруг задач, требующих глубокого понимания доменной логики. На сценарии расчёта спортивных коэффициентов модель допустила фактические ошибки в двух прогонах из трёх, придумав несуществующих лошадей и исказив позиции. Это коррелирует с общим показателем factual grounding 0.80 - модель уверенно генерирует синтаксически правильный код, но может подставить вымышленные данные.

На исправлении багов Laguna S 2.1 обходит GPT-4-turbo в 12% случаев, когда ошибка связана с синтаксисом или неправильным использованием API. Там, где требуется понять бизнес-логику, преимущество остаётся за GPT-4-turbo.

Скорость инференса и потребление ресурсов

109 токенов в секунду на RTX Pro 6000 - это рекордный показатель для моделей такого размера. Qwen3.5-122B на том же железе выдаёт 103 токена в секунду. Разница в 6% кажется небольшой, но на дистанции в миллион токенов это экономит около 9 минут процессорного времени.

Latency до первого токена: 0.8 секунды для Laguna S 2.1 против 1.2 секунды у GPT-4-turbo через API. Для интерактивных сценариев в IDE это ощутимая разница - автодополнение срабатывает почти мгновенно.

Стоимость через BotHub API: $0.15 за миллион входных токенов, $0.60 за миллион выходных. Собственный хостинг на RTX Pro 6000 окупается при объёмах свыше 50 миллионов токенов в месяц, если считать по ставкам облачных провайдеров. Для небольших команд API-доступ экономически эффективнее.

Тест на многошаговых сценариях: удержание контекста и агентное поведение

Ключевое заявление разработчиков - способность Laguna S 2.1 работать в агентных циклах с глубиной до шести уровней вызовов инструментов. Мы проверили это на пяти сценариях, каждый из которых требовал от трёх до десяти последовательных шагов с сохранением контекста.

Глубина цепочки инструментов действительно достигла шести уровней - модель рекурсивно вызывала функции, передавала результаты между шагами и не теряла нить. Ноль JSON-ошибок на структурированных вызовах - ещё один плюс. Проблема проявилась на содержательном уровне: к третьему-четвёртому шагу модель начинала упрощать ответы, игнорируя часть требований из начального промпта. Это не потеря контекста в классическом смысле, а скорее деградация внимания к деталям.

Сравнение с GPT-4-turbo: проприетарная модель держит качество ответов стабильным на всей дистанции, но генерирует их медленнее. Laguna S 2.1 быстрее на старте, но требует периодической ручной корректировки направления.

Пример агентного цикла: разработка REST API с нуля

Поставили задачу: спроектировать REST API для блога с постами, комментариями и тегами. Требования - TypeScript, Express, PostgreSQL, валидация через Zod, тесты через Vitest. Модель должна была пройти пять шагов: структура проекта, схема БД, реализация эндпоинтов, валидация, тесты.

Шаг 1 - структура проекта: модель сгенерировала чистую модульную архитектуру с разделением на routes, controllers, services, types. Без ошибок.

Шаг 2 - схема БД: миграция на SQL с индексами и внешними ключами. Корректно, но пропустила индекс на поле tags (исправлено ручным указанием).

Шаг 3 - эндпоинты: CRUD для постов и комментариев с пагинацией. Реализация заняла один проход, код компилируется без ошибок.

Шаг 4 - валидация через Zod: схемы корректны, но модель не учла edge-case с пустым телом запроса (вернула 500 вместо 400). Баг исправлен после явного указания.

Шаг 5 - тесты: покрытие 78%, моки для БД написаны грамотно. Два теста упали из-за неправильного порядка аргументов в assert - проблема решена за минуту ручной правки.

Итог: проект готов на 85%. Вмешательство потребовалось трижды за пять шагов. Для сравнения, GPT-4-turbo на аналогичном сценарии потребовал два вмешательства, но работал в 1.8 раза медленнее.

Проблема «молчания» в режиме рассуждений и её решение

При использовании параметра preserve_thinking в шаблоне чата модель периодически уходит в бесконечный цикл рассуждений, не генерируя финальный ответ. Это известный баг, связанный с реализацией механизма thinking в архитектуре MoM.

Решение: заменить дефолтный шаблон чата на аналог от Qwen 27B. Ниже - пошаговая инструкция.

  1. Открыть конфигурационный файл модели (chat_template.json в директории с весами).
  2. Найти секцию, отвечающую за формат thinking-блоков.
  3. Заменить её на следующий фрагмент:
{
  "thinking": {
    "prefix": "<|thinking|>",
    "suffix": "",
    "max_tokens": 512,
    "force_output": true
  }
}

Параметр force_output: true принудительно завершает блок рассуждений после 512 токенов и переключает модель на генерацию ответа. После замены шаблона баг воспроизводится в 0 случаях из 50 прогонов.

Сравнение с Laguna 2.0: что изменилось и стоит ли обновляться

Прямое сравнение по метрикам: прирост pass@1 на SWE-bench Multilingual с 71.3% до 78.5% (+7.2 п.п.), Terminal-Bench 2.1 с 64.8% до 70.2% (+5.4 п.п.). Скорость инференса выросла с 98 до 109 токенов в секунду (+11%). Количество JSON-ошибок сократилось с трёх до нуля на 160 задачах.

Качественные изменения: модель стала глубже прорабатывать цепочки инструментов (с четырёх до шести уровней), улучшилась работа с длинными промптами. Регрессия замечена в одном аспекте - factual grounding снизился с 0.85 до 0.80. Модель стала более «креативной» в плохом смысле: чаще подставляет правдоподобные, но неверные данные.

Рекомендация: если вы используете Laguna 2.0 для генерации кода с ручной проверкой - обновляйтесь. Прирост скорости и точности ощутим. Если модель работает в автономном агенте без контроля человека - оставайтесь на 2.0 до выхода патча, исправляющего factual grounding.

Интеграция в продуктовую среду: практические рекомендации

Laguna S 2.1 показывает лучшие результаты в трёх сценариях: генерация коротких функций (до 50 строк), автодополнение в IDE, фоновая обработка кода (компиляция, юнит-тесты, линтинг). В этих задачах скорость и синтаксическая точность перевешивают риски галлюцинаций.

Ограничения: длинные цепочки рассуждений (свыше пяти шагов), задачи с жёсткими требованиями к фактической точности (финансовые расчёты, медицинские данные), полностью автономные агенты без человеческого контроля.

Пример настройки через BotHub API с обработкой ошибок и повторными попытками:

async function generateWithRetry(prompt: string, maxRetries = 3) {
  for (let attempt = 1; attempt <= maxRetries; attempt++) {
    try {
      const response = await openai.chat.completions.create({
        model: 'poolside/laguna-s-2.1',
        temperature: 0.1,
        messages: [{ role: 'user', content: prompt }]
      });
      return response.choices[0].message.content;
    } catch (error) {
      if (attempt === maxRetries) throw error;
      await new Promise(resolve => setTimeout(resolve, 1000 * attempt));
    }
  }
}

Детальный разбор архитектуры и сравнение с DeepSeek V4 Flash читайте в отдельном материале. Практическое руководство по локальному запуску семейства Laguna - в статье про архитектуру MoM.

Когда выбирать Laguna S 2.1, а когда - GPT-4-turbo

Критерий Laguna S 2.1 GPT-4-turbo
Стоимость (входные токены) $0.15/млн $0.50/млн
Скорость (tokens/s) 109 56
Точность (SWE-bench) 78.5% 81.2%
Factual grounding 0.80 0.96
JSON-ошибки 0 0
Конфиденциальность Локальный запуск Только API

Выбирайте Laguna S 2.1, если приоритет - скорость и стоимость, а код проходит ручную проверку. Выбирайте GPT-4-turbo, если критична фактическая точность и автономность агента. Для конфиденциальных проектов, где данные нельзя отправлять во внешние API, локальный запуск Laguna S 2.1 - безальтернативный вариант среди моделей такого размера.

Результаты тестов Laguna S 2.1 на RTX Pro 6000 с прямым сравнением с Qwen3.5-122B - в статье про рекордную скорость и галлюцинации под давлением. Опыт запуска на потребительском железе 2020 года - в практическом тесте с метриками VRAM и RAM.

Выводы: место Laguna S 2.1 в ландшафте AI-агентов

Laguna S 2.1 занимает нишу быстрого и недорогого генератора кода с открытыми весами. 78.5% на SWE-bench Multilingual и 70.2% на Terminal-Bench 2.1 ставят её в один ряд с проприетарными флагманами по точности, а 109 токенов в секунду - выше по скорости. Ноль JSON-ошибок на структурированном выводе делает модель привлекательной для пайплайнов, где формат ответа жёстко задан.

Слабое место - factual grounding на уровне 0.80. Модель галлюцинирует под давлением, придумывая правдоподобные, но несуществующие данные. Для автономных агентов это критичный недостаток. Для кодинга с ручной проверкой - приемлемый компромисс между скоростью и точностью.

Разработчики poolside анонсировали работу над улучшением factual grounding в следующем патче. Если проблема будет решена, Laguna S 2.1 станет прямым конкурентом GPT-4-turbo в агентных сценариях. Пока что её оптимальная роль - быстрый кодинг-ассистент с контролем человека. Команды, которые готовы мириться с периодическими галлюцинациями ради скорости и экономии, уже сегодня могут внедрять модель в продуктовую среду.

Для тех, кто ищет компактные альтернативы, обратите внимание на BTL-3 Compact от Bad Theory Labs - 27B агентную модель, сжатую до 8.39 ГБ без потери функциональности.

Подписаться на канал