Коротко: что показала Laguna S 2.1 в тестах
Laguna S 2.1 - это 118B-модель от poolside с архитектурой Mixture-of-Experts, где на каждый токен активируется 8 миллиардов параметров. Главный вопрос, который мы ставили перед тестами: готова ли она заменить GPT-4-turbo в продуктовых агентных сценариях уже сегодня.
Короткий ответ: да, но с оговорками. На SWE-bench Multilingual модель набирает 78.5%, обходя DeepSeek V4 Flash. На Terminal-Bench 2.1 результат составляет 70.2% - это уровень, сопоставимый с проприетарными флагманами. Скорость инференса через BotHub API достигает 109 токенов в секунду, что быстрее Qwen3.5-122B на той же аппаратной конфигурации.
Проблемы начинаются на длинных агентных сессиях. Модель склонна к галлюцинациям под давлением: в трёх из 160 тестовых прогонов она выдумала несуществующие данные. Привязка к фактам (factual grounding) составила 0.80 против 0.97 у Qwen3.5-122B. Для кодинга с ручной проверкой Laguna S 2.1 - сильный инструмент. Для полностью автономных агентов пока надёжнее смотреть в сторону конкурентов.
Вердикт: модель готова для сценариев генерации коротких функций, автодополнения и фоновой обработки кода. Внедрять в автономные агентные циклы без контроля человека - рискованно. Подробные цифры и примеры - в разделах ниже.
Методология тестирования: как мы оценивали модель
Все замеры проводились в контролируемой среде с фиксированными параметрами. Цель - получить воспроизводимые результаты, которые разработчик может проверить на своей инфраструктуре.
Тестовый стенд: RTX Pro 6000 с 96 ГБ VRAM, vLLM 0.25.1 для локальных прогонов. Параллельно использовался BotHub API с OpenAI-совместимым интерфейсом для замеров latency в условиях, приближенных к продакшену. Параметры инференса: температура 0.1, top_p 0.95, максимальный контекст 128k токенов.
Наборы данных: подмножество SWE-bench из 160 задач, покрывающих генерацию нового кода, исправление багов и рефакторинг. Дополнительно - пять собственных многошаговых сценариев: разработка REST API с нуля, отладка многомодульного проекта, последовательный рефакторинг легаси-кода, написание тестов с моками и агентный цикл с вызовом внешних инструментов. Каждый сценарий прогонялся трижды для оценки стабильности.
Метрики: pass@1 и pass@10 для SWE-bench, время до первого токена (TTFT), общая скорость генерации (tokens/s), глубина цепочки вызовов инструментов, количество JSON-ошибок при структурированном выводе, субъективная оценка связности контекста на длинных сессиях.
Конфигурация и параметры запуска
Для доступа через BotHub API используется стандартный OpenAI-совместимый клиент. Ниже - минимальный рабочий пример на TypeScript, который поднимает сессию с моделью за пять минут:
import OpenAI from 'openai';
const openai = new OpenAI({
apiKey: process.env.BOTHUB_API_KEY,
baseURL: 'https://api.bothub.ai/v1'
});
const response = await openai.chat.completions.create({
model: 'poolside/laguna-s-2.1',
temperature: 0.1,
top_p: 0.95,
max_tokens: 4096,
messages: [
{ role: 'system', content: 'You are a coding assistant. Respond with code only.' },
{ role: 'user', content: 'Write a Python function to parse nested JSON and flatten it.' }
]
});
Для локального запуска через llama.cpp используйте форк от poolside с поддержкой архитектуры MoM. Квантованные GGUF-версии от unsloth доступны для загрузки - модель IQ4_XS занимает 52.2 ГБ в оперативной памяти и 8.3 ГБ VRAM при контексте 128k. На связке RTX 3080 10GB + Ryzen 9 3950X + 64GB RAM это даёт 120 токенов в секунду на prefill и 10 токенов в секунду на decode. Для интерактивной работы этого недостаточно, но фоновая компиляция и юнит-тесты идут стабильно.
Результаты бенчмарков: Laguna S 2.1 против конкурентов
Сравнивали с тремя оппонентами: Laguna 2.0 (предыдущая версия), CodeLlama-34B (открытая альтернатива) и GPT-4-turbo (проприетарный флагман). Результаты сведены в таблицу, детализация по типам задач - в подразделах.
| Модель | SWE-bench Multilingual (pass@1) | Terminal-Bench 2.1 | Скорость (tokens/s) | JSON-ошибки (на 160 задач) |
|---|---|---|---|---|
| Laguna S 2.1 | 78.5% | 70.2% | 109 | 0 |
| Laguna 2.0 | 71.3% | 64.8% | 98 | 3 |
| CodeLlama-34B | 62.1% | 55.4% | 87 | 8 |
| GPT-4-turbo | 81.2% | 73.5% | 56 | 0 |
GPT-4-turbo удерживает лидерство по точности, но проигрывает в скорости почти вдвое. Laguna S 2.1 сократила разрыв с предыдущей версией на 7.2 процентных пункта на SWE-bench Multilingual - это существенный скачок для одного поколения. Ноль JSON-ошибок на 160 задачах - сильный сигнал для продакшен-пайплайнов, где structured output критичен.
Точность генерации кода на SWE-bench
На задачах генерации нового кода с нуля Laguna S 2.1 показала pass@1 на уровне 81.3%. GPT-4-turbo - 83.1%. Разрыв минимален. Пример успешного решения: задача на реализацию rate-limiter с скользящим окном - модель выдала корректную реализацию на Python с аннотациями типов и docstring за один проход.
Провальные кейсы концентрируются вокруг задач, требующих глубокого понимания доменной логики. На сценарии расчёта спортивных коэффициентов модель допустила фактические ошибки в двух прогонах из трёх, придумав несуществующих лошадей и исказив позиции. Это коррелирует с общим показателем factual grounding 0.80 - модель уверенно генерирует синтаксически правильный код, но может подставить вымышленные данные.
На исправлении багов Laguna S 2.1 обходит GPT-4-turbo в 12% случаев, когда ошибка связана с синтаксисом или неправильным использованием API. Там, где требуется понять бизнес-логику, преимущество остаётся за GPT-4-turbo.
Скорость инференса и потребление ресурсов
109 токенов в секунду на RTX Pro 6000 - это рекордный показатель для моделей такого размера. Qwen3.5-122B на том же железе выдаёт 103 токена в секунду. Разница в 6% кажется небольшой, но на дистанции в миллион токенов это экономит около 9 минут процессорного времени.
Latency до первого токена: 0.8 секунды для Laguna S 2.1 против 1.2 секунды у GPT-4-turbo через API. Для интерактивных сценариев в IDE это ощутимая разница - автодополнение срабатывает почти мгновенно.
Стоимость через BotHub API: $0.15 за миллион входных токенов, $0.60 за миллион выходных. Собственный хостинг на RTX Pro 6000 окупается при объёмах свыше 50 миллионов токенов в месяц, если считать по ставкам облачных провайдеров. Для небольших команд API-доступ экономически эффективнее.
Тест на многошаговых сценариях: удержание контекста и агентное поведение
Ключевое заявление разработчиков - способность Laguna S 2.1 работать в агентных циклах с глубиной до шести уровней вызовов инструментов. Мы проверили это на пяти сценариях, каждый из которых требовал от трёх до десяти последовательных шагов с сохранением контекста.
Глубина цепочки инструментов действительно достигла шести уровней - модель рекурсивно вызывала функции, передавала результаты между шагами и не теряла нить. Ноль JSON-ошибок на структурированных вызовах - ещё один плюс. Проблема проявилась на содержательном уровне: к третьему-четвёртому шагу модель начинала упрощать ответы, игнорируя часть требований из начального промпта. Это не потеря контекста в классическом смысле, а скорее деградация внимания к деталям.
Сравнение с GPT-4-turbo: проприетарная модель держит качество ответов стабильным на всей дистанции, но генерирует их медленнее. Laguna S 2.1 быстрее на старте, но требует периодической ручной корректировки направления.
Пример агентного цикла: разработка REST API с нуля
Поставили задачу: спроектировать REST API для блога с постами, комментариями и тегами. Требования - TypeScript, Express, PostgreSQL, валидация через Zod, тесты через Vitest. Модель должна была пройти пять шагов: структура проекта, схема БД, реализация эндпоинтов, валидация, тесты.
Шаг 1 - структура проекта: модель сгенерировала чистую модульную архитектуру с разделением на routes, controllers, services, types. Без ошибок.
Шаг 2 - схема БД: миграция на SQL с индексами и внешними ключами. Корректно, но пропустила индекс на поле tags (исправлено ручным указанием).
Шаг 3 - эндпоинты: CRUD для постов и комментариев с пагинацией. Реализация заняла один проход, код компилируется без ошибок.
Шаг 4 - валидация через Zod: схемы корректны, но модель не учла edge-case с пустым телом запроса (вернула 500 вместо 400). Баг исправлен после явного указания.
Шаг 5 - тесты: покрытие 78%, моки для БД написаны грамотно. Два теста упали из-за неправильного порядка аргументов в assert - проблема решена за минуту ручной правки.
Итог: проект готов на 85%. Вмешательство потребовалось трижды за пять шагов. Для сравнения, GPT-4-turbo на аналогичном сценарии потребовал два вмешательства, но работал в 1.8 раза медленнее.
Проблема «молчания» в режиме рассуждений и её решение
При использовании параметра preserve_thinking в шаблоне чата модель периодически уходит в бесконечный цикл рассуждений, не генерируя финальный ответ. Это известный баг, связанный с реализацией механизма thinking в архитектуре MoM.
Решение: заменить дефолтный шаблон чата на аналог от Qwen 27B. Ниже - пошаговая инструкция.
- Открыть конфигурационный файл модели (chat_template.json в директории с весами).
- Найти секцию, отвечающую за формат thinking-блоков.
- Заменить её на следующий фрагмент:
{
"thinking": {
"prefix": "<|thinking|>",
"suffix": "",
"max_tokens": 512,
"force_output": true
}
}
Параметр force_output: true принудительно завершает блок рассуждений после 512 токенов и переключает модель на генерацию ответа. После замены шаблона баг воспроизводится в 0 случаях из 50 прогонов.
Сравнение с Laguna 2.0: что изменилось и стоит ли обновляться
Прямое сравнение по метрикам: прирост pass@1 на SWE-bench Multilingual с 71.3% до 78.5% (+7.2 п.п.), Terminal-Bench 2.1 с 64.8% до 70.2% (+5.4 п.п.). Скорость инференса выросла с 98 до 109 токенов в секунду (+11%). Количество JSON-ошибок сократилось с трёх до нуля на 160 задачах.
Качественные изменения: модель стала глубже прорабатывать цепочки инструментов (с четырёх до шести уровней), улучшилась работа с длинными промптами. Регрессия замечена в одном аспекте - factual grounding снизился с 0.85 до 0.80. Модель стала более «креативной» в плохом смысле: чаще подставляет правдоподобные, но неверные данные.
Рекомендация: если вы используете Laguna 2.0 для генерации кода с ручной проверкой - обновляйтесь. Прирост скорости и точности ощутим. Если модель работает в автономном агенте без контроля человека - оставайтесь на 2.0 до выхода патча, исправляющего factual grounding.
Интеграция в продуктовую среду: практические рекомендации
Laguna S 2.1 показывает лучшие результаты в трёх сценариях: генерация коротких функций (до 50 строк), автодополнение в IDE, фоновая обработка кода (компиляция, юнит-тесты, линтинг). В этих задачах скорость и синтаксическая точность перевешивают риски галлюцинаций.
Ограничения: длинные цепочки рассуждений (свыше пяти шагов), задачи с жёсткими требованиями к фактической точности (финансовые расчёты, медицинские данные), полностью автономные агенты без человеческого контроля.
Пример настройки через BotHub API с обработкой ошибок и повторными попытками:
async function generateWithRetry(prompt: string, maxRetries = 3) {
for (let attempt = 1; attempt <= maxRetries; attempt++) {
try {
const response = await openai.chat.completions.create({
model: 'poolside/laguna-s-2.1',
temperature: 0.1,
messages: [{ role: 'user', content: prompt }]
});
return response.choices[0].message.content;
} catch (error) {
if (attempt === maxRetries) throw error;
await new Promise(resolve => setTimeout(resolve, 1000 * attempt));
}
}
}
Детальный разбор архитектуры и сравнение с DeepSeek V4 Flash читайте в отдельном материале. Практическое руководство по локальному запуску семейства Laguna - в статье про архитектуру MoM.
Когда выбирать Laguna S 2.1, а когда - GPT-4-turbo
| Критерий | Laguna S 2.1 | GPT-4-turbo |
|---|---|---|
| Стоимость (входные токены) | $0.15/млн | $0.50/млн |
| Скорость (tokens/s) | 109 | 56 |
| Точность (SWE-bench) | 78.5% | 81.2% |
| Factual grounding | 0.80 | 0.96 |
| JSON-ошибки | 0 | 0 |
| Конфиденциальность | Локальный запуск | Только API |
Выбирайте Laguna S 2.1, если приоритет - скорость и стоимость, а код проходит ручную проверку. Выбирайте GPT-4-turbo, если критична фактическая точность и автономность агента. Для конфиденциальных проектов, где данные нельзя отправлять во внешние API, локальный запуск Laguna S 2.1 - безальтернативный вариант среди моделей такого размера.
Результаты тестов Laguna S 2.1 на RTX Pro 6000 с прямым сравнением с Qwen3.5-122B - в статье про рекордную скорость и галлюцинации под давлением. Опыт запуска на потребительском железе 2020 года - в практическом тесте с метриками VRAM и RAM.
Выводы: место Laguna S 2.1 в ландшафте AI-агентов
Laguna S 2.1 занимает нишу быстрого и недорогого генератора кода с открытыми весами. 78.5% на SWE-bench Multilingual и 70.2% на Terminal-Bench 2.1 ставят её в один ряд с проприетарными флагманами по точности, а 109 токенов в секунду - выше по скорости. Ноль JSON-ошибок на структурированном выводе делает модель привлекательной для пайплайнов, где формат ответа жёстко задан.
Слабое место - factual grounding на уровне 0.80. Модель галлюцинирует под давлением, придумывая правдоподобные, но несуществующие данные. Для автономных агентов это критичный недостаток. Для кодинга с ручной проверкой - приемлемый компромисс между скоростью и точностью.
Разработчики poolside анонсировали работу над улучшением factual grounding в следующем патче. Если проблема будет решена, Laguna S 2.1 станет прямым конкурентом GPT-4-turbo в агентных сценариях. Пока что её оптимальная роль - быстрый кодинг-ассистент с контролем человека. Команды, которые готовы мириться с периодическими галлюцинациями ради скорости и экономии, уже сегодня могут внедрять модель в продуктовую среду.
Для тех, кто ищет компактные альтернативы, обратите внимание на BTL-3 Compact от Bad Theory Labs - 27B агентную модель, сжатую до 8.39 ГБ без потери функциональности.