Poolside Laguna-S-2.1 - это 120-миллиардная языковая модель архитектуры Mixture of Experts, заточенная под агентное кодирование и доступная для локального запуска прямо сейчас. Ключевой факт: 4-битный квант JANG_4M от OsaurusAI выдаёт 33-44 токена в секунду на Apple Silicon M5 Max со 128 ГБ оперативной памяти. Этого достаточно, чтобы работать с длинными код-базами, генерировать документацию и выполнять сложные цепочки инструментов без аренды облачных GPU. Модель поддерживает контекст в 1 миллион токенов, использует 256 экспертов с активацией лишь 8 миллиардов параметров за шаг и конкурирует по качеству с более крупными frontier MoE-решениями.
Информационный шум вокруг новых релизов зашкаливает: каждую неделю выходят десятки моделей, и понять, какая из них реально работает на потребительском железе, а не только в бенчмарках на A100, становится всё сложнее. Laguna-S-2.1 выделяется тем, что для неё уже есть готовые GGUFs, кастомный форк llama.cpp и подробные инструкции по запуску. В этом разборе - архитектура, цифры производительности, пошаговый запуск и честная оценка ограничений.
Что такое Laguna-S-2.1 и почему она важна прямо сейчас
Poolside выпустила Laguna-S-2.1 как развитие своей линейки моделей для программной инженерии. Версия S-2.1 насчитывает 120 миллиардов параметров в разреженной MoE-архитектуре, где на каждом шаге активно лишь около 8 миллиардов. Это даёт двойной выигрыш: качество большой модели и скорость инференса, сравнимую с компактными dense-моделями.
Модель доступна на Hugging Face в репозитории OsaurusAI/Laguna-S-2.1-JANG_4M. Квант JANG_4M использует 4-битные веса для экспертов с AWQ, 6-битные для общего эксперта и 8-битные для attention-слоёв, роутера и нормализации в fp16. Такой модульный подход к точности сохраняет качество там, где это критично, и агрессивно сжимает то, что менее чувствительно к потерям.
Почему это важно. Локальный запуск 120B-модели перестаёт быть привилегией дата-центров. Система за 8000 долларов с двумя DGX Spark уже тянет модели такого класса в 4-битной квантности. Laguna-S-2.1 идёт дальше: она работает на одном чипе M5 Max, который стоит в составе готового устройства. Это снижает порог входа для независимых разработчиков и небольших команд.
Архитектура Laguna-S-2.1: как устроена 120B-модель
Архитектурно Laguna-S-2.1 - это Mixture of Experts с 48 слоями, Grouped Query Attention и гибридным механизмом внимания, сочетающим глобальные и скользящие окна. Разберём ключевые компоненты.
Mixture of Experts: 256 экспертов и эффективная активация
Модель содержит 256 маршрутизируемых экспертов плюс один общий эксперт, который активируется всегда. Роутер на каждом токене выбирает top-10 экспертов из 256, суммируя их выходы с весами. Общий эксперт добавляет стабильности: даже если роутер ошибается с распределением, базовая компетенция модели не проваливается.
При 120B полных параметров активными остаются только около 8 миллиардов. Это соотношение достигается за счёт того, что каждый эксперт - относительно узкий блок, а основная масса параметров лежит в неактивных ветках. Результат: объём вычислений на токен примерно соответствует dense-модели на 8B, а качество выходит на уровень значительно более крупных систем. Прямой выигрыш для разработчика - модель не требует 8×A100 для комфортной работы.
Нулевой слой сделан dense, без маршрутизации. Это обеспечивает качественное начальное представление токенов до того, как они попадут в MoE-блоки. Практическое следствие: модель лучше держит контекст на старте длинных диалогов и не разваливается при переключении между экспертами.
Sliding Window Attention и работа с длинным контекстом
Laguna-S-2.1 заявляет поддержку контекста в 1 миллион токенов. Достигается это гибридной схемой внимания: 12 слоёв из 48 используют глобальное внимание на весь контекст, остальные 36 работают со скользящим окном шириной 512 токенов.
Глобальные слои дают модели способность связывать удалённые участки кода - например, вызов функции в одном модуле и её определение в другом, отстоящем на сотни тысяч токенов. SWA-слои обрабатывают локальный контекст с линейной сложностью по длине последовательности, а не квадратичной. Без этого механизма 1M-контекст требовал бы нереалистичного объёма вычислений и памяти.
Grouped Query Attention с 8 KV-головами дополнительно снижает затраты на кэш ключей и значений. Для агентного кодирования, где модель держит в памяти всю историю взаимодействия с инструментами, это критично: кэш на миллион токенов должен помещаться в доступную память.
Квантование JANG_4M: запуск 120B на Apple Silicon
OsaurusAI подготовила квант JANG_4M специально для Apple Silicon. Схема квантования дифференцированная: 4-битные аффинные веса для gate/up/down проекций экспертов с групповым квантованием по 64 и AWQ-оптимизацией, 6-битные для общего эксперта, 8-битные для attention-проекций и g_proj. Роутер, bias и нормализации остаются в fp16.
Такая гранулярность важна. Attention-слои чувствительны к ошибкам квантования: потеря точности здесь напрямую бьёт по способности модели фокусироваться на релевантных участках контекста. Эксперты, наоборот, избыточны по параметрам, и 4 бита с AWQ дают минимальную деградацию при максимальном сжатии.
Производительность на M5 Max: 33-44 токена в секунду
На M5 Max со 128 ГБ унифицированной памяти модель показывает 33 токена в секунду на холодном старте и до 44 токенов в секунду после прогрева при жадной декодировке. Это практические замеры, а не теоретические расчёты.
Ключевой параметр для достижения таких цифр - лимит wired memory. Рекомендованное значение: минимум из (размер бандла × 1.2 + 8 ГБ) и 118 ГБ. Если лимит не настроен, пропускная способность памяти падает примерно вдвое, и скорость инференса соответственно снижается. Настройка выполняется через sysctl, конкретные значения зависят от конфигурации системы.
Для сравнения: на одной RTX Pro 6000 с 96 ГБ VRAM через vLLM модель Laguna-S-2.1 уже показала 109 токенов в секунду в агентных задачах кодирования, обойдя Qwen3.5-122B по скорости и глубине цепочек инструментов. Это подтверждает, что архитектура эффективно масштабируется на разном железе.
Пошаговый запуск: от установки до первого запроса
Для запуска на Apple Silicon потребуется окружение с mlx-lm и transformers. Установка зависимостей стандартна:
pip install mlx mlx-lm transformersЗагрузка модели идёт напрямую с Hugging Face. Загрузчик должен учитывать модульную разрядность - стандартные инструменты, не поддерживающие per-module bits, работать не будут. OsaurusAI предоставляет кастомный рантайм:
python -m jang_tools.laguna.runtimeChat-протокол включает thinking mode, включённый по умолчанию. Модель использует eos_token_id = [2, 24], где 24 - это end-of-turn токен. Он обязательно должен быть в стоп-сете, иначе модель не будет корректно завершать ответы.
Перед первым запуском настройте лимит wired memory. Без этого шага скорость будет вдвое ниже заявленной. Точное значение зависит от вашей конфигурации, но ориентир - 118 ГБ для системы со 128 ГБ ОЗУ.
Качество модели: бенчмарки и сравнение с конкурентами
Исходная BF16-версия Laguna-S-2.1 конкурентоспособна с более крупными frontier MoE-моделями. На Terminal-Bench 2.1 модель набирает 70.2%, на SWE-bench Multilingual - 78.5%, на SWE-Bench Pro - 59.4%. Эти цифры ставят её в один ряд с DeepSeek V4 Flash при меньшей стоимости инференса.
В практических тестах на 160 задачах с тремя прогонами каждая Laguna-S-2.1 показала нулевое количество JSON-ошибок и глубину цепочек инструментов до 6 уровней - лучший результат в сравнении с Qwen3.5-122B. Однако модель уступила в привязке к фактам: 0.80 против 0.97 у Qwen. Зафиксированы три подтверждённых случая генерации несуществующих данных - модель придумывала финансовые показатели для отсутствующих рынков и указывала вымышленных лошадей с искажением позиций в задаче на спортивную аналитику.
Квантование JANG_4M может незначительно отличаться по качеству от BF16. Точных цифр деградации производитель не публикует, но дифференцированная схема с сохранением высокого разрешения в attention и роутере минимизирует потери. Для агентного кодирования с ручной проверкой результатов этого достаточно. Для полностью автономных агентов, где критична абсолютная точность, Qwen остаётся более надёжным выбором.
Подробное сравнение Laguna-S-2.1 с DeepSeek V4 Flash и V4 Pro по реальным бенчмаркам доступно в отдельном материале, где разобраны метрики скорости, точности и галлюцинаций на RTX Pro 6000.
Практические сценарии использования Laguna-S-2.1
Модель ориентирована на агентное кодирование: работа с длинными код-базами, генерация и рефакторинг кода, создание документации, анализ логов. Контекст в 1 миллион токенов позволяет скормить модели целый репозиторий среднего размера и получать осмысленные ответы с учётом всех зависимостей.
Скорость в 33-44 токенов в секунду на M5 Max комфортна для интерактивной работы. Модель не заставляет ждать по несколько секунд на каждую строку кода. Глубина цепочек инструментов в 6 уровней означает, что модель способна последовательно вызывать компилятор, линтер, тестовый фреймворк и анализировать результаты на каждом шаге.
Ограничения: модель текстовая, без поддержки vision, audio и video. Для задач, требующих анализа скриншотов интерфейсов или диаграмм, потребуются мультимодальные решения. Лицензия poolside накладывает ограничения, которые стоит изучить перед коммерческим использованием.
API и облачные решения: быстрый старт без своего железа
Если локальный запуск не подходит, Pi предоставляет API для Laguna S 2.1 Free с посекундной тарификацией. Эндпоинт совместим с OpenAI-протоколом, что упрощает интеграцию в существующие пайплайны. Цены указаны за миллион токенов, и для эпизодического использования это дешевле, чем держать выделенный сервер.
Выбор между локальным и облачным инференсом сводится к профилю нагрузки. При постоянной работе локальный запуск на M5 Max окупается за счёт отсутствия переменных затрат. При пиковых нагрузках API даёт гибкость масштабирования без капитальных вложений в железо. Гибридный подход - локальная модель для повседневных задач и API для пиков - часто оптимален для небольших команд.
Ограничения и подводные камни
Первое: настройка wired memory на Apple Silicon обязательна. Без неё пропускная способность памяти падает вдвое, и заявленные 33-44 токенов в секунду превращаются в 15-20. Это не баг модели, а особенность архитектуры унифицированной памяти, но факт остаётся фактом: из коробки без тюнинга производительность будет ниже ожидаемой.
Второе: модель склонна к галлюцинациям под давлением. Три подтверждённых случая выдумки данных в тестах - это немного на 480 прогонов, но достаточно, чтобы исключить полностью автономное использование без валидации результатов. Для кодинга с ручной проверкой проблема некритична, для автоматических пайплайнов - требует дополнительного уровня верификации.
Третье: кастомный форк llama.cpp для GGUF-версии означает зависимость от поддержки сообщества. Стандартный llama.cpp может не поддерживать модульную разрядность квантования, и обновления основного репозитория не гарантируют совместимость. Аналогичная ситуация с оптимизацией инференса DeepSeek-V4-Flash на B300, где стандартные конфигурации vLLM не давали ожидаемой производительности без тонкой настройки.
Четвёртое: отсутствие мультимодальности ограничивает сценарии использования. Для задач, где нужен анализ изображений или аудио, потребуются другие модели. В экосистеме AI-MANUAL есть обзоры альтернатив, включая 1-битные модели Bonsai для edge-развёртывания и компактные решения Granite 4.0 Nano от IBM - выбор зависит от конкретной задачи.
Пятое: лицензия poolside. Перед коммерческим использованием изучите условия: они могут отличаться от привычных open-source лицензий и накладывать ограничения на сферы применения или объёмы.
Laguna-S-2.1 - это работающий инструмент для агентного кодирования с длинным контекстом, который можно запустить на потребительском железе. Модель не идеальна: галлюцинации, требования к тюнингу памяти, текст-онли ограничения. Но для разработчика, который готов проверять результаты и хочет получить 120B-качество без аренды облачных GPU, это один из самых практичных вариантов на середину 2026 года.