Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Nanbeige 4.2-3B: Обзор архитектуры Looped Transformer и бенчмарков на агентных задачах

Nanbeige 4.2-3B с архитектурой Looped Transformer обходит Qwen3.5-9B и Gemma4-12B в агентных тестах SWE-Bench при всего 3B параметрах. Разбираем результаты 63.6

Коротко

Что будет в материале

  1. 01

    Что такое Nanbeige 4.2-3B и почему о ней говорят

  2. 02

    Архитектура Looped Transformer: как глубина растет без параметров

  3. 03

    Бенчмарки SWE-Bench: разбор результатов Nanbeige 4.2-3B

  4. 04

    Методика тестирования: OpenClaw и Lyzr Control Plane

Что такое Nanbeige 4.2-3B и почему о ней говорят

Nanbeige 4.2-3B - компактная языковая модель с 3 миллиардами неэмбеддинговых параметров. Её ключевая особенность - архитектура Looped Transformer, которая позволяет многократно переиспользовать одни и те же слои для увеличения эффективной глубины сети без роста числа параметров. На практике это означает, что модель размером с телефон способна конкурировать с решениями, занимающими в 3-4 раза больше памяти.

Заявленные результаты впечатляют: 63.6 на SWE-Bench Verified и 46.9 на SWE-Bench Pro. Для сравнения, Qwen3.5-9B и Gemma4-12B - модели с 9 и 12 миллиардами параметров - показывают результаты ниже в этих же тестах. Трёхмиллиардная модель обходит двенадцатимиллиардную. Это не магия, а архитектурное решение, которое меняет правила игры для локального развёртывания агентных систем.

Интерес сообщества подогревает и методика тестирования: замеры проводились в среде OpenClaw под управлением Lyzr Control Plane. Результаты при этом расходятся с официальными данными Qwen, что требует осторожной интерпретации. Разберём архитектуру, цифры и ограничения без воды.

Архитектура Looped Transformer: как глубина растет без параметров

Looped Transformer решает фундаментальную проблему: глубина сети напрямую влияет на способность модели к рассуждению, но каждый новый слой добавляет параметры и увеличивает потребление памяти. Разработчики Nanbeige применили подход, при котором блоки трансформера выполняются не один раз, а циклически - выход одного прохода становится входом для следующего, и так несколько итераций.

Принцип работы Looped Transformer

В классическом трансформере каждый слой имеет собственные веса. В Looped Transformer один и тот же блок слоёв (или группа блоков) применяется к скрытому состоянию несколько раз подряд. Количество итераций - loop count - становится гиперпараметром, который можно настраивать под задачу. На этапе обучения модель учится выдавать полезные представления на каждом проходе, а на инференсе можно динамически увеличивать глубину обработки для сложных запросов.

Механизм напоминает развёртывание рекуррентной сети во времени, но с сохранением преимуществ self-attention: каждый проход видит полный контекст. Градиенты при обучении текут через все итерации, что требует аккуратной настройки оптимизатора и нормализации, но итоговая модель остаётся компактной - веса не дублируются.

Сравнение с традиционными архитектурами

Прямое сравнение характеристик даёт чёткую картину преимуществ:

Модель Параметры Эффективная глубина VRAM (FP16)
Nanbeige 4.2-3B 3B ~48 слоёв (при loop=4) ~6 ГБ
Qwen3.5-9B 9B ~36 слоёв ~18 ГБ
Gemma4-12B 12B ~48 слоёв ~24 ГБ

При 3B параметров Nanbeige требует втрое меньше памяти, чем Qwen3.5-9B, и вчетверо меньше, чем Gemma4-12B. Эффективная глубина при этом сопоставима с 12B-моделью. Плата за компактность - увеличенное время инференса на токен: каждый дополнительный проход добавляет вычислительную нагрузку, но суммарно модель всё равно быстрее на устройствах с ограниченной VRAM, где большие модели просто не помещаются.

Ограничения подхода связаны с насыщением: после определённого числа итераций качество перестаёт расти, а в некоторых случаях деградирует. Разработчикам приходится искать баланс между loop count и размером блока.

Бенчмарки SWE-Bench: разбор результатов Nanbeige 4.2-3B

SWE-Bench - стандартный бенчмарк для оценки способности моделей решать реальные задачи по исправлению багов в программном коде. Модель получает описание проблемы и репозиторий, должна найти нужный файл и внести корректное исправление. Два варианта бенчмарка - Verified и Pro - различаются сложностью и объёмом кодовой базы.

SWE-Bench Verified: 63.6 - что стоит за цифрой

SWE-Bench Verified включает задачи, проверенные экспертами на корректность и однозначность. Результат 63.6 означает, что модель успешно решила почти две трети задач из набора. Для контекста: GPT-4o на этом бенчмарке показывает около 45%, Claude 3.5 Sonnet - порядка 50%. Модели с 7-9B параметров редко преодолевают планку в 30%.

Сильная сторона Nanbeige - точное следование инструкциям и способность удерживать контекст даже в больших файлах. Looped Transformer даёт здесь преимущество: повторные проходы через одни и те же слои позволяют модели «додумывать» решение, уточняя локализацию бага на каждой итерации.

SWE-Bench Pro: 46.9 и превосходство над более крупными моделями

SWE-Bench Pro сложнее: задачи требуют изменений в нескольких файлах, понимания архитектуры проекта и нетривиальных исправлений. Результат 46.9 ставит Nanbeige 4.2-3B выше Qwen3.5-9B (официальные данные Qwen для Pro отсутствуют, но оценки сообщества дают около 35-40%) и Gemma4-12B (примерно 38-42%).

Парадокс «меньшая модель решает сложнее» объясняется архитектурой. Традиционные модели распределяют знания по всем слоям - чем больше параметров, тем выше ёмкость. Looped Transformer концентрирует способность к рассуждению в небольшом наборе весов и усиливает её через итерации. На задачах, требующих логического вывода, а не запоминания, это даёт преимущество. Наш разбор архитектуры циклического переиспользования слоёв детально раскрывает этот механизм.

Методика тестирования: OpenClaw и Lyzr Control Plane

Результаты бенчмарков нельзя рассматривать в отрыве от среды, в которой они получены. Nanbeige 4.2-3B тестировалась в связке OpenClaw + Lyzr Control Plane - это полноценный агентный стек, а не просто вызов API модели.

Роль OpenClaw в агентном тестировании

OpenClaw - среда исполнения для агентных задач. Она предоставляет модели доступ к файловой системе, возможность запускать код, читать вывод компилятора и тестов. Модель не просто генерирует патч - она может проверить его работоспособность, увидеть ошибку и исправить. Это принципиально отличается от «слепой» генерации: агент получает обратную связь от среды и итеративно улучшает решение.

OpenClaw собирает метрики по каждому запуску: количество итераций до успеха, типы ошибок, время выполнения. Для Nanbeige среда особенно важна, потому что loop-архитектура естественно ложится на итеративный процесс: каждый проход модели может соответствовать одному циклу «генерация - проверка - исправление».

Lyzr Control Plane: управление пайплайнами

Lyzr Control Plane выступает оркестратором: управляет запуском OpenClaw, маршрутизирует задачи, кэширует промежуточные результаты и оптимизирует использование ресурсов. Платформа может автоматически подбирать loop count под сложность задачи, перезапускать упавшие агенты и агрегировать статистику.

Влияние на итоговые цифры существенное. Без Control Plane часть задач могла бы провалиться из-за таймаутов или неоптимальных настроек. С другой стороны, платформа не «подкручивает» ответы модели - она лишь обеспечивает стабильную среду. Результаты воспроизводимы при использовании того же стека, но на «голой» модели без агентной обвязки цифры будут ниже.

Расхождения с официальными данными: насколько можно доверять результатам

Прямое сравнение с Qwen3.5-9B выявило расхождения. Официальные бенчмарки Qwen для SWE-Bench Verified показывают около 42%, тогда как в тестах Nanbeige эта модель получила значительно более низкую оценку. Разница в 15-20 пунктов не объясняется случайностью.

Возможные причины расхождений:

  • Версии бенчмарка. SWE-Bench обновляется, и разные версии могут содержать разные задачи или критерии оценки.
  • Настройки инференса. Температура, top_p, максимальная длина вывода - эти параметры критичны для агентных задач. Разные команды используют разные конфигурации.
  • Среда исполнения. Qwen тестировалась в собственной среде, Nanbeige - в OpenClaw. Разница в доступных инструментах и обратной связи напрямую влияет на результат.
  • Промпт-инжиниринг. Формулировка инструкции для агента может изменить результат на десятки процентов. Разработчики Lyzr могли использовать оптимизированные промпты, которых нет в открытом доступе.

Рекомендация: относитесь к цифрам как к индикатору потенциала, а не как к абсолютной истине. Независимое тестирование на собственных задачах - единственный способ понять, подходит ли модель под конкретный сценарий. Сравнение реальных бенчмарков Laguna S 2.1 и DeepSeek V4 Flash показывает, насколько результаты могут отличаться от заявленных при смене условий тестирования.

Практические ограничения для локального развертывания

Запустить Nanbeige 4.2-3B на своём железе реально, но есть нюансы. Модель требует не только памяти под веса, но и среду для агентного исполнения.

Аппаратные требования и производительность инференса

В FP16 модель занимает около 6 ГБ VRAM. С квантованием до 4 бит - примерно 2.5 ГБ. Поддерживаются основные бэкенды: llama.cpp, vLLM, HuggingFace Transformers. На RTX 3060 12GB модель выдаёт 45-55 токенов/с при loop=4. Для сравнения, Qwen3.5-9B в FP16 на той же карте не запустится из-за нехватки памяти, а в 4-битном квантовании даёт 25-30 токенов/с.

На CPU с 32 ГБ RAM скорость падает до 5-8 токенов/с, но модель остаётся пригодной для пакетной обработки. Наш материал о тестировании экстремального сжатия в 8GB VRAM даёт ориентиры по производительности разных моделей в условиях ограниченной памяти.

Интеграция в агентные пайплайны

Модель сама по себе не является агентом. Для решения SWE-Bench задач требуется оркестратор (Lyzr Control Plane, LangChain, CrewAI или самописный скрипт) и среда исполнения кода (OpenClaw, E2B, Docker-контейнер). Минимальный пайплайн включает:

  1. Получение задачи и клонирование репозитория.
  2. Запуск модели для генерации патча.
  3. Применение патча и запуск тестов в изолированной среде.
  4. Передачу вывода тестов обратно модели для исправления ошибок.
  5. Повторение до успеха или исчерпания лимита итераций.

Loop-архитектура Nanbeige хорошо ложится на этот процесс: каждая итерация агента может соответствовать одному проходу модели. Но настройка такого пайплайна требует инженерных компетенций - это не plug-and-play решение. Для тех, кто рассматривает альтернативы, сравнение Gemma-4-26B-a4B и Qwen3.6-MoE даёт представление о других компактных моделях для локального развёртывания.

Выводы: стоит ли обратить внимание на Nanbeige 4.2-3B

Nanbeige 4.2-3B - технологически интересная модель с реальным преимуществом в энергоэффективности. 3B параметров, способные конкурировать с 9B и 12B аналогами на агентных задачах, открывают новые сценарии для локального развёртывания. Looped Transformer как архитектурный подход заслуживает пристального внимания: переиспользование слоёв без дублирования весов может стать стандартом для компактных моделей.

Слабые стороны: результаты получены в специфической среде (OpenClaw + Lyzr Control Plane) и расходятся с официальными данными конкурентов. Воспроизвести цифры 63.6/46.9 на своём стеке без тщательной настройки не получится. Модель требовательна к качеству агентной обвязки - «голая» генерация патчей даст более скромные показатели.

Практическая рекомендация: если вы строите агентный пайплайн и ограничены памятью GPU, Nanbeige 4.2-3B - один из сильнейших кандидатов на рынке. Для задач, не требующих агентного исполнения (чат, суммаризация, генерация текстов), преимущества loop-архитектуры менее выражены, и традиционные модели того же размера могут быть практичнее. Начните с тестов на своих задачах, используя открытые веса модели и стандартные бэкенды инференса. Осторожный оптимизм и собственные эксперименты - лучшая стратегия.

Подписаться на канал