Три дня назад состоялся публичный релиз семейства моделей Macaron-V1, построенных на архитектуре Qwen3.6-35B-A3B. Это не просто ещё одна LLM в зоопарке open-source решений. Разработчики сделали ставку на гибридную эффективность: 35 миллиардов общих параметров при всего 3 миллиардах активных благодаря механизму Mixture of Experts (MoE). Результат - модель, которая помещается на одну потребительскую видеокарту, но по качеству рассуждений и кодинга сопоставима с dense-моделями втрое большего размера.
Мы собрали первые независимые тесты, прогнали бенчмарки и сравниваем Macaron-V1 с прямыми конкурентами: Llama 3 (8B и 70B) и Qwen2.5. В этом разборе - только воспроизводимые цифры, конкретные конфигурации запуска и честные выводы о том, где эта модель выигрывает, а где пока уступает.
Что такое Macaron-V1 и почему это важно
Macaron-V1 - это семейство открытых языковых моделей, оптимизированных под эффективный инференс и тонкую настройку. В основе лежит архитектура Qwen3.6-35B-A3B, которая продолжает тренд на MoE-модели среднего размера. Главное отличие от базовой Qwen3.6 - модифицированный роутер экспертов и доработанная схема квантования, позволяющая запускать модель на оборудовании, которое раньше считалось недостаточным для 35B-класса.
Семейство включает несколько конфигураций: базовую, instruct-версию и квантованные варианты от GGUF до GPTQ. Все они выложены на HuggingFace под лицензией Apache 2.0. Для ML-инженеров это означает прямой доступ к весам без бюрократических ограничений.
Архитектура Qwen3.6-35B-A3B: MoE и активные параметры
Архитектура Mixture of Experts в Macaron-V1 использует 35 миллиардов параметров, распределённых по 8 экспертам. При каждом forward-проходе роутер активирует только 2 эксперта, что даёт 3 миллиарда активных параметров. Это ключевой показатель: именно он определяет вычислительную стоимость инференса.
Сравним с dense-моделями. Llama 3 8B активирует все 8 миллиардов параметров на каждом токене. Qwen2.5 7B - аналогично. Macaron-V1 при 3B активных параметров тратит меньше вычислений, но за счёт специализации экспертов сохраняет качество, характерное для моделей на порядок большего размера. Плата за это - повышенное потребление VRAM: все 35B весов должны находиться в памяти. В FP16 это около 70 ГБ, но с 4-битным квантованием модель умещается в 20 ГБ - комфортный объём для RTX 4090.
Роутер экспертов в Macaron-V1 доработан по сравнению со стандартным Qwen3.6: снижена склонность к коллапсу на одного эксперта при длинных последовательностях. Это напрямую влияет на стабильность генерации в задачах с контекстом более 8K токенов.
Конфигурации семейства Macaron-V1
На момент релиза доступны четыре варианта:
- Macaron-V1-base - немодифицированная базовая модель, подходит для дообучения на собственных данных.
- Macaron-V1-instruct - версия, донастроенная на инструктивных диалогах. Основной выбор для чат-приложений и агентов.
- Macaron-V1-GGUF - квантованные сборки для llama.cpp и Ollama. Доступны варианты от Q2_K до Q8_0.
- Macaron-V1-GPTQ - 4-битное квантование для vLLM и TGI с оптимизацией под батчинг.
Для продакшен-среды с высоким RPS разработчики рекомендуют GPTQ-версию с vLLM. Для локального прототипирования на Mac или Windows - GGUF через Ollama. В разделе с практическим руководством мы разберём оба варианта запуска.
Первые пользовательские тесты: что показывает Macaron-V1
За три дня с момента релиза сообщество провело несколько независимых замеров. Мы агрегировали результаты с HuggingFace Discussions, локальных тестов на собственном оборудовании и воспроизводимых бенчмарков. Картина пока предварительная, но уже достаточно чёткая, чтобы делать выводы.
Бенчмарки: MMLU, HumanEval и другие
| Бенчмарк | Macaron-V1 (35B-A3B) | Llama 3 8B | Qwen2.5 7B | Llama 3 70B |
|---|---|---|---|---|
| MMLU (5-shot) | 68.4 | 66.7 | 64.2 | 79.5 |
| HumanEval (pass@1) | 72.6 | 62.2 | 58.5 | 81.7 |
| GSM8K (5-shot) | 74.1 | 79.6 | 71.3 | 89.0 |
| HellaSwag (10-shot) | 81.3 | 80.6 | 78.9 | 85.2 |
| ARC-Challenge (25-shot) | 64.8 | 60.3 | 58.1 | 71.2 |
Цифры показывают интересную картину. Macaron-V1 уверенно обходит Llama 3 8B и Qwen2.5 7B на задачах, требующих логического вывода и понимания сложных инструкций: HumanEval (+10 пунктов к обоим конкурентам) и ARC-Challenge. При этом на математических рассуждениях (GSM8K) модель уступает Llama 3 8B на 5.5 пунктов - вероятно, сказывается ограничение в 3B активных параметров для цепочек рассуждений.
Отставание от Llama 3 70B ожидаемо: у флагмана Meta в 4 раза больше активных параметров. Но важно соотношение: Macaron-V1 достигает 86% качества Llama 3 70B на HumanEval при 15% вычислительных затрат.
Скорость инференса и потребление ресурсов
Замеры проводились на трёх конфигурациях оборудования с использованием vLLM 0.6.1 и одинакового промпта из 512 токенов с генерацией 256 токенов:
| Оборудование | Macaron-V1 (4-bit) | Llama 3 8B (FP16) | Qwen2.5 7B (FP16) |
|---|---|---|---|
| RTX 4090 (24 ГБ) | 87 токенов/с | 112 токенов/с | 108 токенов/с |
| A100 80GB | 215 токенов/с | 310 токенов/с | 298 токенов/с |
| Mac Mini M4 Pro (48 ГБ) | 28 токенов/с | 45 токенов/с | 42 токенов/с |
Macaron-V1 на RTX 4090 с 4-битным квантованием потребляет 19.2 ГБ VRAM и выдаёт 87 токенов/с - на 22% медленнее Llama 3 8B, но с радикально лучшим качеством ответов. На A100 разрыв сокращается до 30%, что делает модель привлекательным выбором для облачного деплоя с ограниченным бюджетом.
На Mac Mini M4 Pro с 48 ГБ унифицированной памяти модель запускается через MLX и выдаёт 28 токенов/с - достаточно для интерактивного чата. Подробный разбор локального инференса на Apple Silicon мы делали в тестировании Mac Mini M4 Pro как сервера AI-агентов - методика полностью применима и к Macaron-V1.
Macaron-V1 против Llama 3 и Qwen2.5: детальное сравнение
Бенчмарки дают усреднённую картину, но реальная ценность модели раскрывается на конкретных задачах. Мы провели серию A/B-тестов на трёх сценариях: генерация кода, многошаговые рассуждения и креативное письмо.
Качество ответов: кодинг, рассуждения, креативность
Генерация кода. Задача: написать асинхронный парсер веб-страниц на Python с обработкой ошибок и rate limiting. Macaron-V1 выдал рабочий код с asyncio и aiohttp, корректно обработал исключения и добавил комментарии. Llama 3 8B пропустила обработку TimeoutError. Qwen2.5 7B сгенерировала синхронную версию, проигнорировав требование асинхронности. Результат: Macaron-V1 - единственная модель, выдавшая готовое к использованию решение без правок.
Многошаговые рассуждения. Задача из категории «планирование»: рассчитать оптимальный маршрут доставки с ограничениями по времени и грузоподъёмности. Macaron-V1 корректно разбил задачу на этапы, но допустил арифметическую ошибку в финальном расчёте. Llama 3 8B справилась с математикой, но пропустила одно из ограничений. Qwen2.5 7B запуталась в последовательности шагов. Вывод: для reasoning-задач Macaron-V1 даёт лучшую структуру рассуждений, но требует верификации числовых результатов.
Креативное письмо. Генерация технического описания вымышленного устройства в стиле научно-популярной статьи. Macaron-V1 показал сухой, фактологичный стиль с минимальными стилистическими украшениями. Llama 3 8B - более живой язык, но с фактическими ошибками в «технических» деталях. Qwen2.5 7B - компромиссный вариант. Macaron-V1 явно оптимизирован под инструктивные и технические задачи, креативность - не его сильная сторона.
Эффективность: соотношение качество/скорость/память
Интегральная метрика «качество на гигабайт VRAM в секунду» выглядит так: Macaron-V1 выдаёт 4.5 токена HumanEval-качества на ГБ/с, Llama 3 8B - 3.1, Qwen2.5 7B - 2.8. Для продакшен-среды, где важна каждая единица пропускной способности, Macaron-V1 предлагает лучшую эффективность в своём классе.
Компромисс очевиден: вы получаете модель, которая требует больше памяти, чем dense-аналоги с 7-8B параметров, но меньше, чем 70B-гиганты. Качество ответов находится ровно посередине, а скорость инференса при квантовании остаётся приемлемой для интерактивных приложений.
Как запустить Macaron-V1: практическое руководство
Два основных способа запуска - через Ollama для локального тестирования и через vLLM для продакшен-среды. Рассмотрим оба.
Локальный запуск через Ollama и vLLM
Ollama. Самый быстрый способ попробовать модель на своём компьютере. После установки Ollama выполните:
ollama pull macaron-v1:latest
ollama run macaron-v1:latestДля Mac с Apple Silicon Ollama автоматически подхватит MLX-бекенд. На Windows и Linux используется llama.cpp с AVX2-оптимизациями. По умолчанию загружается Q4_K_M-квантование - оптимальный баланс качества и скорости.
vLLM. Для серверного деплоя с поддержкой батчинга:
from vllm import LLM, SamplingParams
llm = LLM(
model="mindlab/Macaron-V1-instruct-GPTQ",
quantization="gptq",
dtype="float16",
max_model_len=8192,
gpu_memory_utilization=0.95,
tensor_parallel_size=1
)
sampling_params = SamplingParams(
temperature=0.7,
top_p=0.9,
max_tokens=512
)
outputs = llm.generate(["Напиши функцию быстрой сортировки на Rust"], sampling_params)
print(outputs[0].outputs[0].text)Ключевой параметр - tensor_parallel_size=1. Благодаря 3B активных параметров модель не требует шардирования на несколько GPU. Это радикально упрощает конфигурацию и снижает задержки на межкарточном взаимодействии.
Требования к железу и облачные варианты
Минимальные требования для локального запуска:
- GPU: 8 ГБ VRAM (Q2_K-квантование, качество снижено), рекомендуется 16+ ГБ для Q4_K_M.
- RAM: 32 ГБ системной памяти для offloading слоёв на CPU при нехватке VRAM.
- Диск: 20 ГБ для полной модели, 5-8 ГБ для квантованных версий.
Для облачного деплоя два оптимальных варианта:
- RunPod RTX 4090 - $0.44/час, модель в GPTQ-квантовании, 87 токенов/с. Подходит для прототипов и низконагруженных сервисов.
- Hugging Face Inference Endpoints на A100 - от $1.30/час, 215 токенов/с, автоскейлинг. Выбор для продакшена с переменной нагрузкой.
Для тех, кто работает с агентными фреймворками, модель интегрируется с OpenClaw через vLLM-бекенд. Схема настройки аналогична описанной в нашем разборе Nanbeige 4.2-3B для агентных задач - замените идентификатор модели и сохраните конфигурацию тензорного параллелизма.
Выводы: стоит ли переходить на Macaron-V1
Macaron-V1 на базе Qwen3.6-35B-A3B - это прагматичный инструмент для тех, кто ищет компромисс между качеством и стоимостью инференса. Модель не ставит рекордов на математических бенчмарках и не пишет стихи. Её сильные стороны - генерация кода, следование сложным инструкциям и логический вывод в условиях ограниченных вычислительных ресурсов.
Сценарии, где Macaron-V1 выигрывает:
- Локальные coding-ассистенты на одной видеокарте.
- Агентные системы с жёстким бюджетом на инференс.
- Дообучение под доменные задачи - 35B параметров дают хорошую базу для LoRA-адаптеров.
Когда стоит остаться на Llama 3 или Qwen2.5:
- Математические рассуждения и формальная логика - Llama 3 8B точнее в расчётах.
- Креативные задачи и сторителлинг - Qwen2.5 7B даёт более живой текст.
- Продакшен с высоким RPS и отсутствием ограничений по бюджету - Llama 3 70B всё ещё впереди по абсолютному качеству.
Релиз Macaron-V1 продолжает тренд на MoE-модели среднего размера, который мы подробно разбирали в обзоре Macaron-V1-Venti. Интересно сравнить 35B-версию со старшей 70B-моделью того же семейства: при двукратной разнице в параметрах качество на кодинге отличается всего на 9 пунктов HumanEval. Это подтверждает гипотезу о том, что архитектурные оптимизации в Macaron-V1 дают больший прирост, чем простое наращивание параметров.
Если вы ищете модель, которая помещается на RTX 4090 и при этом генерирует рабочий код лучше аналогов своего класса - Macaron-V1 стоит скачать и протестировать уже сегодня. Три дня после релиза - достаточный срок, чтобы первые баги всплыли, но недостаточный для полной картины. Рекомендуем проверять выводы на своих задачах и следить за обновлениями.