Короткий вывод: кому подходит Mac mini M4 Pro
- Для кого: Mac mini M4 Pro с 48 ГБ подходит для локального AI-сервера, агентных задач, работы с файлами, поиска и выполнения кода через связку OpenClaw + LM Studio.
- Какие модели выбирать: в этом тесте лучше показали себя MoE-модели qwen3.6-35b-a3b и gemma-4-26b-a4b-qat с 3-4B активных параметров.
- Какие модели не выбирать для интерактивных агентов: плотная gemma-4-31b выдавала 15-18 токенов/с против 50-59 токенов/с у протестированных MoE-моделей.
- Минимум памяти: 48 ГБ дают запас для контекста 8192 токенов и нескольких конфигураций. 24 ГБ достаточно для одной MoE-модели с контекстом 4096, но без большого запаса.
Введение: зачем тестировать Mac mini M4 Pro как AI-сервер?
Облачные AI-сервисы решают много задач, но создают три проблемы: регулярные платежи, риск передачи конфиденциальных данных и зависимость от интернета. Поэтому часть пользователей переносит инференс на собственное железо. Mac mini M4 Pro с 48 ГБ унифицированной памяти интересен как компактный и энергоэффективный сервер AI-агентов, которому не нужна отдельная GPU-ферма.
В статье показано, как развернуть OpenClaw, подключить LM Studio и сравнить три модели среднего размера на одном стенде. Основной вопрос теста: подходит ли Mac mini для AI-агентов при локальном запуске LLM и выборе моделей с учётом их архитектуры.
Методология тестирования: что и как мы измеряли
Мы фиксировали три сценария: пинг (задержка до первого ответа), генерация сводки новостей (реалистичная агентная задача) и синтетический бенчмарк (непрерывная генерация длинного текста). Каждый тест повторялся пять раз, результаты усреднялись. Измеряли токенов/с, время до первого токена (TTFT) и энергопотребление под нагрузкой.
Конфигурация оборудования и ПО
Тестовый стенд:
- Mac mini M4 Pro, чип Apple M4 Pro с 12 ядрами CPU (8 производительных, 4 эффективных) и 16 ядрами GPU.
- 48 ГБ унифицированной памяти LPDDR5x с пропускной способностью 273 ГБ/с.
- macOS Sequoia 15.4, LM Studio 0.3.8, OpenClaw из репозитория main.
- Все модели загружены в формате GGUF с квантованием Q4_K_M, размер контекста 8192 токена.
- Слои модели полностью выгружены на GPU, бэкенд Metal.
Энергопотребление замерялось через встроенный датчик системы (powermetrics) с интервалом 1 секунда; фиксировалось среднее за период активного инференса. Шум и нагрев оценивались субъективно: кулер оставался в зоне слышимости только при длительной нагрузке на плотную модель.
Ограничения теста
Результаты относятся к одной машине, одной версии macOS, LM Studio и OpenClaw, квантованию Q4_K_M, контексту 8192 токенов и указанным сценариям. Они не заменяют тестирование на других конфигурациях памяти, версиях ПО, размерах контекста и моделях. Оценка шума субъективна, а энергопотребление зависит от режима работы системы и длительности нагрузки.
Тестируемые модели: MoE против плотных архитектур
Выбор моделей отражает два принципиально разных подхода к архитектуре:
- qwen3.6-35b-a3b - Mixture of Experts, 35B общих параметров, 3B активных на токен. 128 экспертов, активируются 8.
- gemma-4-26b-a4b-qat - MoE, 26B общих, 4B активных. Архитектура с квантованием-aware training, что даёт дополнительную оптимизацию при сжатии.
- gemma-4-31b - плотная архитектура, все 31B параметров активны на каждом токене.
MoE активирует только часть параметров на каждом токене и тем самым снижает вычислительную нагрузку. Плотная модель обрабатывает все параметры, поэтому на Mac mini разница определяется прежде всего вычислительной нагрузкой, а не только объёмом памяти.
Установка и настройка OpenClaw на Mac mini
OpenClaw - это фреймворк для создания AI-агентов с поддержкой локальных LLM. Он подключается к LM Studio как к OpenAI-совместимому серверу и добавляет инструменты: поиск в интернете, работу с файлами, выполнение кода. Ниже пошаговая инструкция, которая позволит воспроизвести стенд за 15-20 минут.
Шаг 1: Установка LM Studio и загрузка моделей
Скачайте LM Studio с официального сайта (lmstudio.ai), установите и запустите. Интерфейс позволяет искать модели прямо из приложения: в строке поиска введите название модели, выберите вариант с квантованием Q4_K_M в формате GGUF. Для статьи использовались:
- qwen3.6-35b-a3b (автор: bartowski, файл qwen3.6-35b-a3b-Q4_K_M.gguf)
- gemma-4-26b-a4b-qat (автор: lmstudio-community, файл gemma-4-26b-a4b-qat-Q4_K_M.gguf)
- gemma-4-31b (автор: bartowski, файл gemma-4-31b-Q4_K_M.gguf)
После загрузки перейдите на вкладку Server, выберите модель, установите порт 1234, активируйте опцию «Serve on Local Network» только если агент будет на другой машине. В настройках модели (вкладка Model Config) установите контекст 8192 и убедитесь, что GPU Offload переключён на «Max». Запустите сервер кнопкой Start Server. Проверьте работоспособность через браузер: http://localhost:1234/v1/models должен вернуть JSON со списком загруженных моделей.
Шаг 2: Установка и конфигурация OpenClaw
Клонируйте репозиторий и установите зависимости:
git clone https://github.com/openclaw/openclaw.git
cd openclaw
pip install -r requirements.txt
Создайте конфигурационный файл agent.yaml в корне проекта:
llm:
provider: openai
model: qwen3.6-35b-a3b
api_base: http://localhost:1234/v1
api_key: not-needed
temperature: 0.7
max_tokens: 2048
tools:
- search
- file_reader
- python_executor
system_prompt: "Ты - AI-агент на локальном сервере. Отвечай на русском языке, используй инструменты для поиска актуальной информации."
Параметр api_key обязателен для совместимости с OpenAI API, но LM Studio игнорирует его. Запустите агента:
python openclaw.py --config agent.yaml
Если агент не видит сервер, проверьте, что LM Studio запущена на порту 1234 и модель загружена. При ошибках памяти уменьшите размер контекста до 4096 или используйте квантование Q3_K_M. Для смены модели достаточно изменить параметр model в конфиге и перезапустить сервер LM Studio.
Результаты тестирования: сколько токенов/с даёт Mac mini
Пинг - запрос «Ответь OK, текущее время и дата», оценивает чистую задержку без сложной обработки. Сводка новостей - промпт «Сгенерируй сводку из 5 новостей об AI за сегодня», длина вывода 300-400 токенов. Синтетический бенчмарк - генерация текста на 1000 токенов по заданной теме, замер непрерывной скорости.
Скорость генерации: токенов в секунду на разных задачах
| Модель | Пинг (токенов/с) | Сводка новостей (токенов/с) | Синтетический бенчмарк (токенов/с) |
|---|---|---|---|
| qwen3.6-35b-a3b (MoE, 3B активных) | 59 | 55 | 58 |
| gemma-4-26b-a4b-qat (MoE, 4B активных) | 53 | 50 | 52 |
| gemma-4-31b (плотная, 31B активных) | 18 | 15 | 17 |
В этом стенде MoE-модели держат 50-59 токенов/с, а плотная gemma-4-31b - 15-18 токенов/с. Разрыв примерно в 3,3 раза соответствует разнице между 3-4B активных параметров и 31B. На сводке новостей скорость немного ниже из-за более сложного промпта и структурированного вывода.
Время до первого токена (TTFT) и отзывчивость
| Модель | TTFT, пинг (мс) | TTFT, сводка новостей (мс) |
|---|---|---|
| qwen3.6-35b-a3b | 210 | 380 |
| gemma-4-26b-a4b-qat | 240 | 410 |
| gemma-4-31b | 520 | 890 |
MoE-модели стартуют за 210-410 мс, тогда как плотной модели требуется до 890 мс на сводке новостей. В данном тесте это связано с тем, что плотная архитектура обрабатывает промпт через все 31B параметров, а MoE - только через активную часть экспертов.
Энергопотребление: насколько экономичен Mac mini как AI-сервер
| Режим | Энергопотребление (Вт) |
|---|---|
| Простой (без инференса) | 8 |
| qwen3.6-35b-a3b, активный инференс | 42 |
| gemma-4-26b-a4b-qat, активный инференс | 45 |
| gemma-4-31b, активный инференс | 58 |
Mac mini в простое потребляет 8 Вт. Под нагрузкой MoE-моделей энергопотребление поднимается до 42-45 Вт, плотная модель - до 58 Вт. Для сравнения: десктопный ПК с RTX 4090 потребляет 150-250 Вт только на GPU во время инференса. При сохранении такой нагрузки за сутки работа агента на qwen3.6-35b-a3b составит около 1 кВт·ч; итоговая стоимость зависит от тарифа.
Анализ: почему MoE-модели выигрывают на Mac mini
Причина разницы в скорости
48 ГБ на M4 Pro работают иначе, чем связка 32 ГБ RAM + 16 ГБ VRAM в ПК. Унифицированная память исключает копирование данных между CPU и GPU: модель загружается один раз и доступна обоим типам ядер. Пропускная способность 273 ГБ/с помогает подгружать активных экспертов MoE, но не компенсирует нехватку вычислительных ядер для плотных архитектур.
Плотная gemma-4-31b требует полного прохода через все слои на каждом токене. В этом тесте GPU держался на 100%, а пропускная способность памяти использовалась на 60-70%. У MoE-моделей загрузка GPU колебалась от 70% до 95%, память была загружена на 80-90%. Это указывает на то, что для сравниваемых моделей узким местом становится вычислительная мощность GPU, а не объём unified memory.
Практическое следствие: какую модель выбрать
Если приоритетом являются интерактивные AI-агенты, tool calls и несколько последовательных запросов, в рамках этого стенда рациональнее начинать с MoE-моделей с 3-4B активных параметров. Плотная модель может быть оправдана, когда важнее конкретное качество ответа или совместимость с определённым workflow, но её скорость и TTFT нужно проверять отдельно.
Практические рекомендации: хватает ли 48 ГБ и какую конфигурацию выбрать
- Агентные задачи: Mac mini M4 Pro с 48 ГБ и MoE-моделью в Q4_K_M подходит для поиска, работы с файлами и выполнения кода через OpenClaw. В тесте qwen3.6-35b-a3b показала 50-59 токенов/с и TTFT 210-380 мс.
- Одиночная модель: 24 ГБ достаточно для одной MoE-модели с контекстом 4096, если не требуется большой запас памяти. 48 ГБ удобнее для контекста 8192 и более тяжёлых конфигураций.
- Несколько сессий: 48 ГБ дают больше пространства для моделей и KV-кэша, но одновременная работа нескольких агентов увеличит нагрузку. Такой сценарий нужно проверять отдельно, поскольку он не входил в приведённые замеры.
- Большие контексты: 8192 токенов использовались в тесте. Увеличение до 16384 может снизить скорость из-за роста объёма KV-кэша, поэтому для конкретного workflow нужны отдельные замеры.
- Квантование: Q4_K_M в этом тесте является базовым балансом между качеством и скоростью. Q3_K_M стоит рассматривать при ограничении памяти, а Q5_K_M - только после проверки, что дополнительное качество оправдывает возможное снижение скорости.
Для одновременного запуска нескольких агентов, моделей с 70B+ параметров и больших контекстов стоит смотреть на Mac Studio с M4 Max или M4 Ultra. У этих конфигураций выше пропускная способность памяти и больше GPU-ядер, но выводы по ним нельзя напрямую переносить из теста Mac mini.
Заключение: Mac mini M4 Pro как локальный AI-сервер
Mac mini M4 Pro с 48 ГБ унифицированной памяти справляется с ролью локального сервера AI-агентов при правильном выборе модели. В приведённых условиях MoE-модели qwen3.6-35b-a3b и gemma-4-26b-a4b-qat выдают 50-59 токенов/с с TTFT 210-410 мс и потребляют 42-45 Вт под нагрузкой. Плотная gemma-4-31b показала 15-18 токенов/с и более высокий TTFT, поэтому для интерактивного агентного сценария выглядит менее практичным вариантом.
Связка LM Studio + OpenClaw настраивается по приведённой схеме и предоставляет локальному агенту поиск, работу с файлами и выполнение кода. Воспроизводимость результатов ограничена совпадением стенда: Mac mini M4 Pro с 48 ГБ, macOS Sequoia 15.4, LM Studio 0.3.8, OpenClaw из main, GGUF Q4_K_M и контекст 8192.
Для дополнительного сравнения можно обратиться к прямому сравнению Gemma-4-26B-a4B и Qwen3.6-MoE, обзору компактных моделей для локального запуска и материалу по гибридным AI-агентам. Разбор AntLing-3.0-flash - гибридной MoE-модели для продакшен-агентов - также помогает оценить альтернативы в сегменте средних MoE-моделей.