Перейти к содержанию
Публикация AiManual

Mac mini M4 Pro как сервер AI-агентов: тестируем OpenClaw и локальный инференс LLM

Практический тест Mac mini M4 Pro с 48 ГБ памяти для локального запуска AI-агентов через OpenClaw и LM Studio. Сравниваем MoE и плотные LLM по скорости, TTFT и

Коротко

Что будет в материале

  1. 01

    Короткий вывод: кому подходит Mac mini M4 Pro

  2. 02

    Введение: зачем тестировать Mac mini M4 Pro как AI-сервер?

  3. 03

    Методология тестирования: что и как мы измеряли

  4. 04

    Установка и настройка OpenClaw на Mac mini

Короткий вывод: кому подходит Mac mini M4 Pro

  • Для кого: Mac mini M4 Pro с 48 ГБ подходит для локального AI-сервера, агентных задач, работы с файлами, поиска и выполнения кода через связку OpenClaw + LM Studio.
  • Какие модели выбирать: в этом тесте лучше показали себя MoE-модели qwen3.6-35b-a3b и gemma-4-26b-a4b-qat с 3-4B активных параметров.
  • Какие модели не выбирать для интерактивных агентов: плотная gemma-4-31b выдавала 15-18 токенов/с против 50-59 токенов/с у протестированных MoE-моделей.
  • Минимум памяти: 48 ГБ дают запас для контекста 8192 токенов и нескольких конфигураций. 24 ГБ достаточно для одной MoE-модели с контекстом 4096, но без большого запаса.

Введение: зачем тестировать Mac mini M4 Pro как AI-сервер?

Облачные AI-сервисы решают много задач, но создают три проблемы: регулярные платежи, риск передачи конфиденциальных данных и зависимость от интернета. Поэтому часть пользователей переносит инференс на собственное железо. Mac mini M4 Pro с 48 ГБ унифицированной памяти интересен как компактный и энергоэффективный сервер AI-агентов, которому не нужна отдельная GPU-ферма.

В статье показано, как развернуть OpenClaw, подключить LM Studio и сравнить три модели среднего размера на одном стенде. Основной вопрос теста: подходит ли Mac mini для AI-агентов при локальном запуске LLM и выборе моделей с учётом их архитектуры.

Методология тестирования: что и как мы измеряли

Мы фиксировали три сценария: пинг (задержка до первого ответа), генерация сводки новостей (реалистичная агентная задача) и синтетический бенчмарк (непрерывная генерация длинного текста). Каждый тест повторялся пять раз, результаты усреднялись. Измеряли токенов/с, время до первого токена (TTFT) и энергопотребление под нагрузкой.

Конфигурация оборудования и ПО

Тестовый стенд:

  • Mac mini M4 Pro, чип Apple M4 Pro с 12 ядрами CPU (8 производительных, 4 эффективных) и 16 ядрами GPU.
  • 48 ГБ унифицированной памяти LPDDR5x с пропускной способностью 273 ГБ/с.
  • macOS Sequoia 15.4, LM Studio 0.3.8, OpenClaw из репозитория main.
  • Все модели загружены в формате GGUF с квантованием Q4_K_M, размер контекста 8192 токена.
  • Слои модели полностью выгружены на GPU, бэкенд Metal.

Энергопотребление замерялось через встроенный датчик системы (powermetrics) с интервалом 1 секунда; фиксировалось среднее за период активного инференса. Шум и нагрев оценивались субъективно: кулер оставался в зоне слышимости только при длительной нагрузке на плотную модель.

Ограничения теста

Результаты относятся к одной машине, одной версии macOS, LM Studio и OpenClaw, квантованию Q4_K_M, контексту 8192 токенов и указанным сценариям. Они не заменяют тестирование на других конфигурациях памяти, версиях ПО, размерах контекста и моделях. Оценка шума субъективна, а энергопотребление зависит от режима работы системы и длительности нагрузки.

Тестируемые модели: MoE против плотных архитектур

Выбор моделей отражает два принципиально разных подхода к архитектуре:

  • qwen3.6-35b-a3b - Mixture of Experts, 35B общих параметров, 3B активных на токен. 128 экспертов, активируются 8.
  • gemma-4-26b-a4b-qat - MoE, 26B общих, 4B активных. Архитектура с квантованием-aware training, что даёт дополнительную оптимизацию при сжатии.
  • gemma-4-31b - плотная архитектура, все 31B параметров активны на каждом токене.

MoE активирует только часть параметров на каждом токене и тем самым снижает вычислительную нагрузку. Плотная модель обрабатывает все параметры, поэтому на Mac mini разница определяется прежде всего вычислительной нагрузкой, а не только объёмом памяти.

Установка и настройка OpenClaw на Mac mini

OpenClaw - это фреймворк для создания AI-агентов с поддержкой локальных LLM. Он подключается к LM Studio как к OpenAI-совместимому серверу и добавляет инструменты: поиск в интернете, работу с файлами, выполнение кода. Ниже пошаговая инструкция, которая позволит воспроизвести стенд за 15-20 минут.

Шаг 1: Установка LM Studio и загрузка моделей

Скачайте LM Studio с официального сайта (lmstudio.ai), установите и запустите. Интерфейс позволяет искать модели прямо из приложения: в строке поиска введите название модели, выберите вариант с квантованием Q4_K_M в формате GGUF. Для статьи использовались:

  • qwen3.6-35b-a3b (автор: bartowski, файл qwen3.6-35b-a3b-Q4_K_M.gguf)
  • gemma-4-26b-a4b-qat (автор: lmstudio-community, файл gemma-4-26b-a4b-qat-Q4_K_M.gguf)
  • gemma-4-31b (автор: bartowski, файл gemma-4-31b-Q4_K_M.gguf)

После загрузки перейдите на вкладку Server, выберите модель, установите порт 1234, активируйте опцию «Serve on Local Network» только если агент будет на другой машине. В настройках модели (вкладка Model Config) установите контекст 8192 и убедитесь, что GPU Offload переключён на «Max». Запустите сервер кнопкой Start Server. Проверьте работоспособность через браузер: http://localhost:1234/v1/models должен вернуть JSON со списком загруженных моделей.

Шаг 2: Установка и конфигурация OpenClaw

Клонируйте репозиторий и установите зависимости:

git clone https://github.com/openclaw/openclaw.git
cd openclaw
pip install -r requirements.txt

Создайте конфигурационный файл agent.yaml в корне проекта:

llm:
  provider: openai
  model: qwen3.6-35b-a3b
  api_base: http://localhost:1234/v1
  api_key: not-needed
  temperature: 0.7
  max_tokens: 2048

tools:
  - search
  - file_reader
  - python_executor

system_prompt: "Ты - AI-агент на локальном сервере. Отвечай на русском языке, используй инструменты для поиска актуальной информации."

Параметр api_key обязателен для совместимости с OpenAI API, но LM Studio игнорирует его. Запустите агента:

python openclaw.py --config agent.yaml

Если агент не видит сервер, проверьте, что LM Studio запущена на порту 1234 и модель загружена. При ошибках памяти уменьшите размер контекста до 4096 или используйте квантование Q3_K_M. Для смены модели достаточно изменить параметр model в конфиге и перезапустить сервер LM Studio.

Результаты тестирования: сколько токенов/с даёт Mac mini

Пинг - запрос «Ответь OK, текущее время и дата», оценивает чистую задержку без сложной обработки. Сводка новостей - промпт «Сгенерируй сводку из 5 новостей об AI за сегодня», длина вывода 300-400 токенов. Синтетический бенчмарк - генерация текста на 1000 токенов по заданной теме, замер непрерывной скорости.

Скорость генерации: токенов в секунду на разных задачах

МодельПинг (токенов/с)Сводка новостей (токенов/с)Синтетический бенчмарк (токенов/с)
qwen3.6-35b-a3b (MoE, 3B активных)595558
gemma-4-26b-a4b-qat (MoE, 4B активных)535052
gemma-4-31b (плотная, 31B активных)181517

В этом стенде MoE-модели держат 50-59 токенов/с, а плотная gemma-4-31b - 15-18 токенов/с. Разрыв примерно в 3,3 раза соответствует разнице между 3-4B активных параметров и 31B. На сводке новостей скорость немного ниже из-за более сложного промпта и структурированного вывода.

Время до первого токена (TTFT) и отзывчивость

МодельTTFT, пинг (мс)TTFT, сводка новостей (мс)
qwen3.6-35b-a3b210380
gemma-4-26b-a4b-qat240410
gemma-4-31b520890

MoE-модели стартуют за 210-410 мс, тогда как плотной модели требуется до 890 мс на сводке новостей. В данном тесте это связано с тем, что плотная архитектура обрабатывает промпт через все 31B параметров, а MoE - только через активную часть экспертов.

Энергопотребление: насколько экономичен Mac mini как AI-сервер

РежимЭнергопотребление (Вт)
Простой (без инференса)8
qwen3.6-35b-a3b, активный инференс42
gemma-4-26b-a4b-qat, активный инференс45
gemma-4-31b, активный инференс58

Mac mini в простое потребляет 8 Вт. Под нагрузкой MoE-моделей энергопотребление поднимается до 42-45 Вт, плотная модель - до 58 Вт. Для сравнения: десктопный ПК с RTX 4090 потребляет 150-250 Вт только на GPU во время инференса. При сохранении такой нагрузки за сутки работа агента на qwen3.6-35b-a3b составит около 1 кВт·ч; итоговая стоимость зависит от тарифа.

Анализ: почему MoE-модели выигрывают на Mac mini

Причина разницы в скорости

48 ГБ на M4 Pro работают иначе, чем связка 32 ГБ RAM + 16 ГБ VRAM в ПК. Унифицированная память исключает копирование данных между CPU и GPU: модель загружается один раз и доступна обоим типам ядер. Пропускная способность 273 ГБ/с помогает подгружать активных экспертов MoE, но не компенсирует нехватку вычислительных ядер для плотных архитектур.

Плотная gemma-4-31b требует полного прохода через все слои на каждом токене. В этом тесте GPU держался на 100%, а пропускная способность памяти использовалась на 60-70%. У MoE-моделей загрузка GPU колебалась от 70% до 95%, память была загружена на 80-90%. Это указывает на то, что для сравниваемых моделей узким местом становится вычислительная мощность GPU, а не объём unified memory.

Практическое следствие: какую модель выбрать

Если приоритетом являются интерактивные AI-агенты, tool calls и несколько последовательных запросов, в рамках этого стенда рациональнее начинать с MoE-моделей с 3-4B активных параметров. Плотная модель может быть оправдана, когда важнее конкретное качество ответа или совместимость с определённым workflow, но её скорость и TTFT нужно проверять отдельно.

Практические рекомендации: хватает ли 48 ГБ и какую конфигурацию выбрать

  • Агентные задачи: Mac mini M4 Pro с 48 ГБ и MoE-моделью в Q4_K_M подходит для поиска, работы с файлами и выполнения кода через OpenClaw. В тесте qwen3.6-35b-a3b показала 50-59 токенов/с и TTFT 210-380 мс.
  • Одиночная модель: 24 ГБ достаточно для одной MoE-модели с контекстом 4096, если не требуется большой запас памяти. 48 ГБ удобнее для контекста 8192 и более тяжёлых конфигураций.
  • Несколько сессий: 48 ГБ дают больше пространства для моделей и KV-кэша, но одновременная работа нескольких агентов увеличит нагрузку. Такой сценарий нужно проверять отдельно, поскольку он не входил в приведённые замеры.
  • Большие контексты: 8192 токенов использовались в тесте. Увеличение до 16384 может снизить скорость из-за роста объёма KV-кэша, поэтому для конкретного workflow нужны отдельные замеры.
  • Квантование: Q4_K_M в этом тесте является базовым балансом между качеством и скоростью. Q3_K_M стоит рассматривать при ограничении памяти, а Q5_K_M - только после проверки, что дополнительное качество оправдывает возможное снижение скорости.

Для одновременного запуска нескольких агентов, моделей с 70B+ параметров и больших контекстов стоит смотреть на Mac Studio с M4 Max или M4 Ultra. У этих конфигураций выше пропускная способность памяти и больше GPU-ядер, но выводы по ним нельзя напрямую переносить из теста Mac mini.

Заключение: Mac mini M4 Pro как локальный AI-сервер

Mac mini M4 Pro с 48 ГБ унифицированной памяти справляется с ролью локального сервера AI-агентов при правильном выборе модели. В приведённых условиях MoE-модели qwen3.6-35b-a3b и gemma-4-26b-a4b-qat выдают 50-59 токенов/с с TTFT 210-410 мс и потребляют 42-45 Вт под нагрузкой. Плотная gemma-4-31b показала 15-18 токенов/с и более высокий TTFT, поэтому для интерактивного агентного сценария выглядит менее практичным вариантом.

Связка LM Studio + OpenClaw настраивается по приведённой схеме и предоставляет локальному агенту поиск, работу с файлами и выполнение кода. Воспроизводимость результатов ограничена совпадением стенда: Mac mini M4 Pro с 48 ГБ, macOS Sequoia 15.4, LM Studio 0.3.8, OpenClaw из main, GGUF Q4_K_M и контекст 8192.

Для дополнительного сравнения можно обратиться к прямому сравнению Gemma-4-26B-a4B и Qwen3.6-MoE, обзору компактных моделей для локального запуска и материалу по гибридным AI-агентам. Разбор AntLing-3.0-flash - гибридной MoE-модели для продакшен-агентов - также помогает оценить альтернативы в сегменте средних MoE-моделей.

Подписаться на канал