Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Mac mini M4 Pro как сервер AI-агентов: тестируем OpenClaw и локальный инференс LLM

Практический тест Mac mini M4 Pro с 48 ГБ памяти для локального запуска AI-агентов. Установка OpenClaw, настройка LM Studio, замеры скорости (токенов/с) для MoE

Коротко

Что будет в материале

  1. 01

    Введение: зачем тестировать Mac mini M4 Pro как AI-сервер?

  2. 02

    Методология тестирования: что и как мы измеряли

  3. 03

    Установка и настройка OpenClaw на Mac mini

  4. 04

    Результаты тестирования: скорость, задержка и энергопотребление

Введение: зачем тестировать Mac mini M4 Pro как AI-сервер?

Облачные AI-сервисы решают много задач, но создают три проблемы: регулярные платежи, утечка конфиденциальных данных и жёсткая зависимость от интернета. Инженеры всё чаще переносят инференс на собственное железо. Mac mini M4 Pro с 48 ГБ унифицированной памяти выглядит идеальным кандидатом для портативного сервера AI-агентов: он компактный, энергоэффективный и не требует отдельной GPU-фермы.

Мы проверили это на практике. Развернули OpenClaw, подключили LM Studio и прогнали три модели среднего размера через серию замеров. Результат: MoE-модели выдают интерактивную скорость 50-59 токенов/с при разумном энергопотреблении. Плотная модель с 31B параметрами проигрывает и по скорости, и по качеству ответа. Mac mini справляется с ролью AI-сервера, но только при правильном выборе архитектуры модели.

Этот тест даёт прямой ответ на вопрос «подходит ли Mac mini для AI-агентов» и закрывает смежные интенты: какие модели ставить, как настраивать OpenClaw и сколько электричества уходит под нагрузкой. Все цифры получены на реальном железе, конфигурации воспроизводимы.

Методология тестирования: что и как мы измеряли

Прозрачность замеров критична для принятия решений. Мы фиксировали три сценария: пинг (задержка до первого ответа), генерация сводки новостей (реалистичная агентная задача) и синтетический бенчмарк (непрерывная генерация длинного текста). Каждый тест повторялся пять раз, результаты усреднялись. Измеряли токенов/с, время до первого токена (TTFT) и энергопотребление под нагрузкой.

Конфигурация оборудования и ПО

Тестовый стенд:

  • Mac mini M4 Pro, чип Apple M4 Pro с 12 ядрами CPU (8 производительных, 4 эффективных) и 16 ядрами GPU.
  • 48 ГБ унифицированной памяти LPDDR5x с пропускной способностью 273 ГБ/с.
  • macOS Sequoia 15.4, LM Studio 0.3.8, OpenClaw из репозитория main.
  • Все модели загружены в формате GGUF с квантованием Q4_K_M, размер контекста 8192 токена.
  • Слои модели полностью выгружены на GPU, бэкенд Metal.

Энергопотребление замерялось через встроенный датчик системы (powermetrics) с интервалом 1 секунда, фиксировалось среднее за период активного инференса. Шум и нагрев оценивались субъективно: кулер оставался в зоне слышимости только при длительной нагрузке на плотную модель.

Тестируемые модели: MoE против плотных архитектур

Выбор моделей отражает два принципиально разных подхода к архитектуре:

  • qwen3.6-35b-a3b - Mixture of Experts, 35B общих параметров, 3B активных на токен. 128 экспертов, активируются 8.
  • gemma-4-26b-a4b-qat - MoE, 26B общих, 4B активных. Архитектура с квантованием-aware training, что даёт дополнительную оптимизацию при сжатии.
  • gemma-4-31b - плотная архитектура, все 31B параметров активны на каждом токене.

Разница принципиальна: MoE активирует только часть параметров, снижая вычислительную нагрузку на токен. На железе с ограниченной GPU-производительностью это даёт выигрыш в скорости. Плотная модель требует полного прохода через все слои, что упирается в вычислительные возможности чипа. Далее цифры подтверждают это предположение.

Установка и настройка OpenClaw на Mac mini

OpenClaw - это фреймворк для создания AI-агентов с поддержкой локальных LLM. Он подключается к LM Studio как к OpenAI-совместимому серверу и добавляет инструменты: поиск в интернете, работу с файлами, выполнение кода. Ниже пошаговая инструкция, которая позволит воспроизвести стенд за 15-20 минут.

Шаг 1: Установка LM Studio и загрузка моделей

Скачайте LM Studio с официального сайта (lmstudio.ai), установите и запустите. Интерфейс позволяет искать модели прямо из приложения: в строке поиска введите название модели, выберите вариант с квантованием Q4_K_M в формате GGUF. Для статьи использовались:

  • qwen3.6-35b-a3b (автор: bartowski, файл qwen3.6-35b-a3b-Q4_K_M.gguf)
  • gemma-4-26b-a4b-qat (автор: lmstudio-community, файл gemma-4-26b-a4b-qat-Q4_K_M.gguf)
  • gemma-4-31b (автор: bartowski, файл gemma-4-31b-Q4_K_M.gguf)

После загрузки перейдите на вкладку Server, выберите модель, установите порт 1234, активируйте опцию «Serve on Local Network» только если агент будет на другой машине. В настройках модели (вкладка Model Config) установите контекст 8192 и убедитесь, что GPU Offload переключён на «Max». Запустите сервер кнопкой Start Server. Проверьте работоспособность через браузер: http://localhost:1234/v1/models должен вернуть JSON со списком загруженных моделей.

Шаг 2: Установка и конфигурация OpenClaw

Клонируйте репозиторий и установите зависимости:

git clone https://github.com/openclaw/openclaw.git
cd openclaw
pip install -r requirements.txt

Создайте конфигурационный файл agent.yaml в корне проекта:

llm:
  provider: openai
  model: qwen3.6-35b-a3b
  api_base: http://localhost:1234/v1
  api_key: not-needed
  temperature: 0.7
  max_tokens: 2048

tools:
  - search
  - file_reader
  - python_executor

system_prompt: "Ты - AI-агент на локальном сервере. Отвечай на русском языке, используй инструменты для поиска актуальной информации."

Параметр api_key обязателен для совместимости с OpenAI API, но LM Studio игнорирует его. Запустите агента:

python openclaw.py --config agent.yaml

Возможные ошибки: если агент не видит сервер, проверьте, что LM Studio запущена на порту 1234 и модель загружена. При ошибках памяти уменьшите размер контекста до 4096 или используйте квантование Q3_K_M. Для смены модели достаточно изменить параметр model в конфиге и перезапустить сервер LM Studio с нужной моделью.

Результаты тестирования: скорость, задержка и энергопотребление

Цифры собраны в трёх сценариях. Пинг - запрос «Ответь OK, текущее время и дата», оценивает чистую задержку без сложной обработки. Сводка новостей - промпт «Сгенерируй сводку из 5 новостей об AI за сегодня», длина вывода 300-400 токенов. Синтетический бенчмарк - генерация текста на 1000 токенов по заданной теме, замер непрерывной скорости.

Скорость генерации: токенов в секунду на разных задачах

МодельПинг (токенов/с)Сводка новостей (токенов/с)Синтетический бенчмарк (токенов/с)
qwen3.6-35b-a3b (MoE, 3B активных)595558
gemma-4-26b-a4b-qat (MoE, 4B активных)535052
gemma-4-31b (плотная, 31B активных)181517

MoE-модели держат стабильные 50-59 токенов/с независимо от сценария. Плотная gemma-4-31b падает до 15-18 токенов/с - это ниже порога комфортного чтения. Разрыв в 3.3 раза объясняется количеством активных параметров: 3-4B против 31B. На сводке новостей скорость чуть ниже из-за более сложного промпта, требующего структурированного вывода, но падение некритично для MoE.

Время до первого токена (TTFT) и отзывчивость

МодельTTFT, пинг (мс)TTFT, сводка новостей (мс)
qwen3.6-35b-a3b210380
gemma-4-26b-a4b-qat240410
gemma-4-31b520890

TTFT критичен для интерактивных агентов: пользователь ждёт начала ответа. MoE-модели стартуют за 210-410 мс - это уровень быстрого веб-приложения. Плотная модель требует почти секунду на сводке новостей, что создаёт ощущение задержки. Причина: плотной архитектуре нужно обработать весь промпт через все 31B параметров перед генерацией первого токена. MoE распределяет промпт по экспертам, сокращая объём вычислений на этапе префилла.

Энергопотребление: насколько экономичен Mac mini как AI-сервер

РежимЭнергопотребление (Вт)
Простой (без инференса)8
qwen3.6-35b-a3b, активный инференс42
gemma-4-26b-a4b-qat, активный инференс45
gemma-4-31b, активный инференс58

Mac mini в простое потребляет 8 Вт - меньше лампочки. Под нагрузкой MoE-моделей энергопотребление поднимается до 42-45 Вт, плотная модель разогревает систему до 58 Вт. Для сравнения: десктопный ПК с RTX 4090 потребляет 150-250 Вт только на GPU во время инференса. Mac mini остаётся экономичным даже при полной загрузке. За сутки непрерывной работы агента на qwen3.6-35b-a3b вы потратите около 1 кВт·ч - это 5-7 рублей по московским тарифам.

Анализ: почему MoE-модели выигрывают на Mac mini

Результаты тестов не случайны. Архитектура Mixture of Experts и унифицированная память M4 Pro создают синергию, а плотные модели упираются в вычислительный потолок чипа.

Влияние унифицированной памяти на инференс

48 ГБ на M4 Pro работают иначе, чем связка 32 ГБ RAM + 16 ГБ VRAM в ПК. Унифицированная память исключает копирование данных между CPU и GPU: модель загружается один раз и доступна обоим типам ядер без накладных расходов. Пропускная способность 273 ГБ/с позволяет быстро подгружать активных экспертов MoE, но не компенсирует нехватку вычислительных ядер для плотных архитектур.

Плотная gemma-4-31b требует полного прохода через все слои на каждом токене. 16 ядер GPU M4 Pro просто не успевают обсчитать 31B параметров с той же скоростью, с какой 3-4B активных параметров MoE проходят через них же. Узкое место - вычислительная мощность GPU, а не память. Это подтверждается мониторингом: при инференсе плотной модели загрузка GPU держится на 100%, а пропускная способность памяти используется на 60-70%. У MoE-моделей загрузка GPU колеблется от 70% до 95%, память загружена на 80-90%.

Сравнение с прямым сравнением Gemma-4-26B-a4B и Qwen3.6-MoE показывает, что 4B активных параметров MoE побеждают в логических задачах именно за счёт эффективного распределения вычислений. Наш тест дополняет эту картину данными по скорости и энергопотреблению на конкретном железе.

Практические рекомендации: какой Mac mini и какие модели выбрать

На основе замеров формируются чёткие рекомендации:

  • Модели: для AI-агентов на Mac mini оптимальны MoE-модели с активными параметрами до 4-5B. qwen3.6-35b-a3b и gemma-4-26b-a4b-qat дают интерактивную скорость 50-59 токенов/с. Плотные модели >30B не рекомендуются: падение скорости до 15-18 токенов/с делает их непригодными для агентных сценариев.
  • Память: 48 ГБ - разумный минимум для комфортной работы с несколькими моделями и контекстом 8192 токенов. 24 ГБ хватит для одной MoE-модели с контекстом 4096, но без запаса на будущее.
  • Квантование: Q4_K_M - баланс между качеством и скоростью. Q5_K_M даёт незначительный прирост качества ценой падения скорости на 10-15%. Q3_K_M подходит только для 24 ГБ конфигураций.
  • Размер контекста: 8192 токенов покрывает 90% агентных задач. Увеличение до 16384 снижает скорость на 15-20% из-за роста объёма KV-кэша.

Для более тяжёлых задач - одновременный запуск нескольких агентов, модели с 70B+ параметров, большие контексты - стоит смотреть на Mac Studio с M4 Max или M4 Ultra. Там пропускная способность памяти достигает 546 ГБ/с и 819 ГБ/с соответственно, а количество GPU-ядер кратно выше. Обзор лучших компактных моделей 2026 года поможет подобрать альтернативы для устройств с 8-16 ГБ памяти.

Отдельный сценарий - холодное кэширование KV-кэша на SSD, которое позволяет запускать три сессии крупных моделей на Mac Studio с 96 ГБ без потери производительности. Этот подход описан в нашем материале по эксплуатации Qwen3.5 122B на Mac Studio, но для Mac mini с 48 ГБ он избыточен: MoE-модели и так влезают в память целиком.

Заключение: Mac mini M4 Pro - состоявшийся портативный AI-сервер

Mac mini M4 Pro с 48 ГБ унифицированной памяти успешно справляется с ролью сервера AI-агентов. MoE-модели qwen3.6-35b-a3b и gemma-4-26b-a4b-qat выдают 50-59 токенов/с с TTFT 210-410 мс - это уровень комфортного интерактивного взаимодействия. Энергопотребление 42-45 Вт под нагрузкой делает круглосуточную работу экономически незаметной. Плотная gemma-4-31b проигрывает по всем метрикам и не рекомендуется для этого класса устройств.

Связка LM Studio + OpenClaw настраивается за 15 минут и даёт полноценного локального агента с поиском, работой с файлами и выполнением кода. Все конфигурации, приведённые в статье, воспроизводимы на любом Mac mini M4 Pro с 48 ГБ.

Для углубления в тему рекомендуем разбор AntLing-3.0-flash - гибридной MoE-модели для продакшен-агентов, а также сравнение Laguna S 2.1 с DeepSeek V4 Flash для понимания альтернатив в сегменте средних MoE-моделей.

Подписаться на канал