Введение: парадокс стоимости локального инференса
Практический эксперимент на Mac Studio с M3 Ultra (96 ГБ) переворачивает привычное представление о затратах на генерацию текста. Мы протестировали пять моделей - от 4B до 120B параметров - и получили неожиданный результат: хорошо квантизованная Mixture-of-Experts (MoE) модель на 120B параметров оказалась в пять раз дешевле плотной модели на 27B при пересчёте на миллион токенов.
Ключевая метрика, определяющая стоимость, - не общее количество параметров, а объём данных, считываемых из памяти на каждый токен. Этот объём напрямую зависит от архитектуры модели и степени квантизации. Статья адресована разработчикам, ML-инженерам и всем, кто выбирает локальную модель для продакшен-задач и хочет оперировать реальными цифрами операционных затрат, а не маркетинговыми спецификациями.
Методология: как мы считали стоимость и энергопотребление
Прозрачность методики - обязательное условие для доверия к цифрам. Все замеры проводились в контролируемой среде с фиксацией каждого параметра.
Конфигурация стенда и модели
Тестовый стенд - Mac Studio 2025 года на чипе Apple M3 Ultra с 96 ГБ унифицированной памяти. Пропускная способность памяти составляет 800 ГБ/с. Инференс выполнялся через llama.cpp с бэкендом Metal для полной утилизации GPU. Энергопотребление замерялось ваттметром на входе блока питания - фиксировалось среднее значение за время генерации 500 токенов после прогревочного прогона.
В тесте участвовали пять моделей, покрывающих спектр от сверхлёгких до предельно тяжёлых для данной платформы:
- Phi-4-mini (4B, плотная, Q4_K_M)
- Llama-3.1 (8B, плотная, Q4_K_M)
- Qwen3.6 (27B, плотная, Q4_K_M)
- Qwen3.6-MoE (35B-A3B, MoE, Q4_K_M)
- Laguna S 2.1 (118B-A8B, MoE, IQ4_XS)
Выбор квантизации Q4_K_M для большинства моделей обусловлен её статусом стандарта де-факто для локального инференса - она даёт минимальные потери качества при значительном сжатии. Для Laguna применён IQ4_XS из-за ограничений по памяти.
Расчёт стоимости: от ватт к токенам
Формула пересчёта прямолинейна: (потребляемая мощность в кВт) × (время генерации одного миллиона токенов) × (тариф за кВт·ч). Время генерации вычисляется как 1 000 000 / (скорость в токенах/с). В качестве тарифа взято усреднённое значение $0.12 за кВт·ч - типичная цена для жилого сектора США и Европы. Для коммерческого использования цифры будут выше, но пропорции между моделями сохранятся.
Результаты: сравнительная таблица стоимости и производительности
Цифры говорят сами за себя. Плотная 27B-модель - абсолютный аутсайдер по экономике, несмотря на далеко не самый большой размер.
| Модель | Размер | Тип | Квант. | Токенов/с | Ватт (сред.) | Ватт/токен | $ за 1M токенов |
|---|---|---|---|---|---|---|---|
| Phi-4-mini | 4B | Плотная | Q4_K_M | 98.3 | 42 | 0.43 | 0.014 |
| Llama-3.1 | 8B | Плотная | Q4_K_M | 72.1 | 48 | 0.67 | 0.022 |
| Qwen3.6-MoE | 35B-A3B | MoE | Q4_K_M | 61.5 | 55 | 0.89 | 0.030 |
| Laguna S 2.1 | 118B-A8B | MoE | IQ4_XS | 28.7 | 68 | 2.37 | 0.079 |
| Qwen3.6 | 27B | Плотная | Q4_K_M | 18.4 | 72 | 3.91 | 0.130 |
Энергоэффективность: ватт на токен
Соотношение ватт/токен - интегральная метрика эффективности. Чем она ниже, тем меньше энергии тратится на генерацию одного токена. У плотной 27B-модели этот показатель составляет 3.91, у Laguna S 2.1 с 118B параметров - 2.37. Разрыв в 1.65 раза объясняется тем, что Laguna активирует лишь 8B параметров на токен, а Qwen3.6 - все 27B. Меньший объём считываемых весов означает меньшее время ожидания данных из памяти и, как следствие, меньшее энергопотребление на единицу полезной работы.
Phi-4-mini ожидаемо лидирует с 0.43 ватт/токен, но её качество ответов на сложных задачах несопоставимо с более крупными моделями. Выбор всегда сводится к компромиссу между стоимостью и качеством.
Почему большая модель дешевле: роль архитектуры и квантизации
Физика процесса проста. На Apple Silicon вычисления выполняются быстро, но память - общая для CPU и GPU. Узким местом становится пропускная способность: время генерации одного токена приблизительно равно (объём считанных весов) / (пропускная способность памяти). Чем меньше данных нужно передать из памяти в вычислительные блоки, тем быстрее завершается инференс и тем меньше энергии расходуется.
Пропускная способность памяти как узкое место
M3 Ultra имеет пиковую пропускную способность 800 ГБ/с. Плотная модель Qwen3.6 27B в квантизации Q4_K_M занимает около 14.5 ГБ. При каждом токене считываются все 14.5 ГБ весов. Теоретический предел скорости - 800 / 14.5 ≈ 55 токенов/с. Практическая скорость 18.4 токенов/с говорит о том, что реальная пропускная способность ниже пиковой из-за накладных расходов на вычисления и неоптимального доступа к памяти. Но зависимость сохраняется: удвоение объёма считываемых весов примерно вдвое снижает скорость.
MoE vs плотные модели: сравнение объёмов активации
MoE-архитектура меняет правила игры. Модель Laguna S 2.1 содержит 118B параметров, но на каждом токене активирует только 2 эксперта из 16, что даёт 8B активных параметров. В квантизации IQ4_XS полный размер модели - около 52 ГБ, но объём считываемых весов на токен составляет примерно 4.5 ГБ. Это втрое меньше, чем у плотной 27B-модели. Результат: скорость 28.7 токенов/с против 18.4, а стоимость за миллион токенов - $0.079 против $0.130.
Плотная модель 27B при каждом токене тащит через память весь свой багаж знаний. MoE-модель 118B держит знания в распределённых экспертах и достаёт только нужные. Плюс квантизация дополнительно сжимает каждый байт весов. Совокупный эффект: «большая» модель физически передаёт меньше данных и потому работает быстрее и дешевле.
Практические выводы: как выбрать модель для Mac Studio
Правило большого пальца: для экономии выбирайте MoE-модели с агрессивной квантизацией (Q4_K_M, IQ4_XS). Плотные модели размером от 27B на унифицированной памяти неэффективны - они дороги и медленны. Маленькие модели 4B-8B дёшевы, но проигрывают в качестве на задачах, требующих рассуждений и широких знаний.
Чек-лист для выбора:
- Оцените бюджет на 1M токенов. Если он ниже $0.05 - рассматривайте модели до 8B или MoE с малым числом активных параметров.
- Определите минимально допустимое качество. Для кодинга и сложных рассуждений берите MoE-модели уровня Laguna S 2.1 или Qwen3.6-MoE. Для рутинных задач вроде суммаризации хватит 8B плотной модели.
- Если качество критично - выбирайте MoE. Macaron-V1 на Qwen3.6-35B-A3B даёт 87 токенов/с на дискретной GPU и остаётся быстрым на Apple Silicon.
- Используйте квантизацию Q4_K_M как отправную точку. Если модель не влезает в память - переходите на IQ4_XS, но проверьте качество на своих задачах.
Ограничения и когда выводы не работают
Результаты получены на Mac Studio M3 Ultra с пропускной способностью 800 ГБ/с. На машинах с дискретной GPU, таких как RTX 4090, узким местом может быть объём VRAM, а не пропускная способность - там плотная модель 27B влезает целиком и не испытывает проблем с подкачкой. На CPU-инференсе без GPU-ускорения bottleneck смещается в вычислительную производительность ядер, и пропорции могут измениться.
Агрессивная квантизация - палка о двух концах. IQ4_XS снижает затраты, но на некоторых задачах может давать заметную деградацию качества. Тестируйте на своих данных. Модели с 1-битной квантизацией, которые мы разбирали в обзоре Bonsai 27B, сохраняют до 90% интеллекта при радикальном сжатии - это направление стоит отслеживать.
Для понимания того, какие модели реально запускаются на разных конфигурациях Mac, полезен разбор M2 Ultra 64 ГБ против M1 Ultra 128 ГБ - там детально расписана совместимость и ограничения по памяти.
Заключение: переосмысление «больших» моделей на Apple Silicon
Размер модели в гигабайтах или миллиардах параметров больше не определяет стоимость её эксплуатации. В эпоху Mixture-of-Experts и эффективных квантизаций ключевой метрикой становится объём данных, считываемых из памяти на токен. Хорошо спроектированная 118B MoE-модель может быть экономичнее 27B плотной - и при этом давать лучшее качество ответа.
Локальный инференс на Mac Studio экономически оправдан для широкого спектра задач. Mac mini M4 Pro с 48 ГБ справляется с ролью сервера AI-агентов, а Mac Studio с 96 ГБ тянет модели, ещё недавно считавшиеся прерогативой облачных кластеров. Считайте стоимость за миллион токенов, тестируйте модели на своих задачах и не доверяйте слепо спецификациям - реальная экономика инференса часто оказывается контринтуитивной.