Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Экономика инференса LLM на Apple Silicon: почему большая модель может быть дешевле

Практический эксперимент на Mac Studio M3 Ultra: замеряем энергопотребление и стоимость за миллион токенов для пяти моделей от 4B до 120B. Узнайте, почему квант

Коротко

Что будет в материале

  1. 01

    Введение: парадокс стоимости локального инференса

  2. 02

    Методология: как мы считали стоимость и энергопотребление

  3. 03

    Результаты: сравнительная таблица стоимости и производительности

  4. 04

    Почему большая модель дешевле: роль архитектуры и квантизации

Введение: парадокс стоимости локального инференса

Практический эксперимент на Mac Studio с M3 Ultra (96 ГБ) переворачивает привычное представление о затратах на генерацию текста. Мы протестировали пять моделей - от 4B до 120B параметров - и получили неожиданный результат: хорошо квантизованная Mixture-of-Experts (MoE) модель на 120B параметров оказалась в пять раз дешевле плотной модели на 27B при пересчёте на миллион токенов.

Ключевая метрика, определяющая стоимость, - не общее количество параметров, а объём данных, считываемых из памяти на каждый токен. Этот объём напрямую зависит от архитектуры модели и степени квантизации. Статья адресована разработчикам, ML-инженерам и всем, кто выбирает локальную модель для продакшен-задач и хочет оперировать реальными цифрами операционных затрат, а не маркетинговыми спецификациями.

Методология: как мы считали стоимость и энергопотребление

Прозрачность методики - обязательное условие для доверия к цифрам. Все замеры проводились в контролируемой среде с фиксацией каждого параметра.

Конфигурация стенда и модели

Тестовый стенд - Mac Studio 2025 года на чипе Apple M3 Ultra с 96 ГБ унифицированной памяти. Пропускная способность памяти составляет 800 ГБ/с. Инференс выполнялся через llama.cpp с бэкендом Metal для полной утилизации GPU. Энергопотребление замерялось ваттметром на входе блока питания - фиксировалось среднее значение за время генерации 500 токенов после прогревочного прогона.

В тесте участвовали пять моделей, покрывающих спектр от сверхлёгких до предельно тяжёлых для данной платформы:

  • Phi-4-mini (4B, плотная, Q4_K_M)
  • Llama-3.1 (8B, плотная, Q4_K_M)
  • Qwen3.6 (27B, плотная, Q4_K_M)
  • Qwen3.6-MoE (35B-A3B, MoE, Q4_K_M)
  • Laguna S 2.1 (118B-A8B, MoE, IQ4_XS)

Выбор квантизации Q4_K_M для большинства моделей обусловлен её статусом стандарта де-факто для локального инференса - она даёт минимальные потери качества при значительном сжатии. Для Laguna применён IQ4_XS из-за ограничений по памяти.

Расчёт стоимости: от ватт к токенам

Формула пересчёта прямолинейна: (потребляемая мощность в кВт) × (время генерации одного миллиона токенов) × (тариф за кВт·ч). Время генерации вычисляется как 1 000 000 / (скорость в токенах/с). В качестве тарифа взято усреднённое значение $0.12 за кВт·ч - типичная цена для жилого сектора США и Европы. Для коммерческого использования цифры будут выше, но пропорции между моделями сохранятся.

Результаты: сравнительная таблица стоимости и производительности

Цифры говорят сами за себя. Плотная 27B-модель - абсолютный аутсайдер по экономике, несмотря на далеко не самый большой размер.

Модель Размер Тип Квант. Токенов/с Ватт (сред.) Ватт/токен $ за 1M токенов
Phi-4-mini 4B Плотная Q4_K_M 98.3 42 0.43 0.014
Llama-3.1 8B Плотная Q4_K_M 72.1 48 0.67 0.022
Qwen3.6-MoE 35B-A3B MoE Q4_K_M 61.5 55 0.89 0.030
Laguna S 2.1 118B-A8B MoE IQ4_XS 28.7 68 2.37 0.079
Qwen3.6 27B Плотная Q4_K_M 18.4 72 3.91 0.130

Энергоэффективность: ватт на токен

Соотношение ватт/токен - интегральная метрика эффективности. Чем она ниже, тем меньше энергии тратится на генерацию одного токена. У плотной 27B-модели этот показатель составляет 3.91, у Laguna S 2.1 с 118B параметров - 2.37. Разрыв в 1.65 раза объясняется тем, что Laguna активирует лишь 8B параметров на токен, а Qwen3.6 - все 27B. Меньший объём считываемых весов означает меньшее время ожидания данных из памяти и, как следствие, меньшее энергопотребление на единицу полезной работы.

Phi-4-mini ожидаемо лидирует с 0.43 ватт/токен, но её качество ответов на сложных задачах несопоставимо с более крупными моделями. Выбор всегда сводится к компромиссу между стоимостью и качеством.

Почему большая модель дешевле: роль архитектуры и квантизации

Физика процесса проста. На Apple Silicon вычисления выполняются быстро, но память - общая для CPU и GPU. Узким местом становится пропускная способность: время генерации одного токена приблизительно равно (объём считанных весов) / (пропускная способность памяти). Чем меньше данных нужно передать из памяти в вычислительные блоки, тем быстрее завершается инференс и тем меньше энергии расходуется.

Пропускная способность памяти как узкое место

M3 Ultra имеет пиковую пропускную способность 800 ГБ/с. Плотная модель Qwen3.6 27B в квантизации Q4_K_M занимает около 14.5 ГБ. При каждом токене считываются все 14.5 ГБ весов. Теоретический предел скорости - 800 / 14.5 ≈ 55 токенов/с. Практическая скорость 18.4 токенов/с говорит о том, что реальная пропускная способность ниже пиковой из-за накладных расходов на вычисления и неоптимального доступа к памяти. Но зависимость сохраняется: удвоение объёма считываемых весов примерно вдвое снижает скорость.

MoE vs плотные модели: сравнение объёмов активации

MoE-архитектура меняет правила игры. Модель Laguna S 2.1 содержит 118B параметров, но на каждом токене активирует только 2 эксперта из 16, что даёт 8B активных параметров. В квантизации IQ4_XS полный размер модели - около 52 ГБ, но объём считываемых весов на токен составляет примерно 4.5 ГБ. Это втрое меньше, чем у плотной 27B-модели. Результат: скорость 28.7 токенов/с против 18.4, а стоимость за миллион токенов - $0.079 против $0.130.

Плотная модель 27B при каждом токене тащит через память весь свой багаж знаний. MoE-модель 118B держит знания в распределённых экспертах и достаёт только нужные. Плюс квантизация дополнительно сжимает каждый байт весов. Совокупный эффект: «большая» модель физически передаёт меньше данных и потому работает быстрее и дешевле.

Практические выводы: как выбрать модель для Mac Studio

Правило большого пальца: для экономии выбирайте MoE-модели с агрессивной квантизацией (Q4_K_M, IQ4_XS). Плотные модели размером от 27B на унифицированной памяти неэффективны - они дороги и медленны. Маленькие модели 4B-8B дёшевы, но проигрывают в качестве на задачах, требующих рассуждений и широких знаний.

Чек-лист для выбора:

  1. Оцените бюджет на 1M токенов. Если он ниже $0.05 - рассматривайте модели до 8B или MoE с малым числом активных параметров.
  2. Определите минимально допустимое качество. Для кодинга и сложных рассуждений берите MoE-модели уровня Laguna S 2.1 или Qwen3.6-MoE. Для рутинных задач вроде суммаризации хватит 8B плотной модели.
  3. Если качество критично - выбирайте MoE. Macaron-V1 на Qwen3.6-35B-A3B даёт 87 токенов/с на дискретной GPU и остаётся быстрым на Apple Silicon.
  4. Используйте квантизацию Q4_K_M как отправную точку. Если модель не влезает в память - переходите на IQ4_XS, но проверьте качество на своих задачах.

Ограничения и когда выводы не работают

Результаты получены на Mac Studio M3 Ultra с пропускной способностью 800 ГБ/с. На машинах с дискретной GPU, таких как RTX 4090, узким местом может быть объём VRAM, а не пропускная способность - там плотная модель 27B влезает целиком и не испытывает проблем с подкачкой. На CPU-инференсе без GPU-ускорения bottleneck смещается в вычислительную производительность ядер, и пропорции могут измениться.

Агрессивная квантизация - палка о двух концах. IQ4_XS снижает затраты, но на некоторых задачах может давать заметную деградацию качества. Тестируйте на своих данных. Модели с 1-битной квантизацией, которые мы разбирали в обзоре Bonsai 27B, сохраняют до 90% интеллекта при радикальном сжатии - это направление стоит отслеживать.

Для понимания того, какие модели реально запускаются на разных конфигурациях Mac, полезен разбор M2 Ultra 64 ГБ против M1 Ultra 128 ГБ - там детально расписана совместимость и ограничения по памяти.

Заключение: переосмысление «больших» моделей на Apple Silicon

Размер модели в гигабайтах или миллиардах параметров больше не определяет стоимость её эксплуатации. В эпоху Mixture-of-Experts и эффективных квантизаций ключевой метрикой становится объём данных, считываемых из памяти на токен. Хорошо спроектированная 118B MoE-модель может быть экономичнее 27B плотной - и при этом давать лучшее качество ответа.

Локальный инференс на Mac Studio экономически оправдан для широкого спектра задач. Mac mini M4 Pro с 48 ГБ справляется с ролью сервера AI-агентов, а Mac Studio с 96 ГБ тянет модели, ещё недавно считавшиеся прерогативой облачных кластеров. Считайте стоимость за миллион токенов, тестируйте модели на своих задачах и не доверяйте слепо спецификациям - реальная экономика инференса часто оказывается контринтуитивной.

Подписаться на канал