Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Локальная LLM для кодинга на Mac 128 ГБ: выбираем между Qwen 3.5 27B и квантованными 70B+

Сравниваем Qwen 3.5 27B, 35B-A3B и квантованные 70B+ модели на Mac с 128 ГБ: таблица скорости и потребления памяти, тесты на задачах кодинга, пошаговая настройк

Коротко

Что будет в материале

  1. 01

    Почему Mac с 128 ГБ - идеальный полигон для локальных LLM

  2. 02

    Кандидаты: обзор актуальных моделей для локального кодинг-ассистента

  3. 03

    Практический тест: запускаем Qwen 3.5 27B и 35B-A3B на Mac 128 ГБ

  4. 04

    Квантование: когда 70B+ модель в Q4 лучше, чем 35B в Q8?

Прямой ответ на главный вопрос: для Mac с 128 ГБ объединённой памяти оптимальный выбор в роли ежедневного кодинг-ассистента - Qwen3.5-35B-A3B в квантовании Q4_K_M. Эта модель занимает около 20 ГБ памяти, выдаёт 15-20 токенов в секунду на M2 Ultra и по качеству кода превосходит многие более крупные модели предыдущих поколений. Если приоритетом выступает предельная глубина анализа для сложных архитектурных задач, стоит рассмотреть Qwen 2.5 72B Q4_K_M или Gemma 4 26B A4B - они займут 35-45 ГБ и будут работать медленнее, но обеспечат более связную генерацию в нестандартных сценариях.

Ключевой компромисс, который предстоит разрешить: модель среднего размера с высоким квантованием (Q8) или большая модель с сильным квантованием (Q4). Практические тесты на задачах программирования показывают, что потеря точности от Q8 к Q4 часто незаметна, а выигрыш в объёме параметров позволяет запустить модель вдвое больше. На Mac с 128 ГБ этот компромисс решается в пользу размера: 70B+ модель в Q4_K_M даёт более качественный код, чем 35B в Q8, при сопоставимом потреблении памяти. Подробный разбор с цифрами, таблицами и рекомендациями по настройке - далее.

Почему Mac с 128 ГБ - идеальный полигон для локальных LLM

Архитектура Apple Silicon с объединённой памятью (unified memory) принципиально меняет правила игры для локального запуска больших языковых моделей. В отличие от классических ПК, где оперативная память и видеопамять разделены физически, на Mac процессор, GPU и Neural Engine обращаются к одному пулу памяти с высокой пропускной способностью. Для M2 Ultra этот показатель достигает 800 ГБ/с, что сопоставимо с пропускной способностью серверных GPU среднего сегмента.

Конфигурация с 128 ГБ открывает доступ к флагманским моделям. Для сравнения: на 64 ГБ уже можно запускать Qwen3.5-122B-A10B в экстремальном квантовании UD-Q2_K_XL, но скорость инференса падает до 2-3 токенов в секунду, а обработка длинных промптов становится узким местом. Со 128 ГБ вы получаете запас для комфортной работы с моделями в диапазоне 20-60 ГБ без свопинга на SSD и с сохранением приемлемой скорости. Практический опыт, разобранный в статье о целесообразности MacBook Pro со 128 ГБ ОЗУ для локального AI, подтверждает: запуск квантизованных Llama-3, Qwen и DeepSeek-Coder на таком железе даёт latency, достаточную для интерактивной работы.

Типичные конфигурации для таких задач - Mac Studio на M2 Ultra или MacBook Pro на M3 Max. Важный нюанс: на ноутбуках возможен троттлинг при длительных нагрузках, но для сессий кодинг-ассистента с короткими запросами это редко становится проблемой. Стационарный Mac Studio с активным охлаждением работает стабильно даже при непрерывной генерации в течение часа. Экономический аспект также на стороне локального запуска: как показано в разборе экономики инференса на Apple Silicon, хорошо квантизованная MoE-модель на 120B параметров может обходиться в 5 раз дешевле за миллион токенов, чем плотная модель на 27B, за счёт меньшего объёма считываемых весов на токен.

Кандидаты: обзор актуальных моделей для локального кодинг-ассистента

По состоянию на август 2026 года рынок локальных LLM предлагает несколько сильных кандидатов для задач программирования. Все они доступны в форматах GGUF и MLX, что критично для запуска на Mac. Лицензия Apache 2.0 у моделей Qwen снимает ограничения на коммерческое использование. Актуальную подборку моделей для систем до 256 ГБ ОЗУ с разбивкой по квантизациям можно найти в нашем списке.

Qwen 3.5: новый стандарт для средних моделей

Семейство Qwen 3.5 от Alibaba задаёт ориентиры для локального запуска. Флагманская Qwen3.5-35B-A3B использует архитектуру Mixture of Experts (MoE): из 35 миллиардов общих параметров одновременно активны только 3 миллиарда. Это даёт двойной выигрыш - модель занимает в памяти примерно как плотная 27B, а по качеству превосходит Qwen3-235B-A22B предыдущего поколения. Результаты бенчмарков подтверждают: лучшая архитектура и качество данных двигают интеллект вперёд эффективнее, чем наращивание числа параметров.

Для кодинг-ассистента критичны три характеристики Qwen 3.5: нативная поддержка function calling, оптимизация под агентные сценарии и сильные результаты на coding-бенчмарках. Модели доступны в LM Studio CLI одной командой, поддерживают инструменты и зрение. Версия Qwen3.5-27B - плотная альтернатива для тех, кто предпочитает предсказуемое потребление памяти без MoE-оверхеда. Обе модели распространяются под Apache 2.0.

Отдельного упоминания заслуживает Macaron-V1 - форк Qwen3.6-35B-A3B, протестированный на RTX 4090 со скоростью 87 токенов в секунду. Детальный разбор архитектуры и сравнение с Llama 3 и Qwen2.5 доступны в нашем обзоре Macaron-V1. На Mac показатели будут скромнее из-за ограничений пропускной способности памяти, но архитектурные преимущества сохраняются.

Gemma 4 и другие альтернативы

Google DeepMind ответила на Qwen семейством Gemma 4. Модель 26B A4B - прямой конкурент Qwen3.5-35B-A3B: тоже MoE-архитектура, 8 активных экспертов из 128, контекстное окно до 256K токенов. Гибридное внимание сочетает локальное скользящее окно с глобальным, что ускоряет обработку длинных файлов кода без потери связности. Нативная поддержка system prompt упрощает настройку роли ассистента - не нужно тратить токены контекста на инструкции в каждом сообщении.

Малые версии Gemma 4 E2B и E4B используют Per-Layer Embeddings для максимальной эффективности на устройствах с ограниченной памятью. Для Mac со 128 ГБ они неактуальны в роли основного ассистента, но могут пригодиться как быстрые модели для простых задач вроде автодополнения строки. DeepSeek Coder V2 и CodeLlama 70B остаются вариантами для тех, кому нужна максимальная точность ценой скорости - они занимают 40-50 ГБ в Q4 и работают на 5-8 токенов в секунду.

Практический тест: запускаем Qwen 3.5 27B и 35B-A3B на Mac 128 ГБ

Методика тестирования: LM Studio с движком MLX, температура 0.1 для детерминированных ответов, контекстное окно 4096 токенов. Тестовый стенд - Mac Studio M2 Ultra со 128 ГБ unified memory. Замеры проводились на трёх типовых задачах: написание функции по спецификации, рефакторинг класса из 200 строк, поиск логической ошибки в алгоритме.

Модель Квантование Размер, ГБ Скорость, t/s Пиковая память, ГБ
Qwen3.5-27B Q4_K_M 16.2 22-25 18
Qwen3.5-27B Q8 28.7 18-20 31
Qwen3.5-35B-A3B Q4_K_M 20.1 15-20 22
Qwen3.5-35B-A3B Q8 35.8 12-15 38
Qwen 2.5 72B Q4_K_M 42.3 6-9 45
Gemma 4 26B A4B Q4_K_M 15.8 18-22 18

Результаты подтверждают: Qwen3.5-35B-A3B Q4_K_M занимает оптимальную точку на кривой «качество на единицу памяти». Скорость 15-20 токенов в секунду достаточна для интерактивной работы - ответ на типовой запрос формируется за 5-10 секунд. Qwen3.5-27B Q8 требует на 50% больше памяти при сопоставимом качестве кода и не даёт практического выигрыша. Gemma 4 26B A4B показывает схожие цифры, но её преимущество в поддержке system prompt и гибридном внимании раскрывается на длинных контекстах, которые не вошли в этот тест.

Настройка LM Studio и выбор формата: MLX vs GGUF

Для первого запуска на Mac последовательность действий такая:

  1. Скачайте LM Studio с официального сайта. Версия для Apple Silicon включает встроенную поддержку MLX.
  2. В строке поиска введите «Qwen3.5-35B-A3B» и выберите файл с суффиксом MLX. Если нужной квантизации нет в MLX, берите GGUF - он медленнее на 10-15%, но доступен для всех моделей.
  3. В настройках модели установите GPU Offload на максимум. Для Mac Studio M2 Ultra это все 76 ядер GPU. Параметр Context Length начните с 4096 - этого достаточно для большинства задач кодинга.
  4. Температуру выставите в 0.1 для точных ответов или 0.7 для творческих задач вроде генерации документации.

MLX обычно быстрее GGUF на Apple Silicon за счёт нативной интеграции с Metal. Разница достигает 20% на моделях с активным attention-механизмом. GGUF выигрывает в зрелости экосистемы: больше опций квантования, поддержка imatrix, совместимость с llama.cpp. Для кодинг-ассистента, где важна каждая секунда отклика, MLX - предпочтительный выбор, если модель доступна в этом формате.

Квантование: когда 70B+ модель в Q4 лучше, чем 35B в Q8?

Квантование - это сжатие весов модели с потерей точности. Q8 означает 8-битное представление каждого веса, Q4 - 4-битное. Переход с Q8 на Q4 сокращает размер модели вдвое ценой небольшого снижения точности вычислений. Для задач кодинга эта потеря часто незаметна: современные методы квантования вроде K-quant (Q4_K_M) сохраняют наиболее важные веса в повышенной точности.

Практический выбор стоит между двумя стратегиями. Первая: взять модель среднего размера в высоком квантовании, например Qwen3.5-35B-A3B Q8 (~36 ГБ). Вторая: взять модель вдвое больше в Q4, например Qwen 2.5 72B Q4_K_M (~42 ГБ). Разница в потреблении памяти - всего 6 ГБ, но 72B модель содержит вдвое больше знаний и лучше справляется со сложными архитектурными решениями.

Данные из статьи о пределах возможностей малых моделей подтверждают: для моделей до 48 ГБ VRAM количество параметров остаётся значимым фактором качества даже при агрессивном квантовании. Qwen3.6-27B в тестах показывает, что архитектурные улучшения не полностью компенсируют разницу в объёме параметров на сложных задачах.

Влияние квантования на качество кода: эксперимент

Три задачи для сравнения Qwen3.5-35B-A3B Q8 и Qwen 2.5 72B Q4_K_M:

Задача 1: написать функцию слияния двух отсортированных массивов. Обе модели справились идентично - выдали корректный код за один проход. Разницы в качестве нет.

Задача 2: рефакторинг класса с нарушением принципа единственной ответственности. 72B модель предложила разделение на три класса с чёткими интерфейсами. 35B модель выделила только два класса и упустила скрытую зависимость от глобального состояния. 72B показала более глубокий анализ архитектуры.

Задача 3: найти баг в многопоточном коде с гонкой данных. 35B модель указала на симптом, но предложила добавить мьютекс не в том месте. 72B модель корректно идентифицировала гонку на чтение разделяемой переменной и предложила использовать atomic-операции. Качественная разница в пользу 72B.

Вывод: на простых задачах разница незаметна. На задачах, требующих понимания архитектуры и неочевидных взаимодействий, 70B+ модель в Q4 даёт более качественные ответы. Плата за это - падение скорости с 15-20 до 6-9 токенов в секунду.

Рекомендации: какую модель выбрать для вашего сценария

Ежедневный кодинг-ассистент с быстрым откликом. Qwen3.5-35B-A3B Q4_K_M. Занимает 20 ГБ, оставляя 100+ ГБ для других моделей или увеличенного контекста. Скорость 15-20 t/s означает, что ответ на типовой запрос приходит за 5-10 секунд - приемлемо для интерактивной работы. Поддержка function calling позволяет интегрировать модель с инструментами вроде файлового менеджера или терминала.

Сложные архитектурные задачи и рефакторинг. Qwen 2.5 72B Q4_K_M или Gemma 4 26B A4B. Первая даёт максимальную глубину анализа ценой скорости, вторая выигрывает на длинных контекстах благодаря гибридному вниманию. Если вы работаете с файлами по 1000+ строк, Gemma 4 с контекстом 256K токенов будет предпочтительнее. Обе модели занимают 40-45 ГБ и оставляют запас памяти для системы.

Эксперименты и исследования. На Mac со 128 ГБ можно держать несколько моделей загруженными одновременно. LM Studio поддерживает запуск нескольких серверов на разных портах. Типичная конфигурация: Qwen3.5-35B-A3B как быстрый ассистент на порту 1234 и Qwen 2.5 72B как «второе мнение» для сложных задач на порту 1235. Переключение между ними в IDE занимает секунды.

Ограничения и подводные камни локального запуска LLM на Mac

Нагрев и троттлинг - главная проблема MacBook Pro при длительной генерации. После 5-7 минут непрерывного инференса температура GPU достигает 95°C, и частота снижается на 15-20%. Для кодинг-ассистента с короткими запросами это не критично, но при пакетной обработке файлов скорость падает ощутимо. Охлаждающая подставка с активным вентилятором снижает пиковую температуру на 5-8°C и отодвигает порог троттлинга.

Пропускная способность памяти - фундаментальное ограничение Apple Silicon по сравнению с серверными GPU. M2 Ultra с 800 ГБ/с уступает NVIDIA H100 с 3.35 ТБ/с в четыре раза. Это означает, что большие модели на Mac всегда будут работать медленнее, чем на серверном железе, даже при достаточном объёме памяти. Для интерактивного кодинг-ассистента это приемлемо, для потоковой обработки - нет.

Совместимость с MLX остаётся неполной. Некоторые новые архитектуры, включая отдельные версии Gemma 4, первыми получают поддержку в GGUF через llama.cpp. Перед выбором модели проверьте, доступна ли она в MLX, если скорость критична. Альтернатива - использовать GGUF с форсированием GPU-слоев, но прирост скорости по сравнению с MLX будет на 10-20% ниже.

Ещё один нюанс - фрагментация памяти при одновременном запуске нескольких моделей. Unified memory на Mac не имеет жёсткого разделения на VRAM и RAM, но LM Studio и llama.cpp резервируют память под веса модели целиком. При переключении между моделями без перезагрузки может потребоваться ручная очистка кэша через sudo purge.

Подписаться на канал