Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

DeepSeek V4 на M1 Ultra 128GB: как патч LM Studio ускорил инференс с 5 до 16 токенов/с

Практический кейс: запуск DeepSeek V4 на Mac M1 Ultra 128GB с квантованием Unsloth UD-IQ3_XXS. Патч LM Studio поднял скорость с 5-6 до 15-16 токенов/с. Разбирае

Коротко

Что будет в материале

  1. 01

    Результаты теста: 15-16 токенов/с на M1 Ultra

  2. 02

    Почему это важно: контекст запуска больших моделей на Apple Silicon

  3. 03

    Ограничения и подводные камни

  4. 04

    Как воспроизвести (общие рекомендации)

Результаты теста: 15-16 токенов/с на M1 Ultra

Пользователь сообщества запустил DeepSeek V4 в экстремально сжатой квантизации Unsloth UD-IQ3_XXS на Mac Studio с чипом M1 Ultra и 128 ГБ унифицированной памяти. До применения патча движка LM Studio скорость генерации составляла 5-6 токенов в секунду. После обновления движка она выросла до 15-16 токенов/с - трёхкратный прирост без смены оборудования.

Качество вывода также улучшилось. Конкретные метрики перплексии или бенчмарков автор не привёл, но субъективно ответы модели стали точнее и связнее. Патч, судя по косвенным признакам, затронул механизмы работы с памятью на Apple Silicon - вероятно, распределение тензоров между CPU и GPU или управление кэшем KV.

Оборудование использовалось максимально близкое к потребительскому: Mac Studio M1 Ultra с 20-ядерным CPU и 64-ядерным GPU. Из 128 ГБ физической памяти примерно 120 ГБ доступно под wired memory - этого хватило для загрузки модели с квантованием UD-IQ3_XXS. LM Studio выступила прослойкой, скрывающей ручную настройку параметров запуска.

Почему это важно: контекст запуска больших моделей на Apple Silicon

Локальный инференс больших языковых моделей на пользовательском железе - один из главных трендов 2026 года. Приватность данных, отсутствие задержек сети и предсказуемая стоимость делают этот подход привлекательным для разработчиков и исследователей. Экономика инференса LLM на Apple Silicon показывает, что грамотно подобранная квантизованная модель обходится дешевле облачных API уже через несколько месяцев регулярного использования.

M1 Ultra с 128 ГБ памяти остаётся одной из немногих потребительских машин, способных тянуть модели класса DeepSeek V4. В нашем сравнении M2 Ultra 64 ГБ против M1 Ultra 128 ГБ мы детально разбирали этот компромисс: объём памяти часто перевешивает прирост вычислительной мощности нового чипа. Кейс с DeepSeek V4 подтверждает этот тезис - модель просто не поместилась бы в 64 ГБ даже с агрессивным квантованием.

DeepSeek V4 и квантование Unsloth UD-IQ3_XXS

DeepSeek V4 - флагманская MoE-модель с сотнями миллиардов параметров в полной точности. Архитектура со смесью экспертов позволяет активировать лишь часть весов при каждом токене, но полный набор всё равно нужно держать в памяти. Без квантования запуск на 128 ГБ невозможен.

Unsloth UD-IQ3_XXS - это экстремально агрессивное квантование, сжимающее модель до 3 бит на параметр с дополнительными техниками оптимизации распределения весов. Качество страдает, но остаётся на удивление рабочим: модель сохраняет связность ответов и базовую логику. Для задач суммаризации, черновой генерации кода или диалогов этого достаточно.

Ограничение wired memory в 120 ГБ - это аппаратный потолок macOS для M1 Ultra. Система резервирует около 8 ГБ под свои нужды, остальное отдаётся под нужды приложений с флагом wired. Модель должна вписаться в этот лимит целиком, иначе начнётся свопинг на SSD с катастрофическим падением скорости.

Роль LM Studio и патча движка

LM Studio - графическая оболочка над llama.cpp, упрощающая загрузку, настройку и запуск моделей на Mac, Windows и Linux. Для Apple Silicon она использует бэкенд Metal, транслирующий вычисления на GPU чипов M-серии. Из коробки LM Studio даёт удобный интерфейс для выбора квантизации, настройки контекстного окна и параметров сэмплинга.

Патч движка, о котором сообщил пользователь, не раскрыт публично. Судя по приросту скорости в 3 раза, изменения затронули низкоуровневые аспекты работы с памятью: перераспределение тензоров между CPU и GPU, оптимизацию операций внимания под конкретную архитектуру M1 Ultra или батчинг вычислений. Похожие техники мы видели в проекте Slipstream для стриминга экспертов с SSD и в оптимизациях llama.cpp для Mamba-2, разобранных в статье об ускорении инференса в llama.cpp.

Факт остаётся фактом: даже без раскрытия деталей, кейс демонстрирует, что программные оптимизации способны кратно увеличить производительность на фиксированном железе. Это важный сигнал для всех, кто уже владеет M1 Ultra 128GB - ваша машина ещё не раскрыла потенциал.

Ограничения и подводные камни

При всей впечатляющей цифре в 16 токенов/с, кейс имеет серьёзные оговорки. Информация основана на единственном сообщении пользователя без независимой верификации. Патч недоступен для воспроизведения. Квантование UD-IQ3_XXS находится на грани деградации качества - модель может галлюцинировать чаще, чем версии с 4 или 5 битами.

Для задач, требующих точности (форматированный вывод JSON, математические расчёты, сложная логика), такое сжатие рискованно. Перед внедрением в рабочий процесс стоит провести собственное тестирование на релевантных данных. Статья про оптимизацию DeepSeek V4 Flash на B300 показывает, с какими неожиданными проблемами можно столкнуться даже на серверном железе.

Wired memory: что это и почему 120GB?

Wired memory в macOS - это страницы физической памяти, закреплённые за конкретным процессом и не подлежащие выгрузке на диск. Для инференса LLM это критично: веса модели должны находиться в оперативной памяти постоянно, иначе каждая операция внимания будет ждать подкачки с SSD.

На M1 Ultra с 128 ГБ унифицированной памяти система резервирует около 8 ГБ под ядро Darwin, драйверы Metal и фреймбуферы. Оставшиеся 120 ГБ - это практический потолок для wired-аллокаций одного процесса. Activity Monitor показывает этот параметр в колонке Wired Memory. Если значение приближается к лимиту, начинается агрессивное сжатие памяти или свопинг - скорость инференса падает на порядок.

Квантование Unsloth UD-IQ3_XXS сжимает DeepSeek V4 примерно до 90-100 ГБ, оставляя запас под KV-кэш и промежуточные тензоры. Без этого запаса модель запустилась бы, но контекстное окно пришлось бы урезать до минимума.

Как воспроизвести (общие рекомендации)

Прямого рецепта с патчем нет, но общий подход к запуску больших моделей на Apple Silicon уже отработан. Начните с установки LM Studio и поиска квантизованных версий DeepSeek V4 в формате GGUF. Unsloth публикует свои сборки в официальных репозиториях - ищите файлы с суффиксом UD-IQ3_XXS.

При первом запуске откройте Activity Monitor, вкладку Memory, и отслеживайте столбец Wired Memory. Если значение упирается в 120 ГБ и начинается свопинг - уменьшайте размер контекстного окна или переходите на более агрессивное квантование. Оптимальный порядок действий: начать с самой сжатой версии, убедиться в стабильной работе, затем пробовать версии с более высоким битрейтом.

Мониторинг wired memory и выбор квантования

Activity Monitor - штатный инструмент macOS, не требующий установки. Для детального анализа используйте команду sudo memory_pressure в терминале или утилиту vm_stat 1 для посекундного мониторинга. Критический индикатор - поле Pageouts: если счётчик растёт, система сбрасывает страницы на диск, и производительность деградирует.

Выбор квантизации - это компромисс между размером модели и качеством вывода. IQ3_XXS даёт максимальное сжатие, но для задач, где важна точность, стоит присмотреться к Q4_K_M или Q5_K_M. На M1 Ultra 128 ГБ эти версии DeepSeek V4 уже не поместятся, но для моделей поменьше - рабочий вариант. Экспериментируйте с альтернативными движками: llama.cpp напрямую, MLX для исследовательских задач, или специализированные форки вроде DS4 DwarfStar для DeepSeek-совместимых архитектур.

Выводы и перспективы

Запуск DeepSeek V4 на M1 Ultra 128GB - не теоретическая возможность, а рабочий кейс с конкретными цифрами. Трёхкратный прирост скорости от патча LM Studio доказывает, что программные оптимизации для Apple Silicon далеки от исчерпания. Чипы M5 уже поддерживают w4a8 на аппаратном уровне, как мы разбирали в статье про скрытый потенциал Apple M5, но текущие фреймворки не используют эти инструкции. Когда сообщество адаптирует бэкенды под новые возможности железа, прирост будет ещё значительнее.

Практический вывод для владельцев M1 Ultra 128GB: не спешите списывать машину со счетов. Следите за обновлениями LM Studio, llama.cpp и специализированных форков. Тестируйте новые квантизации от Unsloth и других команд. Локальный инференс больших моделей становится реальностью не за счёт нового железа, а благодаря умным программным решениям - и этот тренд только набирает обороты.

Подписаться на канал