Перейти к содержанию
Публикация AiManual

Qwen 3.8 27B на Apple M5 Ultra через Splash: есть ли реальные замеры и чего ждать

Публичных замеров Qwen 3.8 27B через Splash на Apple M5 Ultra пока нет: есть только вопрос в r/LocalLLaMA и цифры для M5 Max из блога Splash. Разбираем, почему

Коротко

Что будет в материале

  1. 01

    Короткий ответ: замеров Qwen 3.8 27B на M5 Ultra через Splash пока нет

  2. 02

    Что такое Splash и какие оптимизации он даёт на Apple Silicon

  3. 03

    Почему результаты M5 Max нельзя автоматически переносить на M5 Ultra

  4. 04

    Как самостоятельно измерить производительность Qwen 3.8 27B на M5 Ultra

Короткий ответ: замеров Qwen 3.8 27B на M5 Ultra через Splash пока нет

Подтверждённых публичных замеров Qwen 3.8 27B, запущенной через Splash на Apple M5 Ultra, в доступных источниках нет. Единственное релевантное обсуждение - тема на r/LocalLLaMA, где пользователь прямо спрашивает: «Has anyone tried Qwen 3.8 27B using Splash on an M5 Ultra?» (обсуждение на Reddit).

Автор вопроса ссылается на релизный блог Splash: там показаны впечатляющие улучшения производительности Qwen 3.8 27B на M5 Max. Значений для M5 Ultra в публикации нет, и в самой ветке никто не привёл своих результатов. Это весь фактологический минимум, который есть на сегодня.

Отсутствие данных не означает, что связка работает медленно. Оно означает, что никто публично не выложил прогон. Дальше разберём, что такое Splash, почему цифры M5 Max нельзя механически переносить на M5 Ultra и как снять свои метрики, если это железо уже под рукой.

Что именно известно из блога Splash и обсуждения на Reddit

Факты короткие. Релизный блог Splash сообщает об ускорении Qwen 3.8 27B на M5 Max. Пользователь, который искал цифры для M5 Ultra, нашёл только эти данные и не обнаружил ничего по своему чипу. Вопрос остался без ответа с конкретными значениями.

Вывод здесь один: «впечатляющие цифры из блога» относятся к M5 Max. Подтверждений, что тот же прирост повторится на Ultra, в материалах нет. Любые числа, которые вы встретите по этой связке на Ultra, требуют проверки первоисточника: кто запускал, какой был пакет модели, какая версия рантайма и какой контекст.

Почему отсутствие данных - норма на старте

Замеры появляются не одновременно с релизом. Сначала выходит рантайм, потом его пробуют на самых распространённых конфигурациях. В линейке Apple Silicon это обычно Max: таких машин больше, их проще взять в обзор, и именно на них авторы фреймворков чаще выкладывают первые результаты.

Ultra - нишевое железо. Его покупают под конкретные задачи: большие контексты, параллельные потоки, домашние серверы. Пользователей меньше, значит и публичных прогонов меньше. Задержка между релизом и первыми честными замерами на топовом чипе может измеряться неделями, но обещать сроки бессмысленно: всё зависит от того, у кого раньше окажется эта связка и кто захочет выложить цифры (исходный вопрос так и остался без числового ответа).

Что такое Splash и какие оптимизации он даёт на Apple Silicon

Splash - рантайм для локального запуска LLM на Apple Silicon. В источниках он фигурирует как софт, чей релизный блог заявляет ускорение Qwen 3.8 27B на M5 Max. Этого достаточно, чтобы отнести его к классу инструментов локального инференса, и недостаточно, чтобы описывать внутреннее устройство как установленный факт.

Общий класс приёмов, которые обычно дают прирост на Mac, выглядит так:

  • работа через Metal вместо частично CPU-путей, чтобы не гонять тензоры между CPU и GPU без нужды;
  • эффективное использование unified memory: на Apple Silicon память общая, и грамотная раскладка весов снижает объём копирований;
  • проработка attention и KV-кэша, что особенно чувствуется на длинном контексте;
  • поддержка квантованных весов и быстрые ядра под конкретные схемы квантизации;
  • снижение накладных расходов на синхронизацию и запуск ядер.

Слово «обычно» здесь ключевое. Конкретный набор решений внутри Splash по доступным материалам не подтверждён, и приписывать ему те или иные приёмы было бы домыслом. Практический вывод другой: если фреймворк заявляет ускорение на конкретном чипе, это результат тюнинга под определённый профиль железа, и он не обязан одинаково раскрываться на другой конфигурации.

Чем Splash отличается от MLX, llama.cpp и Ollama

Экосистема локального запуска на Mac делится по назначению, а не по принципу «кто быстрее».

ИнструментНиша
MLXФреймворк Apple для ML на Apple Silicon, часто служит базой для сторонних рантаймов и квантованных сборок моделей
llama.cppКроссплатформенный движок с широкой поддержкой форматов и квантований, включая GGUF
OllamaУдобная обёртка для запуска моделей, рассчитанная на простую установку и повседневное использование
SplashРантайм под Apple Silicon, заявляющий ускорение Qwen 3.8 27B на M5 Max

Splash не стоит записывать в безусловные лидеры. Любое сравнение требует одной модели, одних промптов и одной конфигурации. Пока публичных сравнений по M5 Ultra нет, вопрос «стоит ли переходить» остаётся открытым. Как корректно мерить скорость генерации и что фиксировать при замерах, разобрано в отдельном материале про проверку эффекта ускорения на своём Mac.

Почему оптимизации под M5 Max не гарантируют тот же эффект на M5 Ultra

Фреймворк тюнят под конкретный профиль: число GPU-ядер, объём и пропускную способность unified memory, тепловой пакет корпуса. M5 Max и M5 Ultra различаются по балансу compute и памяти. Даже если вычислительных блоков на Ultra больше, узким местом может стать пропускная способность памяти или планировщик, который на большем числе ядер работает иначе.

На практике это выглядит так: прирост на Max получен там, где упор шёл в compute или в неэффективность конкретных ядер. На Ultra та же нагрузка может упираться в память, и тогда тюнинг даст меньший эффект. Обратная ситуация тоже возможна. Без запуска на самом чипе предсказать направление нельзя.

Почему результаты M5 Max нельзя автоматически переносить на M5 Ultra

Перенос цифр с одного чипа на другой без проверки - это гадание. Причины конкретные.

  • Конфигурация GPU отличается: число ядер и баланс с памятью.
  • Объём unified memory влияет на выбор пакета модели, а пакет определяет и скорость, и качество.
  • Тепловой режим: в разных корпусах охлаждение работает по-разному, и троттлинг наступает не одновременно. Короткий замер и длинный прогон дают разные медианы.
  • Рантайм может масштабироваться под число ядер нелинейно.
  • Версия Splash, версия macOS и драйверы Metal меняют картину между прогонами.

Проценты разницы между Max и Ultra в доступных источниках никто не приводил. Любая цифра вида «Ultra будет на N процентов быстрее» не подтверждена.

Память и квантование: Q4, Q8 и FP16 на M5 Ultra

Qwen3.8-27B доступна в нескольких вариантах пакетов: Q4 (меньше памяти), Q8 (выше качество) и FP16 (оригинальные веса). Это первый фактор, который нужно фиксировать при любом замере, иначе сравнивать нечего.

Логика компромисса простая. Меньшая битность даёт меньший объём весов и обычно более высокую скорость, но качество ответа проседает. FP16 сохраняет оригинальные веса и максимальное качество, занимает заметно больше памяти и работает медленнее. Q8 сидит между ними. Насколько каждая схема ударит по качеству на конкретных задачах, зависит от модели и типа запросов. Разбор выбора между квантованными схемами для Qwen3.8-27B на Apple Silicon есть в материале про oQ3e, oQ4e, oQ6e и oQ8e.

Для M5 Ultra объём памяти определяет, влезет ли FP16 и с каким контекстом. Если выбирать пакет по принципу «лишь бы запустилось», скорость окажется не главным ограничением.

Оценка по памяти ≠ проверенный запуск

Каталоги моделей, например YouRunAI, показывают варианты пакетов Qwen3.8-27B и оценки совместимости с оборудованием. Там именно оценка. В источнике прямо сказано: оценка соответствия памяти отличается от проверенной конфигурации запуска. Оценочные рейтинги называют свой пакет и допущения, а карточки со ссылкой только на источник не выдумывают вердикт по конкретному железу.

Проще говоря, каталог может показать, что модель помещается в память. Сколько токенов в секунду вы получите, он не скажет. Для читателя, который ищет «реальные замеры», разница принципиальная: поместиться в память и выдавать комфортную скорость - разные вещи. Оценки из каталога YouRunAI стоит читать с этой поправкой.

Как самостоятельно измерить производительность Qwen 3.8 27B на M5 Ultra

Если машина уже под рукой, свои цифры получить быстрее, чем ждать чужие. Методика простая, но требует дисциплины.

  1. Зафиксировать конфигурацию: чип, объём unified memory, версию macOS, версию Splash, пакет модели (Q4, Q8 или FP16).
  2. Выбрать метрики: TTFT, скорость prefill, скорость генерации, потребление памяти.
  3. Прогнать одинаковые промпты разной длины: короткий, средний, длинный контекст.
  4. Повторить прогон несколько раз и взять медиану, а не лучший результат.
  5. Проверить троттлинг: повторить замер после нескольких минут нагрузки и сравнить с холодным стартом.

Для сравнения с другими рантаймами те же промпты можно прогнать через MLX или llama.cpp. Тогда получите не абстрактное «быстро», а сопоставимые значения.

Ключевые метрики: TTFT, prefill и generation speed

Одна цифра в токенах в секунду без указания контекста почти ничего не значит. Смотреть нужно на три вещи.

  • TTFT (time to first token) - сколько ждать первого токена. Критично для интерактивной работы и агентных сценариев, где запросов много и они короткие.
  • Prefill (prompt processing) - скорость обработки входного контекста в токенах в секунду. Определяет комфорт работы с длинными промптами, документами и RAG.
  • Generation speed - скорость генерации токенов в секунду. От неё зависит, насколько ровно читается ответ в диалоге.

Для агентных нагрузок важнее prefill и TTFT: если система обрабатывает десятки тысяч токенов контекста на каждом шаге, время уходит именно там. Для диалога и генерации текста на первый план выходит generation speed. Чем prefill отличается от decode и какие данные нужны для честного сравнения, разобрано в материале про Qwen3.8-Next на Mac M5 Air и streaming-стек.

Как не обмануться собственными замерами

Типичные ловушки, из-за которых цифры перестают сравниваться с чужими:

  • разная длина контекста в промптах;
  • разные параметры сэмплирования: temperature, top_p, top_k;
  • холодный старт против прогретого кэша модели;
  • фоновые процессы и другой софт на машине;
  • троттлинг после нескольких минут непрерывной нагрузки;
  • другая версия Splash или модели.

Практическое правило: публикуйте замеры вместе с полной конфигурацией, версией рантайма и самими промптами. Тогда их можно перепроверить. Именно этого не хватает в обсуждении про M5 Ultra: есть вопрос, нет прогона с описанием условий.

Стоит ли ждать Splash на M5 Ultra или проверить альтернативы

Если M5 Ultra уже у вас: запускайте Qwen 3.8 27B через Splash и снимайте метрики по методике выше. Это даст ответ быстрее, чем ожидание чужого бенчмарка, и заодно покажет, раскрываются ли заявленные ускорения на вашем чипе.

Если только выбираете железо: не берите цифры M5 Max как гарантию. Они относятся к другому чипу, другой конфигурации памяти и, возможно, другой версии рантайма. Для сравнения прогоните те же промпты через MLX, llama.cpp и Ollama: разница между рантаймами на одной машине часто сопоставима с разницей между чипами. Как отделять заявленные цифры от подтверждённых, хорошо видно на примере разбора скорости Qwen3.8-Flash-Next на Apple Silicon.

Что проверить перед покупкой M5 Ultra под локальные LLM

  • Объём unified memory под нужный пакет: Q4, Q8 или FP16 плюс запас на контекст.
  • Наличие замеров именно вашей связки: модель, рантайм, чип. Замеры на M5 Max не заменяют замеров на M5 Ultra.
  • Поддержка рантайма на вашей версии macOS.
  • Тепловой режим корпуса: длинные прогоны греют сильнее коротких тестов.

Отдельно про лицензию: Qwen3.8-27B распространяется под Qwen Community License 1.0. Для локального запуска это не создаёт проблем, а при коммерческом использовании стоит прочитать условия, а не полагаться на общее впечатление «модель открытая».

Реальных замеров Qwen 3.8 27B на M5 Ultra через Splash в публичных источниках на сегодня нет. Есть цифры для M5 Max в блоге Splash и открытый вопрос в сообществе. Дальше всё решает либо собственный прогон, либо публикация кем-то из владельцев этого чипа. До этого момента переносить результаты Max на Ultra не стоит.

Подписаться на канал