Перейти к содержанию
Публикация AiManual

Qwen3.8-Next на Mac M5 Air: как MoE-модель ведет себя в streaming-стеке

Разбираем, что можно ожидать от Qwen3.8-Next на Mac M5 Air: как MoE и 3-bit-квантизация соотносятся с плотной 27B-моделью в 4-bit, чем отличаются prefill и deco

Коротко

Что будет в материале

  1. 01

    Qwen3.8-Next на Mac M5 Air: какой вывод можно сделать сразу

  2. 02

    Что известно о Qwen3.8-Next и почему здесь важна MoE-архитектура

  3. 03

    Qwen3.8-Next streaming стек: что именно измерять

  4. 04

    Сравнение с плотной 27B-моделью: где MoE может выиграть, а где вывод условен

Qwen3.8-Next на Mac M5 Air: какой вывод можно сделать сразу

Qwen3.8-Next имеет практический смысл для локального запуска на Mac M5 Air, если пользователю важны экономия памяти, потоковая генерация и работа без облачного API. Сочетание MoE-архитектуры и 3-bit-квантизации потенциально снижает нагрузку на память и вычислительные блоки, однако итоговая скорость зависит от runtime, backend, формата модели и длины контекста.

Сравнение с плотной 27B-моделью в 4-bit нельзя сводить к одной цифре токенов в секунду. Для корректного вывода нужны отдельные значения prefill, decode, задержки первого токена, пикового потребления памяти и поведения системы при длительной генерации. Подтвержденных замеров именно Qwen3.8-Next на конкретной конфигурации Mac M5 Air в доступных материалах нет, поэтому ниже разобраны методика, возможные преимущества и границы такого сравнения.

Кому вообще нужен такой тест

Тест интересен пользователям, которые хотят запускать LLM локально на ноутбуке с Apple Silicon. Типичные задачи включают интерактивный чат, редактирование кода, суммаризацию документов, работу с локальной базой знаний и прототипирование AI-инструментов.

У MacBook Air есть очевидное ограничение: запас памяти и возможности охлаждения зависят от конкретной конфигурации и длительности нагрузки. Модель, которая быстро отвечает в коротком запросе, может заметно замедлиться при большом контексте или продолжительной генерации. Поэтому сравнение Qwen3.8-Next с плотной 27B нужно проводить как проверку конкретного рабочего сценария.

Главный тезис: смотреть нужно на профиль нагрузки

Одна скорость генерации описывает только часть пользовательского опыта. Для короткого чата важна задержка до первого токена и стабильный decode. Для анализа длинного документа на первый план выходит prefill. Для многочасовой сессии добавляются расход KV-cache, температура устройства, свободная единая память и возможный троттлинг.

Практический вывод зависит от задачи:

  • короткие вопросы требуют низкой задержки первого токена и равномерного streaming;
  • длинные документы требуют быстрого prefill и достаточного запаса памяти под KV-cache;
  • генерация кода зависит от decode, качества инструкций и длины контекста;
  • длительная работа требует замеров скорости через 10, 20 и 30 минут, а не одного короткого прогона.

Что известно о Qwen3.8-Next и почему здесь важна MoE-архитектура

В рамках доступных данных нет подтвержденных характеристик Qwen3.8-Next: общего числа параметров, количества активных параметров, поддерживаемых форматов, размера контекста и конкретного streaming-стека. Эти значения нужно получить из карточки модели и репозитория runtime перед публикацией числового бенчмарка.

Рабочая гипотеза теста понятна: сравниваются MoE-модель в 3-bit и плотная 27B-модель в 4-bit на одном Mac M5 Air. Такой эксперимент может показать разницу между экономией на активных вычислениях и фактической стоимостью хранения весов, работы runtime и обслуживания контекста.

MoE против плотной модели: что меняется в вычислениях

Плотная модель использует все свои параметры при обработке каждого токена. В MoE-модели есть несколько экспертных блоков, а маршрутизатор выбирает часть из них для конкретного токена. Поэтому у MoE нужно различать два числа: общий объем параметров и объем активных параметров.

Активные параметры влияют на вычисления для отдельного токена. Общий объем параметров влияет на размер файла, требования к памяти и загрузку весов. Меньшее число активных параметров не означает, что вся модель автоматически поместится в небольшой объем RAM.

В streaming-режиме MoE может выиграть на decode, если backend эффективно обрабатывает маршрутизацию экспертов и не создает лишних обращений к памяти. При слабой поддержке архитектуры накладные расходы runtime способны сократить преимущество. Результат определяется конкретной реализацией, а не одним названием архитектуры.

Практические примеры MoE-моделей с разницей между общим и активным размером разобраны в материале о Macaron-V1 на Qwen3.6-35B-A3B. Эти результаты нельзя переносить на Qwen3.8-Next, поскольку отличаются модель, железо, формат и runtime.

Почему 3-bit не равен просто «меньше памяти»

При одинаковом числе параметров идеальная упаковка 3-bit требует примерно на четверть меньше места под веса, чем 4-bit: 3 бита против 4 на параметр. В реальном файле присутствуют scale, metadata, служебные буферы и выравнивание, поэтому итоговая разница зависит от формата квантизации.

У 3-bit есть цена. Более агрессивное округление может сильнее повлиять на ответы, особенно в задачах с кодом, точным следованием инструкциям и длинной цепочкой рассуждений. Эффект нельзя оценить по размеру файла. Нужны одинаковые задания, одинаковые параметры генерации и слепое сравнение ответов.

Совместимость с backend тоже влияет на скорость. Формат может занимать меньше диска, но работать медленнее, если runtime деквантизирует веса неудобным способом или не использует оптимизированные ядра Apple Silicon. Поэтому вопрос «что быстрее, 3-bit или 4-bit» не имеет универсального ответа.

Qwen3.8-Next streaming стек: что именно измерять

Для сравнения нужно зафиксировать модель, квантизацию, runtime, backend и параметры контекста. На Mac M5 Air дополнительно следует указать объем единой памяти, версию macOS, состояние фоновых приложений и способ измерения скорости.

Prefill: скорость обработки входного контекста

Prefill, это этап, на котором модель читает входной запрос. Она обрабатывает системную инструкцию, историю диалога, приложенный документ или найденные фрагменты RAG до начала последовательной генерации.

Для prefill нужно записывать:

  • число входных токенов;
  • время обработки контекста;
  • скорость в токенах в секунду;
  • задержку до появления первого выходного токена;
  • пиковый расход памяти во время загрузки и обработки запроса.

Короткий запрос на 100-300 токенов и документ на 8 000-16 000 токенов создают разную нагрузку. Средняя скорость короткого prefill не позволяет предсказать, сколько пользователь будет ждать ответа после загрузки большого файла.

Decode: скорость последовательной генерации

Decode начинается после обработки входного контекста. Модель генерирует токены последовательно, каждый следующий токен зависит от уже полученных. В этот момент на ощущение плавности влияют активные параметры MoE-модели, пропускная способность памяти, KV-cache и оптимизация backend.

В таблице бенчмарка decode нужно указывать среднее значение после прогрева и разброс между прогонами. Один короткий ответ может скрыть паузы, которые появятся в длинной сессии. Для практической оценки полезно отдельно измерять ответы на 128, 512 и 2 048 выходных токенов, если runtime позволяет повторить такие сценарии.

Какие метрики нельзя смешивать

МетрикаЧто показываетГде особенно важна
Задержка первого токенаВремя до начала ответаЧат и интерактивные команды
Prefill throughputСкорость обработки входных токеновДокументы, RAG, длинная история
Decode throughputСкорость последовательной генерацииКод, ответы и потоковый вывод
Полное время ответаВремя от отправки запроса до конца генерацииСравнение реальных сценариев
Пиковая памятьМаксимальный расход единой памятиОценка стабильности запуска

Удобный интерфейс streaming может скрыть высокую задержку первого токена, если приложение показывает индикатор загрузки. И наоборот, высокий decode не компенсирует долгую подготовку контекста. В отчете эти значения нужно показывать отдельными строками.

Сравнение с плотной 27B-моделью: где MoE может выиграть, а где вывод условен

Память: размер файла, рабочая память и KV-cache

Локальный запуск расходует память по нескольким направлениям:

  • веса модели и служебные данные квантизации;
  • буферы runtime и backend;
  • KV-cache для истории и текущего контекста;
  • память операционной системы и фоновых приложений.

Размер файла на диске показывает только часть картины. Модель может занимать условные X гигабайт в хранилище, но потребовать больше памяти после распаковки, создания буферов и запуска контекста. Для Mac с единой памятью этот запас делят CPU, GPU, Neural Engine, приложения и сама модель.

При длинной истории KV-cache растет вместе с количеством обработанных токенов. Точный расход зависит от архитектуры, числа слоев, размера скрытого состояния, типа KV-cache и настроек runtime. Без этих параметров нельзя честно назвать минимальный объем памяти для Qwen3.8-Next.

Prefill и длинный контекст

MoE-модель может выглядеть привлекательно в сценарии с большим входным контекстом благодаря меньшему числу активных параметров на токен. Это лишь гипотеза до появления замеров. На prefill влияет параллельная обработка входа, а эффективность конкретной реализации может отличаться от поведения на decode.

Для теста нужны как минимум три длины контекста: короткий запрос, средний диалог и длинный документ. Одинаковый текст следует подавать обеим моделям в одинаковом формате. Системные инструкции, шаблон чата и способ добавления документов должны совпадать.

Decode и потоковая генерация

В обычном чате пользователь оценивает не пиковый результат, а сочетание нескольких параметров: когда появился первый токен, насколько ровно идет поток и возникают ли паузы между фрагментами. Модель с более высоким средним decode может ощущаться медленнее, если runtime периодически задерживает выдачу.

На итог влияют temperature, top-p, top-k, максимальная длина ответа, наличие reasoning-режима и формат вывода. Эти параметры нужно зафиксировать. Сравнение с разными настройками sampling измеряет разные продукты, а не две модели на одной задаче.

Что означает «выгоднее» в этом сравнении

Практическая выгода состоит из пяти компонентов: модель помещается в доступную память, быстро начинает отвечать, поддерживает приемлемый decode, сохраняет нужное качество и стабильно работает длительное время.

Qwen3.8-Next может оказаться рациональнее плотной 27B-модели для короткого локального чата, если 3-bit-формат поддерживается без заметных потерь скорости и качества. Плотная 27B может быть удобнее при наличии зрелого backend, предсказуемой совместимости или более стабильного качества на нужных задачах. Такой вывод требует измерений, а не следует из обозначений MoE и 3-bit.

Связь скорости с энергопотреблением разобрана в статье об экономике инференса LLM на Apple Silicon. Там отдельно показано, почему стоимость генерации нельзя оценивать только по числу параметров.

Как факторы Apple Silicon меняют локальный запуск

Единая память и отсутствие отдельной VRAM

Mac использует единую память, поэтому модель конкурирует за общий ресурс с операционной системой и приложениями. Свободный объем перед запуском не равен гарантированному объему, доступному runtime после загрузки весов и создания KV-cache.

Перед тестом нужно закрыть лишние приложения, записать свободную память и повторить замер в одинаковых условиях. Разница в браузере с несколькими вкладками или запущенной IDE может изменить поведение системы при больших контекстах.

На результат влияют пропускная способность памяти, поддержка Metal или другого API конкретным backend, способ хранения квантизованных весов и наличие оптимизированных ядер. Одинаковая модель в двух runtime может показывать разную скорость даже на одном Mac.

Ограничения программной поддержки Apple M5 для низкоразрядных форматов и prefill разобраны в материале о режимах вычислений на чипах Apple M5.

Длительная генерация и стабильность скорости

MacBook Air не стоит оценивать по одному пиковому прогону. Длительная нагрузка может изменить частоту чипа, температуру корпуса и доступный бюджет мощности. Для честного отчета нужно запускать длинную генерацию и записывать скорость через равные интервалы.

Минимальный набор наблюдений:

  • температура или косвенный признак снижения частоты, если система его предоставляет;
  • скорость decode в начале и конце прогона;
  • изменение занятой памяти;
  • появление пауз, ошибок или перезапуска backend;
  • состояние ноутбука: питание от батареи или адаптера.

Без длительного прогона корректно говорить только о кратковременной производительности. Поведение конкретной конфигурации M5 Air и ее температурные показатели нужно подтверждать отдельным тестом.

Для каких задач Qwen3.8-Next на Mac выглядит наиболее оправданной

Чат и интерактивные ответы

Для локального чата важны задержка первого токена и стабильный decode. Пользователь быстро замечает паузу перед началом ответа, а затем оценивает равномерность потока. Среднее значение токенов в секунду полезно, но оно не описывает весь диалог.

Тестировать следует короткие вопросы, уточняющие реплики и многошаговый диалог с растущей историей. Отдельная проверка нужна для режима с отключенным reasoning, если такая настройка поддерживается моделью и runtime.

Код и технические тексты

При генерации кода важны качество следования формату, способность учитывать несколько файлов и скорость выдачи больших фрагментов. Плотность модели и квантизация влияют на результат, но оценивать их нужно на одинаковых задачах: исправление ошибки, написание функции, рефакторинг и объяснение существующего кода.

Для технических текстов полезно проверять сохранение терминов, структуру ответа и работу с ограничениями. Один удачный пример не подтверждает общее качество модели. Нужна серия однотипных заданий с одинаковыми инструкциями.

Документы и локальный RAG

В RAG-сценариях модель получает найденные фрагменты вместе с вопросом. Здесь prefill может быть важнее decode, особенно если retrieval-слой возвращает большой объем текста. На результат влияют размер чанков, качество эмбеддингов, алгоритм поиска и шаблон промпта.

Qwen3.8-Next имеет смысл проверять на суммаризации, поиске фактов внутри документов и сравнении нескольких фрагментов. Отдельно нужно следить за KV-cache: длинная история и крупные вставки уменьшают запас единой памяти.

Ограничения сравнения и как читать результаты без лишних выводов

Почему 3-bit против 4-bit не является честным качественным тестом

Такое сравнение одновременно оценивает архитектуру, разрядность, формат файла, реализацию backend и настройки запуска. Если Qwen3.8-Next окажется быстрее или экономнее, это не докажет общее превосходство всех MoE-моделей над плотными моделями.

Корректная формулировка звучит конкретнее: «эта конфигурация Qwen3.8-Next в 3-bit показала такой-то результат на этом Mac и в этом runtime». Для сравнения качества нужны одинаковые задания, одинаковые ограничения на ответ и независимая проверка фактических ошибок.

Каких данных не хватает для полноценного вывода

Перед публикацией числовых результатов нужно добавить:

  • точную модель Mac M5 Air и объем единой памяти;
  • версию macOS, runtime и backend;
  • названия и контрольные суммы файлов моделей;
  • форматы квантизации и размер контекста;
  • результаты prefill и decode на нескольких длинах входа;
  • пиковый расход памяти и длительность каждого прогона;
  • температуру, режим питания и состояние фоновых процессов;
  • одинаковые задания для проверки качества ответов.

Пока эти сведения отсутствуют, статья может объяснить методику и критерии выбора, но не должна объявлять победителя или приписывать Qwen3.8-Next конкретные показатели.

Сравнение доступных инструментов для запуска Qwen3.8-27B в локальном режиме помогает увидеть, насколько сильно результат зависит от Ollama, MLX, vLLM, SGLang и MTP-подходов: обзор runtime для Qwen3.8-27B.

Qwen3.8-Next локальный запуск: практический чек-лист

Что проверить до загрузки модели

  1. Уточнить точную архитектуру модели, общий объем параметров и количество активных параметров.
  2. Проверить, поддерживает ли выбранный runtime MoE-маршрутизацию и нужный 3-bit-формат.
  3. Сопоставить размер весов с доступной единой памятью, оставив запас для runtime, системы и KV-cache.
  4. Уточнить допустимый размер контекста и реальный расход памяти на выбранной длине.
  5. Проверить, поддерживает ли backend streaming без дополнительных ограничений.
  6. Подготовить одинаковые промпты для короткого чата, длинного контекста и генерации кода.

Какие настройки фиксировать для повторяемого результата

  • версию runtime и backend;
  • формат и разрядность модели;
  • размер контекста;
  • temperature, top-p, top-k и максимальную длину ответа;
  • режим reasoning, если он доступен;
  • число прогревочных запусков;
  • длину входа и выхода в токенах;
  • режим питания и состояние фоновых приложений;
  • способ расчета prefill, decode и задержки первого токена.

Команды запуска нельзя добавлять без подтвержденного runtime и формата файла. У разных стеков отличаются параметры, шаблоны чата и способы вывода статистики. Ошибка в одной настройке способна превратить сравнение моделей в сравнение двух разных режимов работы.

Итог: когда выбор Qwen3.8-Next имеет смысл

Qwen3.8-Next стоит рассматривать для локального запуска на Mac M5 Air, если подтверждены совместимость выбранного backend, работоспособность 3-bit-формата и приемлемый расход единой памяти. Потенциальное преимущество MoE связано с меньшим числом активных вычислений, а не с автоматическим уменьшением полного размера модели.

Плотная 27B-модель остается рациональным выбором, если для нее лучше поддержка runtime, предсказуемее скорость, выше качество на нужных задачах или проще настройка. Разная квантизация делает сравнение прикладным, но ограничивает силу общих выводов.

Короткая матрица выбора

КритерийQwen3.8-Next, MoE 3-bitПлотная 27B, 4-bit
Расход памяти под весаПотенциально ниже за счет 3-bit, точное значение нужно измеритьЗависит от формата 4-bit и служебных данных
Активные вычисленияЗависят от числа активных экспертовИспользуется плотная архитектура
PrefillНужны замеры на коротком и длинном контекстеНужны замеры в том же runtime
DecodeЗависит от маршрутизации и поддержки backendМожет быть предсказуемее при зрелой реализации
КачествоНельзя оценить без одинаковых заданийНельзя считать эталоном без конкретных тестов
Длительная работаНужен отдельный тест на память и троттлингНужен такой же длительный тест

Для выбора модели на 2026 год достаточно начать с собственного профиля нагрузки. Если главная задача, локальный чат с умеренным контекстом, измеряйте задержку первого токена и decode. Для документов и RAG добавьте prefill и KV-cache. Для постоянной генерации кода проверьте качество, равномерность streaming и скорость после длительного прогрева.

Практический результат должен описывать конкретную связку «модель, квантизация, Mac, runtime и задача». Без этой связки цифры легко превращаются в красивый, но мало полезный рейтинг.

Подписаться на канал