Короткий ответ: цифры для Apple Silicon пока нельзя считать подтверждённым тестом
Заявления о скорости 45 tok/s на M4 Max и 25 tok/s на M2 Ultra для Qwen3.8-Flash-Next-oQ4e-mtp пока нельзя выдавать за подтверждённый бенчмарк. В доступных материалах нет прямого описания этой модели, методики замера или сопоставительного теста с Qwen3.8 27B.
Подтверждённого сравнения по качеству, скорости, расходу памяти и удобству ежедневной работы тоже нет. Поэтому приведённые 45 и 25 tok/s корректно называть заявленными показателями, которые требуют проверки на конкретных Mac и в одинаковом программном окружении.
Ниже разобраны доступные сведения, границы сравнения и методика самостоятельного теста. Это не отчёт о собственном запуске модели, а практическая рамка, которая помогает понять, какие данные нужны для честного вывода о локальном инференсе.
Что подтверждают доступные материалы
Подтверждённый контур информации пока узкий:
- Qwen3.8 27B упоминается в контексте запуска на Mac с конфигурациями, содержащими от 16 до 48 ГБ памяти. Этот диапазон описывает сценарий запуска, но не служит универсальной таблицей требований.
- Для Qwen3.8 27B есть отдельная жалоба на медленный tool calling в среде vllm-ascend. Это сведения о другом программно-аппаратном контексте, их нельзя переносить на Apple Silicon.
- Прямых подтверждений существования и характеристик Qwen3.8-Flash-Next-oQ4e-mtp в предоставленном наборе данных нет.
- Числа 45 tok/s на M4 Max и 25 tok/s на M2 Ultra в доступных материалах не подтверждены.
Из этих пунктов следует простой вывод: запуск Qwen3.8 27B на Mac подтверждает интерес к локальному сценарию, но ничего не доказывает о скорости Flash-Next-oQ4e-mtp.
Какие утверждения требуют первоисточника или воспроизводимого теста
Для публикации чисел как результата тестирования понадобятся минимум следующие подтверждения:
- точные значения 45 tok/s на M4 Max и 25 tok/s на M2 Ultra с описанием метода подсчёта;
- сравнение Qwen3.8-Flash-Next-oQ4e-mtp и Qwen3.8 27B на одинаковых промптах, контексте и настройках генерации;
- данные о качестве на типичных задачах: код, суммаризация, структурированный вывод и длинный контекст;
- измерения задержки первого токена, обработки входного промпта и полной длительности ответа;
- сведения о стабильности запуска, потреблении памяти и работе с инструментами.
До появления таких данных допустимы формулировки «заявлено», «по имеющемуся описанию» и «требует проверки». Формулировки «самая быстрая модель» или «доказанно быстрее Qwen3.8 27B» для этого набора данных слишком категоричны.
Qwen3.8-Flash-Next-oQ4e-mtp на Apple Silicon: что именно нужно сравнивать
Локальный инференс зависит от связки модели, файла весов, квантизации, объёма unified memory, runtime, backend, длины контекста и параметров генерации. Название модели само по себе не позволяет оценить скорость на конкретном Mac.
Почему Apple Silicon - отдельный сценарий локального инференса
В Mac с Apple Silicon модель и рабочие данные используют общую память системы. В ней размещаются веса, KV-cache, входной контекст, промежуточные буферы и процессы операционной системы. При росте контекста свободный запас сокращается, поэтому одинаковый файл может вести себя по-разному при коротком диалоге и при работе с большими документами.
На скорость влияет пропускная способность памяти. Во время генерации runtime регулярно обращается к весам модели, и задержка зависит от того, как конкретный backend организует эти обращения. Квантизация уменьшает объём данных, но меняет требования к поддержке формата и может влиять на качество.
Сравнение M4 Max и M2 Ultra требует одинакового runtime или чёткого объяснения, почему используются разные backend. Версия macOS, фоновые процессы, нагрев и выбранный режим памяти тоже способны менять результат. Переносить показатели с NVIDIA GPU, Ascend или другой платформы на Mac без повторного замера нельзя.
Qwen3.8-Flash-Next-oQ4e-mtp и Qwen3.8 27B: границы корректного сравнения
У двух моделей нужно сопоставлять несколько характеристик одновременно. Пиковая скорость decode отвечает лишь на один вопрос: сколько токенов в секунду система генерирует после начала вывода.
| Критерий | Что сравнивать | Почему это важно |
|---|---|---|
| Скорость | Prefill, decode, задержка первого токена и полная длительность ответа | Показывает отзывчивость как коротких, так и длинных запросов |
| Качество | Код, суммаризация, рассуждения и структурированный вывод | Быстрый ответ бесполезен, если он чаще ошибается на нужных задачах |
| Память | Размер файла, KV-cache и пиковое потребление памяти | Определяет, помещается ли модель вместе с контекстом и приложениями |
| Стабильность | Повторные запросы, длинные сессии и продолжительная нагрузка | Выявляет сбои, перегрев и падение скорости |
| Инструменты | Формат вызова, корректность аргументов и полный цикл tool calling | Чатовая скорость не описывает работу локального агента |
| Удобство | Поддержка runtime, формат модели и настройка сервера | Снижает время, которое уходит на запуск и диагностику |
При выборе квантизации Qwen3.8-27B MTP полезно учитывать размер весов, запас памяти и ожидаемое качество. Практический разбор вариантов oQ3e, oQ4e, oQ6e и oQ8e собран в статье о выборе квантизации Qwen3.8-27B MTP. Эти сведения помогают спланировать тест, но не заменяют замер Flash-Next-oQ4e-mtp.
45 tok/s на M4 Max и 25 tok/s на M2 Ultra: как читать заявленные показатели
Что означает tok/s в тесте языковой модели
tok/s обычно показывает количество токенов, которые модель генерирует за секунду после начала вывода. Токен может быть частью слова, целым коротким словом или знаком пунктуации, поэтому 45 токенов не равны 45 словам.
До генерации приложение обрабатывает входной промпт. Этот этап называют prefill или prompt processing. Затем начинается decode, когда модель последовательно создаёт токены ответа. Длинный промпт может увеличить время до первого токена, даже если последующий decode идёт быстро.
Пользователь воспринимает скорость как сочетание нескольких задержек: время загрузки модели, обработка контекста, задержка первого токена, потоковая выдача и время завершения ответа. Для короткого запроса важен быстрый первый вывод. Для большого документа существенную долю времени занимает prefill.
Разница между prefill и decode подробно разобрана в материале о поведении Qwen3.8-Next на Mac в streaming-стеке: как читать эти две метрики при локальном запуске.
Каких данных не хватает для честного сравнения M4 Max и M2 Ultra
Двух чисел недостаточно, чтобы определить преимущество одного Mac или одной модели. Для воспроизводимого замера нужно зафиксировать:
- точную конфигурацию M4 Max и M2 Ultra, включая объём unified memory;
- версию файла модели, формат весов и уровень квантизации oQ4e;
- runtime, backend и их версии;
- размер контекста, длину входного промпта и ожидаемый размер ответа;
- параметры sampling, включая temperature, top-p и ограничения на длину генерации, если они использовались;
- число прогревов перед замером и число повторов;
- критерий подсчёта токенов: весь ответ, только decode или отдельный участок после стабилизации скорости;
- состояние системы, наличие фоновых процессов и режим нагрузки.
Без этих параметров нельзя надёжно сопоставить даже 45 и 25 tok/s между собой. Тем более нельзя использовать их для вывода о превосходстве Qwen3.8-Flash-Next-oQ4e-mtp над Qwen3.8 27B.
Почему высокий throughput не гарантирует лучшего пользовательского опыта
Высокий throughput полезен, когда модель уже загрузилась, промпт короткий, ответ генерируется непрерывно, а качество соответствует задаче. В реальном приложении условия меняются.
- Большой контекст увеличивает время обработки входных данных и расход KV-cache.
- RAG добавляет к запросу найденные фрагменты, иногда на порядок увеличивая длину промпта.
- При потоковой выдаче важна задержка первого токена, а не только среднее число токенов в секунду.
- Параллельные запросы делят память и вычислительные ресурсы, поэтому индивидуальная скорость может снизиться.
- Вызов инструмента добавляет сетевой или локальный процесс, парсинг аргументов и новый проход модели.
- При продолжительной нагрузке нагрев и ограничения системы могут изменить скорость после первых запросов.
Даже подтверждённые 45 tok/s описывали бы конкретный режим генерации. Для вывода о повседневной работе нужны полная задержка ответа, качество и стабильность.
Qwen3.8 27B на Mac: что известно о запуске и чего нельзя утверждать
Диапазон 16-48 ГБ: как правильно его интерпретировать
Qwen3.8 27B упоминается как модель, которую запускают на Mac с конфигурациями, содержащими 16, 24, 32 или 48 ГБ памяти. В доступном описании это выглядит как диапазон возможных сценариев, а не как независимая таблица минимальных требований для каждого режима.
Фактическая пригодность конфигурации зависит от формата файла, уровня квантизации, размера контекста, runtime и числа параллельных запросов. Часть памяти нужна операционной системе и другим процессам. При ограниченном запасе модель может загрузиться, но длинный контекст или несколько запросов подряд приведут к замедлению или ошибке нехватки памяти.
Упоминание 16-48 ГБ нельзя превращать в рекомендацию по покупке Mac. Оно показывает, что локальный запуск Qwen3.8 27B рассматривают в широком диапазоне конфигураций, но не описывает одинаковую скорость и качество на каждом устройстве.
Для выбора программного окружения пригодится сравнение инструментов локального запуска Qwen3.8-27B, где отдельно рассматриваются Ollama, MLX, vLLM и SGLang. При переносе выводов на Flash-Next нужно проверить совместимость конкретного файла и backend.
Почему запуск Qwen3.8 27B ещё не доказывает сопоставимую производительность
Факт загрузки модели отвечает на вопрос о совместимости памяти и runtime. Он не отвечает на вопрос, насколько комфортно пользоваться моделью каждый день.
Для прямого сравнения с Qwen3.8-Flash-Next-oQ4e-mtp нужно измерить:
- скорость обработки промпта;
- время до первого токена;
- скорость decode;
- полную задержку ответа;
- потребление памяти при коротком и длинном контексте;
- стабильность после серии запросов;
- качество на одинаковом наборе задач;
- корректность структурированного вывода и tool calling, если модель нужна для агента.
Прямого подтверждённого сравнения Qwen3.8 27B и Flash-Next-oQ4e-mtp по этим параметрам в доступных данных нет. Поэтому слово «сопоставимая» пока описывает гипотезу, а не результат измерения.
Tool calling и локальные агенты: отдельная проверка, а не бонус к скорости
Почему скорость вызова инструментов отличается от скорости генерации
Агентский цикл состоит из нескольких этапов, и только один из них связан с tok/s:
- Модель генерирует запрос к инструменту и его аргументы.
- Приложение разбирает ответ и проверяет формат.
- Клиент передаёт вызов нужному инструменту.
- Инструмент выполняет действие и возвращает результат.
- Модель получает результат, читает обновлённый контекст и создаёт следующий ответ.
Медленная работа может возникнуть на любом этапе. Быстрый decode не компенсирует долгую обработку инструмента, ошибки формата или повторный запуск модели на большой истории.
В доступных материалах упоминается жалоба на медленный tool calling у Qwen3.8-27B в vllm-ascend. vllm-ascend и Apple Silicon используют разные программно-аппаратные условия, поэтому этот случай нельзя считать тестом на Mac. Он показывает, что скорость инструментов нужно проверять отдельно.
Что проверять перед использованием модели в агентском сценарии
- Корректно ли модель формирует JSON или другой формат, который ожидает приложение.
- Сохраняется ли схема аргументов при длинном контексте.
- Как система обрабатывает отсутствующие, лишние и неверные параметры.
- Как модель ведёт себя при повторном вызове одного инструмента.
- Сколько времени занимает полный цикл от запроса пользователя до итогового ответа.
- Что происходит после ошибки инструмента или пустого результата.
- Меняется ли скорость после серии последовательных вызовов.
Для локального агента полезнее измерить пять или десять полных циклов на типовых задачах, чем фиксировать один высокий показатель decode. Поддержка tool calling должна подтверждаться документацией модели и тестом конкретного runtime.
Кому может подойти Qwen3.8-Flash-Next-oQ4e-mtp на Mac
Пользователи Mac, которым важна скорость локальных ответов
Модель потенциально интересна владельцам Mac, которые хотят уменьшить задержку локального чата, генерации текста или простых рабочих запросов. Заявленные 45 tok/s на M4 Max и 25 tok/s на M2 Ultra выглядят как повод для проверки, но не как основание менять рабочую конфигурацию.
Перед переходом нужно убедиться, что конкретный файл запускается в выбранном runtime, помещается вместе с нужным контекстом и сохраняет приемлемое качество. Для коротких ответов измеряйте задержку первого токена. Для больших документов добавляйте prefill и полное время ответа.
Разработчики и энтузиасты, сравнивающие скорость с качеством
Этой аудитории полезно провести парное сравнение Qwen3.8-Flash-Next-oQ4e-mtp и Qwen3.8 27B на одинаковых задачах:
- написание и исправление кода;
- суммаризация технических документов;
- извлечение данных в заданную JSON-схему;
- ответы на вопросы по длинному контексту;
- многошаговые запросы с инструментами.
Результаты качества нельзя заранее приписывать ни одной из моделей. Их нужно фиксировать рядом со скоростью, памятью и ошибками формата. Такой подход показывает реальный компромисс, а не выбирает победителя по одному числу.
Кому пока недостаточно доступных данных
Осторожный подход нужен тем, кому требуются подтверждённые требования к памяти, стабильный backend и предсказуемое качество. Это касается локальных сервисов, агентских систем, рабочих процессов с длинным контекстом и приложений, где ошибки структурированного вывода дорого обходятся.
Двух неподтверждённых чисел недостаточно и для выбора железа. Сначала нужны файл модели, методика теста, результаты на нужных задачах и данные о поведении при продолжительной нагрузке.
Как проверить Qwen3.8-Flash-Next на Apple Silicon самостоятельно
Зафиксировать одинаковые условия для M4 Max, M2 Ultra и Qwen3.8 27B
Сравнение нужно начинать с описания окружения. Для каждого прогона зафиксируйте:
- точную модель Mac, чип и объём unified memory;
- версию операционной системы;
- runtime, backend и их версии;
- конкретный файл модели, формат весов и квантизацию;
- размер контекста и параметры KV-cache, если runtime их предоставляет;
- одинаковый промпт, длину входа и ограничение длины ответа;
- параметры sampling;
- число прогревов, повторов и правило усреднения;
- состояние фоновых процессов и длительность нагрузки.
Для Qwen3.8-Flash-Next и Qwen3.8 27B нужно явно указать, совпадает ли уровень квантизации. Разные форматы могут давать разное качество и разную нагрузку на память, поэтому скрывать это различие нельзя.
Совместимые форматы, команды запуска и требования к runtime нужно брать из официальной документации или репозитория конкретной модели. В предоставленных данных таких инструкций нет, поэтому универсальную команду для запуска придумывать нельзя.
Измерить не только tok/s
| Метрика | Что измеряет |
|---|---|
| Задержка первого токена | Время от отправки запроса до начала вывода |
| Prompt processing или prefill | Скорость обработки входного текста |
| Decode, tok/s | Скорость последовательной генерации ответа |
| Полная задержка | Время от запроса до последнего токена |
| Пиковое потребление памяти | Запас для контекста, приложений и параллельных запросов |
| Длинный контекст | Изменение скорости, качества и стабильности при росте входного текста |
| Качество | Ошибки в коде, суммаризации, фактах и структурированном выводе |
| Полный цикл tool calling | Время от запроса пользователя до результата с учётом инструмента |
Минимальный набор задач должен содержать короткий чат, длинный промпт, генерацию кода, суммаризацию и структурированный ответ. Для агента добавьте вызов инструмента с корректными и ошибочными аргументами.
Опубликовать ограничения теста вместе с результатами
Проверяемый бенчмарк должен содержать точные устройства, объём памяти, версии программ, имя и формат файла модели, уровень квантизации, контекст, промпты, параметры sampling, число прогревов и повторов. Для каждой метрики укажите среднее значение и разброс, если замеров достаточно.
Отдельно опишите термальное состояние и длительность прогона. Первые секунды после загрузки могут отличаться от работы после нескольких последовательных запросов.
Результат на одном M4 Max или одном M2 Ultra не описывает все устройства Apple Silicon. Различия в памяти, охлаждении, runtime и версии backend способны изменить итоговую скорость и стабильность.
Вывод: интересный сценарий для локального инференса, но не подтверждённый рекорд
Qwen3.8-Flash-Next-oQ4e-mtp представляет интерес для владельцев Mac, которым нужна быстрая локальная генерация и удобный компромисс между скоростью, качеством и расходом памяти. Однако по состоянию на 6 сентября 2026 года доступные материалы не подтверждают ни саму модель в заявленном контексте, ни 45 tok/s на M4 Max, ни 25 tok/s на M2 Ultra.
Нет и проверяемого сопоставления с Qwen3.8 27B по качеству, памяти, decode, prefill или tool calling. Упоминание запуска Qwen3.8 27B на Mac в конфигурациях 16-48 ГБ помогает обозначить интерес к платформе, но не заменяет прямой тест.
Практический вывод прост: используйте заявленные цифры как повод для воспроизводимой проверки. Перед миграцией сравните одинаковые промпты, файл и квантизацию, измерьте задержку первого токена, prefill, decode, полное время ответа, память, качество и полный цикл работы инструментов.