Qwen 3.8 27B в 2026 году закрепилась как одна из самых востребованных моделей для локального кодинга. Модель сильна в генерации кода, но требовательна к железу и харнессу запуска. Правильный выбор инструмента напрямую определяет, получите ли вы 38 токенов в секунду или 5, столкнетесь ли с бесконечным повторением фразы или получите чистый вывод. Основные варианты: Ollama, MLX, vLLM и SGLang. Сообщество уже провело серию тестов и обсуждений - цифры ниже взяты из них.
Короткий ответ: на Apple Silicon выбирайте MLX, на NVIDIA GPU - vLLM. Ollama подойдет для быстрых экспериментов без тонкой настройки. SGLang пока используйте с осторожностью из-за известного бага с FP8-квантизацией. Ниже разберем, почему это так, и какие цифры стоят за этими рекомендациями.
Сводная таблица: Ollama, MLX, vLLM и SGLang для Qwen 3.8 27B
Инструмент, платформа, скорость по данным сообщества и ключевое ограничение - в одном месте. Абсолютные значения tok/s приведены только там, где их публиковало сообщество: для vLLM и SGLang в этом сравнении отдельных цифр нет, движки оценивались по стабильности вывода на GPU.
| Инструмент | Платформа | Скорость и стабильность | Ключевое ограничение |
|---|---|---|---|
| Ollama | macOS, Linux, Windows | 11.78 tok/s на GGUF q4_K_M; 5.14 tok/s при MTP-драфтах | Нет тонкого контроля батчинга и памяти, слабая скорость на Apple Silicon |
| MLX | Apple Silicon (чипы M-серии) | 38.36 tok/s на предсказуемом контенте, 20.26 tok/s на непредсказуемом | Работает только на Mac, вне Apple Silicon неприменим |
| vLLM | NVIDIA GPU | Стабильный вывод с FP8, зацикливания нет | Требует GPU и настройки сервера |
| SGLang | NVIDIA GPU | По скорости сопоставим с vLLM | Баг FP8: зацикливание на unsloth/Qwen3.8-27B-NVFP4 (статус на август 2026) |
Если вы еще не определились с моделью, посмотрите разбор Qwen против конкурентов, где Qwen 3.6 27B сравнивается с Llama, DeepSeek и Mistral по бенчмаркам и скорости на реальном железе.
Ключевые игроки: обзор инструментов для локального запуска
Четыре харнесса закрывают почти все сценарии локального инференса Qwen 3.8 27B. Они различаются архитектурой, платформами и уровнем сложности настройки. Разберем каждый по фактам.
Ollama: простота и удобство
Ollama остается самым простым способом запустить Qwen 3.8 27B локально. Установка сводится к одной команде, модель подтягивается из реестра готовых сборок. Поддерживаются GGUF-квантизации, включая q4_K_M и MTP-варианты. Для быстрых тестов и прототипов этого достаточно.
Ограничение проявляется под нагрузкой. На Apple Silicon GGUF q4_K_M без MTP выдает 11.78 tok/s, а MTP-версия при отклонении драфтов падает до 5.14 tok/s. Для фонового ассистента это терпимо, для активной работы с кодом - уже нет. Ollama не дает тонкого контроля над батчингом и распределением памяти, поэтому в production-сценариях уступает специализированным движкам.
Где именно удобство оборачивается компромиссом по качеству и контролю, разобрано в отдельном материале о плюсах и минусах Ollama.
MLX: оптимизация для Apple Silicon
MLX - фреймворк от Apple, созданный под чипы M-серии. Он использует unified memory напрямую, без лишних копирований между CPU и GPU. Для Qwen 3.8 27B это дает решающее преимущество на Mac.
Тесты сообщества показывают: MLX nvfp4 с MTP достигает 38.36 tok/s на предсказуемом контенте и 20.26 tok/s на непредсказуемом. Это лучший результат среди всех протестированных харнессов на Apple Silicon. MLX также поддерживает vision-модальность модели, что расширяет сценарии использования за пределы чистого кодинга. Если вы работаете на Mac, альтернативы практически нет.
vLLM: высокопроизводительный инференс на GPU
vLLM построен вокруг PagedAttention и continuous batching. Это позволяет эффективно обслуживать множественные запросы и выжимать максимум из NVIDIA GPU. Для Qwen 3.8 27B vLLM поддерживает FP8-квантизацию и корректно обрабатывает lm_head, что подтверждено исправлениями в кодовой базе.
На практике vLLM показывает стабильную генерацию без деградации качества: зацикливания, которое ловится в SGLang на FP8, здесь нет. Это основной выбор для тех, кто разворачивает модель на сервере или рабочей станции с GPU и планирует использовать ее как постоянный кодинг-ассистент. Пример развертывания с конкретными настройками - запуск Qwen 3 27B INT4 через vLLM на RTX 3090 с контекстом 144K.
SGLang: гибкость и скорость, но с оговорками
SGLang предлагает RadixAttention и ряд оптимизаций для сложных пайплайнов. По скорости на GPU он конкурирует с vLLM. Проблема в другом: в текущей версии SGLang есть баг с FP8-квантизацией. При использовании unsloth/Qwen3.8-27B-NVFP4 модель начинает бесконечно повторять одну фразу, например «need analysis there need analysis there...». vLLM эту проблему уже исправил, SGLang на август 2026 - еще нет. Статус фикса стоит проверять в актуальном релизе: дата в статье - это точка отсчета, а не гарантия, что баг жив до сих пор.
Симптом легко распознать: первые токены выглядят осмысленно, затем вывод зацикливается. Если столкнулись с этим - временно переключитесь на vLLM или используйте другую квантизацию.
Сравнение производительности: что показывают тесты сообщества
Цифры из реальных измерений дают четкую картину. На Apple Silicon разрыв между харнессами достигает семикратного размера. На GPU решает не только скорость, но и корректность работы с квантизацией.
Влияние MTP на скорость: не всегда плюс
MTP (Multi-Token Prediction) - технология, при которой модель предсказывает несколько токенов за шаг. Логика подсказывает, что это ускоряет генерацию. На практике все зависит от платформы и реализации.
На Apple Silicon через Ollama MTP-вариант GGUF mtp-q4_K_M выдает 5.14 tok/s при отклонении драфтов. Non-MTP GGUF q4_K_M - 11.78 tok/s. Замедление в два раза. Причина: на чипах M-серии механизм отклонения драфтов создает накладные расходы, которые не компенсируются выигрышем от предсказания.
MLX справляется с MTP лучше: 38.36 tok/s на предсказуемом контенте и 20.26 tok/s на непредсказуемом. Здесь оптимизация под Apple Silicon работает как задумано. Вывод: MTP - не универсальное ускорение. Проверяйте его на своей платформе перед тем, как делать основным вариантом. Что быстрее на конкретной конфигурации - MTP или DFlash - разбирается в отдельном сравнении для запуска Qwen 3.8 27B на 32 ГБ памяти.
Баг с FP8 в SGLang: как распознать и что делать
FP8-квантизация экономит память и ускоряет инференс на GPU, но в SGLang она сломана. Модель unsloth/Qwen3.8-27B-NVFP4 начинает повторять одну фразу бесконечно. Это не случайный сбой, а воспроизводимая проблема, связанная с обработкой FP8 lm_head.
vLLM уже содержит фикс для этой проблемы. SGLang - нет. Если вы работаете с FP8 на GPU, vLLM сейчас безопаснее. Альтернатива: использовать неквантизованную модель или другой формат сжатия в SGLang, если нужен именно этот движок.
Как выбрать инструмент: практические рекомендации
Алгоритм выбора простой. Определите платформу, затем задачу, затем берите соответствующий харнесс. Универсального решения нет, но для каждого сценария есть оптимальный вариант.
Для пользователей Apple Silicon
Основной выбор - MLX. Он дает максимальную скорость на чипах M-серии, поддерживает MTP без деградации и работает с vision-модальностью. Установка через pip, запуск через mlx_lm.generate. Для кодинга на Mac это лучший вариант из протестированных.
Если вы работаете на Mac со 128 ГБ памяти и выбираете между разными моделями, загляните в сравнение Qwen 3.5 27B и квантованных 70B+. Там же есть таблица скорости и потребления памяти, которая поможет оценить запас под харнесс.
Для пользователей NVIDIA GPU
Выбирайте vLLM. Он стабилен с FP8, поддерживает continuous batching и активно развивается. Для production-развертывания Qwen 3.8 27B на GPU это самый надежный вариант. Если нужна максимальная производительность - используйте неквантизованную модель или проверенную FP8-сборку.
Вопрос выбора между 27B и более крупными моделями под вашу видеокарту разобран в материале о пределах малых моделей и VRAM. Там есть тесты Qwen 3.6 27B и анализ, когда упираетесь в память, а когда в параметры.
Для тех, кто ценит простоту
Ollama - ваш вариант. Одна команда установки, готовые модели, минимум настроек. Плата - потеря производительности на Apple Silicon, особенно с MTP. Для периодических запросов и знакомства с моделью этого достаточно. Для ежедневной работы с кодом лучше сразу смотреть в сторону MLX или vLLM.
Если интересует тонкая настройка квантования под MLX, разбор 4-битных методов для Apple Silicon поможет выбрать между OptiQ, Unsloth dynamic и нативным квантованием.
Чек-лист перед запуском
- Платформа: Apple Silicon - MLX, NVIDIA GPU - vLLM.
- Задача: разовые эксперименты и прототипы - Ollama, постоянный кодинг-ассистент - MLX или vLLM.
- Формат квантизации: FP8 безопасен в vLLM; в SGLang берите другой формат или неквантованную модель.
- MTP: замерьте скорость на своем железе и своем контенте - на Apple Silicon через Ollama он может замедлить генерацию вдвое.
Заключение: что выбрать под ваше железо
Лучший харнесс для Qwen 3.8 27B определяется платформой. На Apple Silicon - MLX с 38.36 tok/s на предсказуемом контенте. На NVIDIA GPU - vLLM с корректной поддержкой FP8. Ollama закрывает сценарий «запустить за пять минут», но на Mac с MTP теряет половину скорости. SGLang до исправления бага с FP8 для этой конфигурации использовать не стоит.
Финальный шаг - замеры на своем железе: скорость и стабильность зависят от квантизации, длины контекста и типа контента, поэтому чужие цифры стоит воспринимать как ориентир, а не как гарантию. А если хотите глубже разобраться в качестве самой модели на задачах кодинга, посмотрите результаты Qwen 3.6 27B в SWE-rebench на Go, Java, Python, Rust и TypeScript.