Qwen 3.8 27B в 2026 году закрепилась как одна из самых востребованных моделей для локального кодинга. Модель сильна в генерации кода, но требовательна к железу и харнессу запуска. Правильный выбор инструмента напрямую определяет, получите ли вы 38 токенов в секунду или 5, столкнетесь ли с бесконечным повторением фразы или получите чистый вывод. Сообщество уже провело серию тестов и обсуждений. Основные варианты: Ollama, MLX, vLLM и SGLang. Каждый из них решает свою задачу, но не каждый подходит под вашу платформу.
Короткий ответ: на Apple Silicon выбирайте MLX, на NVIDIA GPU - vLLM. Ollama подойдет для быстрых экспериментов без тонкой настройки. SGLang пока используйте с осторожностью из-за известного бага с FP8-квантизацией. Ниже разберем, почему это так, и какие цифры стоят за этими рекомендациями.
Если вы еще не определились с моделью, посмотрите разбор Qwen против конкурентов, где Qwen 3.6 27B сравнивается с Llama, DeepSeek и Mistral по бенчмаркам и скорости на реальном железе.
Ключевые игроки: обзор инструментов для локального запуска
Четыре харнесса закрывают почти все сценарии локального инференса Qwen 3.8 27B. Они различаются архитектурой, платформами и уровнем сложности настройки. Разберем каждый по фактам.
Ollama: простота и удобство
Ollama остается самым простым способом запустить Qwen 3.8 27B локально. Установка сводится к одной команде, модель подтягивается из реестра готовых сборок. Поддерживаются GGUF-квантизации, включая q4_K_M и MTP-варианты. Для быстрых тестов и прототипов этого достаточно.
Ограничение проявляется под нагрузкой. На Apple Silicon GGUF q4_K_M без MTP выдает 11.78 tok/s, а MTP-версия при отклонении драфтов падает до 5.14 tok/s. Для фонового ассистента это терпимо, для активной работы с кодом - уже нет. Ollama не дает тонкого контроля над батчингом и распределением памяти, поэтому в production-сценариях уступает специализированным движкам.
MLX: оптимизация для Apple Silicon
MLX - фреймворк от Apple, созданный под чипы M-серии. Он использует unified memory напрямую, без лишних копирований между CPU и GPU. Для Qwen 3.8 27B это дает решающее преимущество на Mac.
Тесты сообщества показывают: MLX nvfp4 с MTP достигает 38.36 tok/s на предсказуемом контенте и 20.26 tok/s на непредсказуемом. Это лучший результат среди всех протестированных харнессов на Apple Silicon. MLX также поддерживает vision-модальность модели, что расширяет сценарии использования за пределы чистого кодинга. Если вы работаете на Mac, альтернативы практически нет.
vLLM: высокопроизводительный инференс на GPU
vLLM построен вокруг PagedAttention и continuous batching. Это позволяет эффективно обслуживать множественные запросы и выжимать максимум из NVIDIA GPU. Для Qwen 3.8 27B vLLM поддерживает FP8-квантизацию и корректно обрабатывает lm_head, что подтверждено исправлениями в кодовой базе.
На практике vLLM показывает стабильную генерацию без деградации качества. Это основной выбор для тех, кто разворачивает модель на сервере или рабочей станции с GPU и планирует использовать ее как постоянный кодинг-ассистент.
SGLang: гибкость и скорость, но с оговорками
SGLang предлагает RadixAttention и ряд оптимизаций для сложных пайплайнов. По скорости на GPU он конкурирует с vLLM. Проблема в другом: в текущей версии SGLang есть баг с FP8-квантизацией. При использовании unsloth/Qwen3.8-27B-NVFP4 модель начинает бесконечно повторять одну фразу, например «need analysis there need analysis there...». vLLM эту проблему уже исправил, SGLang на август 2026 - еще нет.
Симптом легко распознать: первые токены выглядят осмысленно, затем вывод зацикливается. Если столкнулись с этим - временно переключитесь на vLLM или используйте другую квантизацию.
Сравнение производительности: что показывают тесты сообщества
Цифры из реальных измерений дают четкую картину. На Apple Silicon разрыв между харнессами достигает семикратного размера. На GPU решает не только скорость, но и корректность работы с квантизацией.
Влияние MTP на скорость: не всегда плюс
MTP (Multi-Token Prediction) - технология, при которой модель предсказывает несколько токенов за шаг. Логика подсказывает, что это ускоряет генерацию. На практике все зависит от платформы и реализации.
На Apple Silicon через Ollama MTP-вариант GGUF mtp-q4_K_M выдает 5.14 tok/s при отклонении драфтов. Non-MTP GGUF q4_K_M - 11.78 tok/s. Замедление в два раза. Причина: на чипах M-серии механизм отклонения драфтов создает накладные расходы, которые не компенсируются выигрышем от предсказания.
MLX справляется с MTP лучше: 38.36 tok/s на предсказуемом контенте и 20.26 tok/s на непредсказуемом. Здесь оптимизация под Apple Silicon работает как задумано. Вывод: MTP - не универсальное ускорение. Проверяйте его на своей платформе перед тем, как делать основным вариантом.
Баг с FP8 в SGLang: как распознать и что делать
FP8-квантизация экономит память и ускоряет инференс на GPU, но в SGLang она сломана. Модель unsloth/Qwen3.8-27B-NVFP4 начинает повторять одну фразу бесконечно. Это не случайный сбой, а воспроизводимая проблема, связанная с обработкой FP8 lm_head.
vLLM уже содержит фикс для этой проблемы. SGLang - нет. Если вы работаете с FP8 на GPU, vLLM сейчас безопаснее. Альтернатива: использовать неквантизованную модель или другой формат сжатия в SGLang, если нужен именно этот движок.
Как выбрать инструмент: практические рекомендации
Алгоритм выбора простой. Определите платформу, затем задачу, затем берите соответствующий харнесс. Универсального решения нет, но для каждого сценария есть оптимальный вариант.
Для пользователей Apple Silicon
Основной выбор - MLX. Он дает максимальную скорость на чипах M-серии, поддерживает MTP без деградации и работает с vision-модальностью. Установка через pip, запуск через mlx_lm.generate. Для кодинга на Mac это лучший вариант из протестированных.
Если вы работаете на Mac со 128 ГБ памяти и выбираете между разными моделями, загляните в сравнение Qwen 3.5 27B и квантованных 70B+. Там же есть таблица скорости и потребления памяти, которая поможет оценить запас под харнесс.
Для пользователей NVIDIA GPU
Выбирайте vLLM. Он стабилен с FP8, поддерживает continuous batching и активно развивается. Для production-развертывания Qwen 3.8 27B на GPU это самый надежный вариант. Если нужна максимальная производительность - используйте неквантизованную модель или проверенную FP8-сборку.
Вопрос выбора между 27B и более крупными моделями под вашу видеокарту разобран в материале о пределах малых моделей и VRAM. Там есть тесты Qwen 3.6 27B и анализ, когда упираетесь в память, а когда в параметры.
Для тех, кто ценит простоту
Ollama - ваш вариант. Одна команда установки, готовые модели, минимум настроек. Плата - потеря производительности на Apple Silicon, особенно с MTP. Для периодических запросов и знакомства с моделью этого достаточно. Для ежедневной работы с кодом лучше сразу смотреть в сторону MLX или vLLM.
Если интересует тонкая настройка квантования под MLX, разбор 4-битных методов для Apple Silicon поможет выбрать между OptiQ, Unsloth dynamic и нативным квантованием.
Заключение: итоги и взгляд в будущее
Лучший харнесс для Qwen 3.8 27B определяется платформой. На Apple Silicon - MLX с 38.36 tok/s на предсказуемом контенте. На NVIDIA GPU - vLLM с корректной поддержкой FP8. Ollama закрывает сценарий «запустить за пять минут». SGLang ждет исправления бага с FP8.
Сообщество продолжает тестировать новые версии движков и квантизаций. Баги вроде проблемы SGLang с FP8, скорее всего, будут исправлены в ближайших релизах. Экспериментируйте на своем железе, замеряйте скорость и делитесь результатами - именно так формируются актуальные рекомендации. А если хотите глубже разобраться в качестве самой модели на задачах кодинга, посмотрите результаты Qwen 3.6 27B в SWE-rebench на Go, Java, Python, Rust и TypeScript.