Введение: локальный инференс как поле битвы
Локальный запуск больших языковых моделей перестал быть нишевым хобби. В 2026 году на одной видеокарте уровня RTX 5080 можно запустить модели, которые ещё два года назад требовали серверного кластера. Прямое сравнение Qwen3.6 35B и Muse Glimmer 30B в задаче генерации воксельных миров на кастомной сборке llama.cpp выявило чёткий компромисс: Muse Glimmer почти не ошибается и строго следует правилам, но его генерации шаблонны. Qwen3.6 создаёт более богатые и сложные миры, но чаще сбивается и галлюцинирует. Выбор между точностью и креативностью зависит от конкретной задачи, а не от абстрактного «качества» модели.
Тестовая среда включала RTX 5080, CUDA 13.1 и нативную поддержку архитектуры Blackwell sm_120a. Сборка llama.cpp использовала флаги GGML_CUDA_FA_ALL_QUANTS, CUDA graphs и PTX-инструкции для sm_120a. Эти технические детали напрямую влияют на скорость инференса и, потенциально, на стабильность вывода. Разберём, как именно.
Материал опирается на пользовательский тест, а не на официальный бенчмарк. Это ограничение важно держать в голове при интерпретации результатов. Если вам нужен более широкий контекст по сравнению Muse и Qwen, обратите внимание на разбор эффективности токенов на бенчмарке GLIMMER.
Методология теста: как мы сравнивали модели
Задача формулировалась одинаково для обеих моделей: сгенерировать описание воксельного мира по заданным правилам. Правила включали ограничения на размер мира, типы блоков, наличие определённых структур и запрет на добавление элементов, не указанных в промпте. Каждая модель получала идентичный системный промпт и параметры запуска, насколько это позволяла архитектура.
Muse Glimmer 30B - это vision-language модель с 27.9B параметров, настроенная для агентных рабочих процессов. Контекстное окно 128K токенов, поддержка текста и изображений. Параметры сэмплирования зафиксированы для детерминированного поведения: temperature 0.7, top-p 0.8. Qwen3.6 35B - текстовая модель из семейства Qwen, известного сильными результатами в генеративных задачах. Разница в модальности и целях настройки уже задаёт разное поведение в креативных сценариях.
Технические детали сборки llama.cpp
Сборка llama.cpp с флагом GGML_CUDA_FA_ALL_QUANTS включает быстрые квантованные матричные умножения для всех поддерживаемых типов квантования. Это ускоряет инференс, но использует приближённые вычисления. Для моделей, настроенных на детерминированность, такие приближения редко приводят к заметным отклонениям. Для моделей с высокой вариативностью вывода они могут усиливать нестабильность.
CUDA graphs снижают накладные расходы на запуск ядер, объединяя последовательность операций в единый граф. Это ускоряет генерацию, но не влияет на математическую точность вычислений. Нативные PTX-инструкции для Blackwell sm_120a задействуют специфичные возможности архитектуры, включая улучшенную работу с тензорными ядрами. На RTX 5080 это даёт прирост скорости, но требует корректной поддержки со стороны llama.cpp и драйверов.
Практический опыт запуска Muse Glimmer на других конфигурациях описан в тесте на M5 Pro с Q4 квантизацией. Там модель показала около 17 токенов в секунду и уступила Qwen3.6 27B в качестве кода, что согласуется с нашими наблюдениями о её консервативности.
Результаты: креативность против надёжности
Пользовательский тест выявил устойчивый паттерн. Muse Glimmer генерировал миры, которые точно соответствовали правилам: все перечисленные структуры на месте, запрещённых элементов нет, размеры соблюдены. Но миры получались однообразными. Одинаковые пропорции, предсказуемое расположение блоков, отсутствие неожиданных решений. Qwen3.6 создавала более сложные композиции: многоуровневые структуры, нестандартные переходы между зонами, интересные цветовые сочетания. При этом модель периодически добавляла элементы, которых не было в промпте, или нарушала ограничения по размеру.
Muse Glimmer 30B: точность без фантазии
Muse Glimmer почти не допускает ошибок в следовании инструкциям. Это ожидаемо: модель настроена для агентных рабочих процессов, где отклонение от спецификации критично. Параметры сэмплирования temperature 0.7 и top-p 0.8 выбраны для надёжного, предсказуемого поведения. В тесте генерации воксельных миров это проявилось как строгое следование правилам, но отсутствие творческой глубины. Миры Muse Glimmer функциональны, но не запоминаются.
Ограничение модели - отсутствие режимов длительного рассуждения. В сложных многошаговых сценариях это может снижать качество результата, что подтверждается и другими тестами. В сравнительном бенчмарке трёх моделей среднего размера Muse Glimmer 30B догоняла конкурентов по итоговому баллу, но требовала в 2-3 раза больше запросов для достижения результата.
Qwen3.6 35B: богатство идей с риском галлюцинаций
Qwen3.6 генерирует более интересные миры. В тесте она создавала многоуровневые структуры с перепадами высот, скрытыми проходами и нестандартными комбинациями блоков. Это указывает на более разнообразные обучающие данные и менее жёсткую настройку на следование инструкциям. Обратная сторона - склонность к галлюцинациям. Модель добавляла несуществующие элементы, игнорировала часть ограничений и иногда сбивалась с формата вывода.
Такое поведение характерно для моделей, обученных на широком спектре задач без жёсткой оптимизации под агентные сценарии. Креативность и стабильность здесь конкурируют за один ресурс - свободу генерации. Чем больше свободы, тем выше вероятность отклонения от инструкций.
Технический анализ: почему модели ведут себя по-разному?
Разница в поведении объясняется тремя факторами: архитектурой, целями настройки и влиянием оптимизаций сборки. Muse Glimmer - vision-language модель, оптимизированная для агентных задач. Её обучали на данных, где точное следование инструкциям важнее разнообразия. Qwen3.6 - часть семейства, ориентированного на широкий спектр генеративных задач, где креативность ценится выше строгого соответствия шаблону.
Влияние оптимизаций llama.cpp на качество вывода
GGML_CUDA_FA_ALL_QUANTS использует быстрые приближённые вычисления для квантованных матричных умножений. Эти приближения вносят небольшие численные ошибки. Для Muse Glimmer, настроенной на детерминированность, такие ошибки редко приводят к заметным отклонениям: модель компенсирует их за счёт консервативной стратегии генерации. Для Qwen3.6, которая и без того склонна к вариативности, дополнительные численные шумы могут усиливать галлюцинации. CUDA graphs ускоряют инференс, но не влияют на качество вычислений, так как не меняют математику операций.
Важно понимать: влияние оптимизаций не изолировано. Оно проявляется в сочетании с архитектурными особенностями модели. На другой сборке llama.cpp или другом GPU результаты могут отличаться. Если вы воспроизводите тест, фиксируйте все флаги компиляции и версии драйверов.
Выбор модели: что важнее для вашей задачи?
Выбор сводится к приоритету. Если задача требует точного следования инструкциям - агентные сценарии, генерация кода, работа с формализованными данными - Muse Glimmer предпочтительнее. Её консервативность здесь преимущество: меньше ошибок, предсказуемый результат. Если задача требует разнообразия и креативности - генерация контента, идей, прототипов - Qwen3.6 даст более интересные результаты, но потребует дополнительной проверки вывода.
Для гибридных сценариев можно комбинировать модели: Qwen3.6 для генерации черновиков и идей, Muse Glimmer для валидации и приведения к спецификации. Это увеличивает время инференса, но снижает риск ошибок в финальном результате.
Ограничения теста и перспективы
Тест проводился на одной задаче и одном оборудовании. Выводы нельзя обобщать на все сценарии использования. RTX 5080 с CUDA 13.1 и Blackwell sm_120a - конкретная конфигурация, на других GPU результаты могут отличаться. На рынке есть модели, которые превосходят Qwen3.6 по отдельным метрикам: Qwen3.8-Max с 2.4 трлн параметров и контекстным окном 1 млн токенов, DeepSeek V4 Pro с низкой стоимостью инференса. Qwen3.6 не является безоговорочным лидером, и единичный бенчмарк не даёт оснований для такого вывода.
Для более полной картины стоит изучить анализ пределов возможностей малых моделей и обзор Muse Spark 1.2 от Meta, которая заявляет двукратную экономию токенов при сопоставимом качестве.
Заключение: баланс между креативностью и надёжностью
Muse Glimmer 30B - выбор для задач, где точность и следование инструкциям критичны. Qwen3.6 35B - выбор для задач, где важна креативность и разнообразие. Идеального решения нет: каждая модель занимает свою нишу. Развитие локальных LLM продолжается, и в ближайшие месяцы появятся новые модели, которые могут изменить этот баланс. Проводите собственные тесты на своих задачах и оборудовании, фиксируйте параметры запуска и не делайте выводов на основе единичных бенчмарков.