Перейти к содержанию
Публикация AiManual

Qwen 3.8-27b: почему модель «залипает» в бесконечных рассуждениях и как это исправить?

Qwen 3.8-27b застревает в бесконечных рассуждениях и не доходит до ответа. Разбираем причины: архитектура, квантование, параметры llama-server. Готовые команды

Коротко

Что будет в материале

  1. 01

    Симптомы: как проявляется проблема

  2. 02

    Возможные причины: архитектура, квантование или настройки?

  3. 03

    Практические решения: как вернуть модель в рабочее состояние

  4. 04

    Сравнение с Qwen 3.6-27b: стоит ли откатываться?

Qwen 3.8-27b уходит в бесконечное планирование на простых задачах. Модель тратит 50 000 токенов только на фазу рассуждений и не доходит до практического ответа. Предыдущая версия Qwen 3.6-27b справляется с тем же кодинг-тестом за тот же объём токенов, но полностью завершает задачу. Проблема воспроизводится на реализации CLI по спецификации: 3.6-27b выдаёт готовый код, а 3.8-27b застревает в цикле «что если» и не завершает генерацию.

Главный вопрос: это баг, особенность архитектуры или следствие настроек запуска? Однозначного ответа пока нет. Но есть рабочие методы, которые возвращают модель в адекватное состояние. Разберём симптомы, гипотезы и конкретные шаги по исправлению.

Симптомы: как проявляется проблема

Пользователи описывают типичное поведение Qwen 3.8-27b: модель начинает рассуждать, генерирует длинные цепочки мыслей, но не переходит к финальному ответу. На простом кодинг-тесте, где нужно реализовать CLI по спецификации, Qwen 3.6-27b завершает задачу за ~50 000 токенов. Qwen 3.8-27b тратит тот же объём только на планирование, а иногда генерация обрывается без результата.

Воспроизводится это на задачах, которые не требуют глубокого анализа. Модель «думает» о структуре, перебирает варианты, уточняет детали, но не пишет код. В логах llama-server виден стабильный рост токенов без появления ответа. Пользователь ждёт минуты, затем прерывает генерацию вручную.

Связка с режимом xhigh усиливает проблему: в этом режиме модель генерирует от 15 000 до 20 000 токенов на задачах вроде создания HTML-клонов игр. Отдельные случаи достигают 40 000 токенов. На medium поведение ближе к норме, но всё равно избыточно для простых запросов.

Возможные причины: архитектура, квантование или настройки?

Выделяем три гипотезы. Каждая имеет аргументы за и против, но ни одна не подтверждена экспериментально в полном объёме.

Архитектурные изменения в Qwen 3.8-27b

Qwen 3.8-27b показывает значительные улучшения в агентных и программных задачах по сравнению с Qwen 3.6-27b. В бенчмарках модель превосходит предшественницу в программировании: прирост до +210% в некоторых метриках. Pass@1 в агентных задачах удваивается. Модель обходит Opus 4.6 Max в агентных бенчмарках (61.7 против 53.4).

Плата за эти результаты - более длительное планирование. Архитектура, вероятно, настроена на глубокую проработку задачи перед генерацией ответа. Контекст 256K и поддержка изображений расширяют возможности, но одновременно дают модели больше пространства для «размышлений». Подробнее о поведении режимов мышления читайте в разборе параметров llama.cpp-server.

Влияние квантования на поведение

Квантование Q3_K_S, kvarn4 и q8_0 по-разному влияет на качество модели. Q3_K_S - агрессивное сжатие, которое экономит память, но снижает точность весов. kvarn4 - менее распространённый метод, его влияние на рассуждения изучено слабо. q8_0 - 8-битное квантование, обычно сохраняющее качество близким к оригиналу.

Квантование снижает качество ответов, но не должно приводить к бесконечным рассуждениям. Скорее наоборот: при низком качестве модель может быстрее выдавать неоптимальный ответ. Наблюдения пользователей показывают, что проблема воспроизводится и на q8_0, и на Q3_K_S. Значит, квантование - не первопричина, хотя может влиять на стабильность.

Параметры llama-server: reasoning_effort, контекст, draft-mtp

Параметр reasoning_effort управляет глубиной рассуждений. Значения low, medium, high напрямую влияют на количество токенов, которые модель тратит на планирование. На high или xhigh модель склонна генерировать длинные цепочки мыслей. На medium поведение ближе к Qwen 3.6-27b.

Размер контекста тоже важен. При контексте 100 000+ токенов модель получает больше пространства для рассуждений и может «растекаться мыслью по древу». Ограничение контекста до 32 000 часто возвращает модель в рабочее состояние.

draft-mtp - параметр, связанный со спекулятивным декодированием. В связке с ngram-mod он может создавать артефакты, влияющие на стабильность генерации. Отключение draft-mtp иногда снижает склонность к длинным рассуждениям. Подробнее о влиянии спекулятивного декодирования на стабильность читайте в разборе chat template для Qwen 27B 3.8.

Практические решения: как вернуть модель в рабочее состояние

Набор действий, которые помогают в большинстве случаев. Начинайте с первого пункта, проверяйте поведение, затем переходите к следующему.

Настройка reasoning_effort

Параметр reasoning_effort принимает значения low, medium, high. Для llama-server команда выглядит так:

llama-server -m qwen3.8-27b-q8_0.gguf --reasoning-effort low

Начните с low. Если ответы становятся слишком поверхностными, поднимите до medium. High используйте только для задач, где глубина анализа критична. На low модель тратит несколько тысяч токенов на рассуждения вместо десятков тысяч.

Ограничение контекста

Большой контекст позволяет модели генерировать длинные рассуждения. Для задач, не требующих длинного контекста, ограничьте его до 32 000 токенов:

llama-server -m qwen3.8-27b-q8_0.gguf -c 32768

Это снижает потребление памяти и ускоряет инференс. На одной RX9070 с 16 ГБ VRAM контекст 32K - разумный предел для кванта Q4_K_M.

Выбор квантования

Сравнение методов:

  • q8_0 - максимальное качество, требует больше памяти. Рекомендуется, если позволяет VRAM.
  • Q4_K_M - компромисс между качеством и скоростью. Хороший выбор для 16 ГБ VRAM.
  • Q3_K_S - экономия памяти, но заметное снижение качества. Используйте только при жёстких ограничениях.
  • kvarn4 - редкий метод, влияние на рассуждения не изучено. Лучше избегать.

Квантование не устраняет проблему бесконечных рассуждений, но q8_0 даёт более стабильные результаты, чем Q3_K_S.

Отключение draft-mtp

draft-mtp - параметр спекулятивного декодирования. Отключите его, если используете:

llama-server -m qwen3.8-27b-q8_0.gguf --draft-mtp 0

Спекулятивное декодирование ускоряет генерацию, но может создавать артефакты, которые усугубляют склонность к длинным рассуждениям. Отключение снижает скорость, но повышает стабильность.

Сравнение с Qwen 3.6-27b: стоит ли откатываться?

Qwen 3.6-27b стабильно завершает задачи, но уступает в бенчмарках. Qwen 3.8-27b показывает +210% в некоторых метриках программирования и удвоение Pass@1 в агентных задачах. Компромисс очевиден: производительность против стабильности.

Для production-задач, где важна предсказуемость, используйте Qwen 3.6-27b. Для экспериментов и задач, где качество важнее скорости, берите 3.8-27b с настройками reasoning_effort=low и ограниченным контекстом. О том, как кадровые изменения в команде Qwen повлияли на развитие модели, читайте в анализе последствий реорганизации.

Оптимизация для ограниченных ресурсов (на примере RX9070)

Одна RX9070 с 16 ГБ VRAM - типичная конфигурация для локального запуска. Рекомендации:

  • Квантование: Q4_K_M. Баланс качества и памяти.
  • Контекст: 32 768 токенов. Достаточно для большинства задач.
  • reasoning_effort: low или medium.
  • draft-mtp: отключён.

Примерная скорость генерации: 30-40 токенов в секунду. Этого достаточно для интерактивной работы. Если нужно больше контекста, уменьшите квант до Q3_K_S, но качество ответов снизится.

Выводы и рекомендации

Проблема бесконечных рассуждений у Qwen 3.8-27b связана с архитектурными особенностями модели. Новая версия склонна к более глубокому планированию, что даёт прирост в бенчмарках, но ломает поведение на простых задачах. Настройки llama-server и квантование могут усугублять проблему, но не являются первопричиной.

Рекомендации:

  • Для быстрых ответов используйте Qwen 3.6-27b.
  • Для экспериментов с 3.8-27b настройте reasoning_effort=low, ограничьте контекст до 32K, используйте q8_0 или Q4_K_M.
  • Отключите draft-mtp, если наблюдаете артефакты.

Сообщество ждёт исправлений от разработчиков. Пока их нет, ручная настройка параметров - единственный способ вернуть модель в рабочее состояние. Дополнительно о проблемах официального chat-шаблона Qwen 3.8 читайте в разборе исправленного Jinja-шаблона.

Подписаться на канал