Перейти к содержанию
Публикация AiManual

Скрытые компромиссы Qwen3.8-27B: почему модель стала хуже знать общие факты

Qwen3.8-27B потеряла часть общих знаний: пользователь Reddit зафиксировал регресс в распознавании малоизвестных географических объектов. Разбираем, какие знания

Коротко

Что будет в материале

  1. 01

    Наблюдение: Qwen3.8-27B теряет общие знания

  2. 02

    Что именно пострадало: география и малоизвестные факты

  3. 03

    Предполагаемая причина: оптимизация под кодинг и агентные задачи

  4. 04

    Практические выводы: как выбирать модель под свои задачи

Наблюдение: Qwen3.8-27B теряет общие знания

Пользователь Reddit зафиксировал конкретный регресс: Qwen3.8-27B хуже распознаёт малоизвестные географические объекты по сравнению с Qwen 3.6. Речь идёт о нишевых фактах, например, исторических местах в небольшом немецком городе. Предыдущие версии 27B и 35B A3B иногда давали правильные ответы, а главное, их можно было навести на верное решение подсказками. Qwen3.8-27B практически не демонстрирует таких знаний и не поддаётся корректировке.

Это прямой сигнал: модель потеряла часть общих знаний. Вопрос в том, насколько глубоко это изменение и чем оно вызвано. Разберём наблюдение, возможные причины и практические выводы для выбора модели.

Что именно пострадало: география и малоизвестные факты

Проблема проявляется на узких фактических запросах. Исторические места в малых городах, локальные достопримечательности, редкие топонимы. Это та категория знаний, которая редко встречается в бенчмарках, но важна для задач, требующих широкой эрудиции.

Qwen 3.6 в версиях 27B и 35B A3B показывала фрагментарные, но реальные знания. Модель могла ошибаться, однако при уточняющих подсказках восстанавливала правильный ответ. Qwen3.8-27B ведёт себя иначе: знания отсутствуют, а подсказки не помогают.

Почему модель не поддаётся корректировке подсказками

Отсутствие реакции на подсказки указывает на более серьёзную потерю, чем поверхностное забывание. Если модель сохранила хотя бы частичную информацию, контекстная подсказка обычно активирует нужные ассоциации. Qwen3.8-27B игнорирует такие сигналы. Это может означать, что соответствующие веса в модели были существенно перераспределены или удалены в процессе обучения. Для пользователя это означает: нельзя рассчитывать на то, что модель «вспомнит» при правильной формулировке запроса.

Предполагаемая причина: оптимизация под кодинг и агентные задачи

Автор наблюдения выдвинул гипотезу: разработчики намеренно обрезали «бесполезные» общие знания в пользу улучшения кодинга и агентных способностей. Это предположение, а не подтверждённый факт, но оно согласуется с логикой развития LLM.

При обучении модели ресурсы ограничены: параметры, вычислительные мощности, объём данных. Улучшение одних способностей часто требует перераспределения ресурсов за счёт других. Кодинг и агентные сценарии требуют сильного логического мышления, следования инструкциям, работы с инструментами. Общие знания о редких географических объектах в этих задачах не нужны. Если приоритет был отдан практическим навыкам, эрудиция могла пострадать.

Компромиссы в обучении LLM: общая тенденция?

Это не единичный случай. Индустрия движется к специализации моделей. Разработчики всё чаще оптимизируют модели под конкретные сценарии: кодинг, агентные задачи, математику, работу с документами. Общие знания при этом страдают. Похожие компромиссы наблюдались и в других моделях, когда улучшение бенчмарков по коду сопровождалось снижением качества ответов на общие вопросы.

Связка с более широкой дискуссией о прозрачности Qwen3.8 прослеживается в отдельном анализе: модель чаще признаёт незнание и отказывается отвечать при низкой уверенности. Это может быть следствием той же стратегии: вместо поверхностных знаний модель получает более честную калибровку, но теряет широту охвата. Подробнее об этом читайте в статье Qwen3.8: Прозрачность или ловушка?.

Практические выводы: как выбирать модель под свои задачи

Выбор модели зависит от приоритетов. Qwen3.8-27B может быть сильнее в кодинге и агентных сценариях, но слабее в общих знаниях. Qwen 3.6 показывает лучшие результаты на нишевых фактических запросах, хотя уступает в новых специализированных навыках.

Критерии для выбора:

  • Если задачи требуют широкой эрудиции: ответы на общие вопросы, работа с нишевыми фактами, историческими и географическими данными, стоит остаться на Qwen 3.6 или рассмотреть альтернативы.
  • Если приоритет: кодинг, агентные сценарии, следование инструкциям, Qwen3.8-27B может быть лучшим выбором.
  • Обязательно тестируйте модель на своих данных. Бенчмарки не показывают потери в нишевых знаниях.

Для тех, кто работает с ограниченными ресурсами, полезен разбор сравнения крупных моделей в 64 ГБ RAM: Пределы возможностей малых моделей. Там показано, как архитектура MoE влияет на достоверность нишевых знаний.

Что делать, если нужны и общие знания, и кодинг?

Есть несколько обходных путей:

  • Гибридный подход: использовать разные модели для разных задач. Qwen3.8-27B для кодинга, Qwen 3.6 для запросов, требующих эрудиции.
  • RAG: подключить внешнюю базу знаний. Модель не обязана хранить все факты, если может получать их из проверенного источника.
  • Дообучение: если критичны конкретные области знаний, модель можно дообучить на специфических данных. Это дороже, но эффективнее для узких сценариев.

Для агентных задач с низкими галлюцинациями стоит обратить внимание на сравнение G9v3-39A5B с Qwen: G9v3-39A5B: agentic MOE с низкими галлюцинациями. Там разобраны архитектурные решения, которые снижают ошибки без потери практических навыков.

Заключение: скрытые компромиссы требуют осознанного выбора

Qwen3.8-27B действительно потеряла часть общих знаний. Наблюдение пользователя Reddit подтверждает: нишевые географические факты, которые были доступны в Qwen 3.6, теперь отсутствуют, а подсказки не помогают. Вероятная причина: намеренная оптимизация под кодинг и агентные задачи.

Это важный сигнал для сообщества. Оценивать модели нужно не только по бенчмаркам, но и по реальным сценариям использования. Скрытые компромиссы между разными областями знаний становятся нормой, и выбор модели должен учитывать эти изменения. Тестируйте на своих данных, проверяйте нишевые запросы и не полагайтесь на общие метрики.

Подписаться на канал