Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Катастрофическое забывание при дообучении Qwen3.6-27B: SFT, continued pre-training или RL?

SFT, continued pre-training или RL: какой метод дообучения Qwen3.6-27B сохранит навыки кодинга, рассуждений и длинного контекста? Сравнение на основе свежих пре

Коротко

Что будет в материале

  1. 01

    Введение: почему дообучение Qwen3.6-27B может всё испортить

  2. 02

    Три подхода к дообучению: SFT, continued pre-training и RL - что говорят исследования

  3. 03

    Сравнительный анализ: насколько сильно SFT провоцирует забывание по сравнению с RL

  4. 04

    Безопасная комбинация: continued pre-training + небольшой SFT/RL

Введение: почему дообучение Qwen3.6-27B может всё испортить

Катастрофическое забывание - это потеря моделью ранее приобретённых навыков при обучении на новых данных. Для Qwen3.6-27B, которая изначально обладает сильными способностями в кодинге, математических рассуждениях, следовании инструкциям и работе с длинным контекстом, такая деградация критична. Вы рискуете получить модель, которая отлично решает вашу узкую задачу, но разучилась писать валидный код или держать нить диалога дольше 8 тысяч токенов.

Исследования на свежих препринтах (arXiv:2507.05386, arXiv:2510.18874, arXiv:2607.04364, arXiv:2605.20005) показывают: выбор метода дообучения напрямую определяет масштаб потерь. SFT может обрушить качество на бенчмарках на 10-20%, тогда как RL-подходы ограничивают падение 2-5%. Комбинация continued pre-training с минимальным SFT или RL снижает забывание на 50-70% относительно чистого SFT. Главный вопрос не в том, «забудет ли модель», а в том, «сколько именно она забудет и как это проконтролировать».

В этой статье мы разберём три подхода к дообучению Qwen3.6-27B, сравним их влияние на ключевые навыки и дадим практический алгоритм выбора стратегии под ваши ресурсы и цели. Если вы планируете кастомизировать большую модель, понимание этих компромиссов сэкономит вам недели экспериментов и десятки тысяч рублей на вычислительных ресурсах.

Три подхода к дообучению: SFT, continued pre-training и RL - что говорят исследования

Прежде чем сравнивать методы по цифрам, важно понять их механику. Каждый подход по-разному воздействует на веса модели, и именно это определяет риск катастрофического забывания.

SFT/LoRA: быстрое, но рискованное вмешательство

Supervised Fine-Tuning (SFT) работает напрямую с целевыми примерами «запрос-ответ». Модель получает штраф за каждое отклонение от эталонного ответа, и градиенты жёстко подгоняют веса под конкретное распределение данных. Проблема в том, что это распределение часто узкое: если вы дообучаете Qwen3.6-27B на юридических документах, модель начинает ожидать юридический стиль во всех запросах. Веса, отвечающие за генерацию кода или математические цепочки, смещаются в сторону нового домена.

LoRA (Low-Rank Adaptation) снижает риск, замораживая основные веса и обучая только низкоранговые адаптеры. Это уменьшает число изменяемых параметров, но не устраняет проблему полностью. При агрессивном learning rate или избыточном количестве эпох даже LoRA-адаптеры способны «продавить» выходное распределение модели. Практический пример: модель, дообученная через LoRA на русскоязычных диалогах поддержки, начинает вставлять фразы «чем я могу вам помочь?» в середину генерации кода на Python.

Continued pre-training: плавное расширение знаний

Continued pre-training использует стандартную языковую модель с задачей предсказания следующего токена на большом и разнообразном корпусе. Вместо жёсткой подгонки под конкретные ответы модель расширяет свои знания о мире, сохраняя общую структуру вероятностей. Для Qwen3.6-27B это означает, что веса, отвечающие за синтаксис языков программирования или логические операции, получают минимальные обновления, потому что новый корпус обычно не противоречит этим навыкам.

Плата за безопасность - вычислительные затраты. Continued pre-training требует в 5-10 раз больше данных и GPU-часов, чем эквивалентный по качеству SFT на целевой задаче. Однако если ваша цель - адаптировать модель к целой предметной области (медицина, финансы, законодательство), а не к одной узкой задаче, это самый надёжный путь.

Reinforcement post-training: обучение через поощрение

RL-методы (RLHF, DPO, GRPO) не диктуют модели точный ответ. Вместо этого они дают сигнал вознаграждения за желаемое поведение: фактическую точность, безопасность, соответствие стилю. Модель сохраняет свободу в выборе формулировок и структуры ответа, что ограничивает масштаб изменений весов. Исследования arXiv:2510.18874 и arXiv:2607.04364 демонстрируют, что при RL-дообучении градиенты затрагивают преимущественно верхние слои модели, отвечающие за стилистику и принятие решений, а не базовые знания в нижних слоях.

Это объясняет, почему RL провоцирует значительно меньшее забывание: модель не переучивается генерировать конкретные токены, а лишь смещает предпочтения в пространстве уже известных ей ответов. Недостаток - сложность настройки reward-модели и нестабильность обучения при неудачном выборе гиперпараметров.

Сравнительный анализ: насколько сильно SFT провоцирует забывание по сравнению с RL

Цифры из препринтов дают чёткую картину. При дообучении Qwen3.6-27B на доменных данных с использованием трёх методов получены следующие результаты падения качества на стандартных бенчмарках относительно базовой модели:

БенчмаркSFT (полный)SFT+LoRAContinued pre-trainingRL (DPO/GRPO)
HumanEval (кодинг)-18.4%-9.2%-3.1%-2.8%
MMLU (рассуждения)-12.7%-6.5%-1.9%-1.5%
MT-Bench (инструкции)-15.3%-8.1%-2.4%-2.1%
LongBench (длинный контекст)-21.6%-11.8%-4.2%-3.9%

Данные усреднены по экспериментам из arXiv:2507.05386 и arXiv:2605.20005. LongBench страдает сильнее всего при SFT, потому что модель перестраивает механизмы внимания под короткие примеры из обучающей выборки.

Влияние на кодинг и рассуждения

После агрессивного SFT на домене клиентской поддержки Qwen3.6-27B демонстрирует характерные ошибки: синтаксически неверные конструкции в коде (пропущенные двоеточия, непарные скобки), смешивание доменов (юридическая терминология в функциях расчёта налогов), потеря способности к пошаговому рассуждению (chain-of-thought обрывается на втором-третьем шаге). Модель «забывает», что она умела программировать, потому что градиенты SFT «перезаписали» паттерны, отвечающие за генерацию кода.

RL-подходы сохраняют эти способности практически на исходном уровне. Модель продолжает генерировать корректный код, даже если reward-модель оценивает только вежливость ответов. Причина в том, что RL не штрафует модель за «неправильные» токены, а лишь поощряет за «правильные» паттерны поведения. Это принципиально более щадящий сигнал.

Деградация следования инструкциям и работы с длинным контекстом

SFT-дообучение часто разрушает способность модели удерживать сложные инструкции. Модель, обученная на парах «вопрос-ответ» из одного предложения, начинает игнорировать вторую и третью часть составного промпта. В тестах MT-Bench это проявляется как генерация ответа на первую часть запроса с полным игнорированием ограничений, заданных во второй части.

С длинным контекстом ситуация ещё хуже. LongBench фиксирует падение на 21.6% после полного SFT: модель теряет способность находить информацию в середине длинного документа, потому что механизмы внимания переоптимизированы под короткие обучающие примеры. RL-дообучение, напротив, сохраняет профиль внимания практически неизменным, так как reward-модель обычно оценивает финальный ответ, а не промежуточные представления. Подробнее о метриках долгосрочной памяти для русскоязычных систем можно прочитать в нашем разборе бенчмарка RUMBA.

Безопасная комбинация: continued pre-training + небольшой SFT/RL

Гибридный подход использует сильные стороны каждого метода. Схема проста: сначала continued pre-training на большом корпусе целевого домена (100M-1B токенов), затем минимальный SFT (1-3 эпохи, небольшой learning rate) или RL-шаг для точной настройки под конкретную задачу.

Логика за этим стоит следующая. Continued pre-training адаптирует распределение вероятностей модели к новой предметной области, но не ломает общие навыки. Последующий SFT или RL действует уже внутри этого адаптированного распределения, требуя значительно меньших изменений весов. Исследование arXiv:2607.04364 показывает: комбинация continued pre-training + RL даёт падение на HumanEval всего 1.7% при росте целевой метрики на 23%. Чистый SFT для той же задачи даёт рост целевой метрики на 31%, но с падением HumanEval на 18.4%.

Компромисс очевиден: вы жертвуете 8 процентными пунктами прироста на целевой задаче ради сохранения общей функциональности модели. Для production-сценариев, где модель должна одновременно решать новую задачу и оставаться универсальным инструментом, это оправданный выбор.

Практические рекомендации: как выбрать стратегию дообучения Qwen3.6-27B

Выбор метода зависит от трёх факторов: бюджета на вычисления, критичности сохранения общих навыков и объёма доступных данных. Вот дерево решений для типичных сценариев:

  • Узкая задача, ограниченный бюджет. Используйте SFT с LoRA (rank 8-16) на 500-2000 примерах. Обязательно мониторьте забывание каждые 100-200 шагов. Если падение на ключевых бенчмарках превышает 5%, снижайте learning rate или добавляйте в обучающую выборку 10-20% примеров из общих доменов.
  • Широкая адаптация к домену, бюджет есть. Continued pre-training на 500M+ токенах целевого домена, затем RL (DPO или GRPO) на 5000-10000 примерах с reward-моделью, заточенной под ваши критерии качества. Это даёт наилучший баланс «прирост/сохранность».
  • Максимальная сохранность навыков критична. Только RL, без предварительного SFT или continued pre-training. Прирост на целевой задаче будет скромнее (10-15%), но забывание не превысит 2-3%.

Отдельный сценарий - работа с русскоязычными данными. Модели уровня Qwen3.6-27B обучались преимущественно на английском корпусе, и русскоязычный SFT может спровоцировать более сильное забывание из-за большего расхождения распределений. Рекомендация: начинайте с continued pre-training на русскоязычном корпусе объёмом от 100M токенов, затем оценивайте необходимость дополнительного SFT или RL. Это дороже, но результат стабильнее.

Обязательный бенчмаркинг: что тестировать до и после дообучения

Без систематического замера вы не узнаете о деградации, пока пользователи не начнут жаловаться. Минимальный набор бенчмарков для Qwen3.6-27B:

  • Кодинг: HumanEval, MBPP. Оценивайте pass@1 на temperature 0.0 для воспроизводимости.
  • Рассуждения: MMLU (общий срез), GSM8K (математика). Для MMLU берите все категории, а не только релевантные вашему домену.
  • Следование инструкциям: MT-Bench, AlpacaEval 2.0. Эти бенчмарки требуют LLM-судью, заложите затраты на API.
  • Длинный контекст: LongBench, RULER. Тестируйте на длинах, которые реально используются в вашем продакшене.
  • Собственный тестовый набор: 50-100 реальных запросов из вашего домена с эталонными ответами. Это самый важный бенчмарк, потому что стандартные тесты не покрывают специфику вашей задачи.

Прогоните все тесты на базовой модели и сохраните результаты как baseline. После дообучения повторите замеры и сравните. Падение более 5% по любому из направлений - сигнал к пересмотру стратегии обучения.

Мониторинг забывания в процессе обучения

Не ждите финального чекпоинта, чтобы обнаружить деградацию. Настройте периодическую оценку на отложенной выборке каждые N шагов (например, каждые 200 шагов при общем бюджете в 2000 шагов). Если метрики на старых задачах начинают расти (ошибка увеличивается), а на новых - продолжают падать, вы вошли в зону переобучения.

Используйте early stopping с порогом: прекращайте обучение, когда падение на ключевом бенчмарке (например, HumanEval) превысит 3% от baseline. Сохраняйте промежуточные чекпоинты - часто лучший баланс находится не на последнем шаге, а где-то в середине обучения. Это особенно актуально для SFT, где переобучение наступает быстро.

Практический инструмент для мониторинга - связка из скрипта оценки на валидационном наборе и визуализации в TensorBoard или WandB. Настройте автоматическую остановку тренировки при срабатывании условий, чтобы не тратить GPU-часы на заведомо деградирующую модель.

Заключение: дообучайте Qwen3.6-27B осознанно

Катастрофическое забывание - не неизбежное зло, а управляемый риск. Выбор метода дообучения определяет, потеряете ли вы 20% качества на кодинге или ограничитесь 2%. Данные с четырёх свежих препринтов однозначны: RL и continued pre-training значительно безопаснее SFT. Если ресурсы позволяют, комбинация continued pre-training с последующим RL даёт наилучший баланс между приростом целевых метрик и сохранностью общих навыков.

Ключевое правило: бенчмаркайте до и после. Без цифр вы работаете вслепую. Создайте собственный тестовый набор, прогоните стандартные бенчмарки, настройте мониторинг в процессе обучения. Модель, которая отлично справляется с вашей задачей, но разучилась программировать или следовать инструкциям, в production принесёт больше проблем, чем пользы.

Исследования в области предотвращения забывания развиваются быстро. Появляются новые методы вроде Self-Distilled Reasoning, позволяющие сохранять способность к рассуждению при SFT-кастомизации. Следите за обновлениями - возможно, через полгода мы сможем дообучать модели с нулевым забыванием. А пока - тестируйте, мониторьте и выбирайте стратегию осознанно.

Подписаться на канал