Введение: почему дообучение Qwen3.6-27B может всё испортить
Катастрофическое забывание - это потеря моделью ранее приобретённых навыков при обучении на новых данных. Для Qwen3.6-27B, которая изначально обладает сильными способностями в кодинге, математических рассуждениях, следовании инструкциям и работе с длинным контекстом, такая деградация критична. Вы рискуете получить модель, которая отлично решает вашу узкую задачу, но разучилась писать валидный код или держать нить диалога дольше 8 тысяч токенов.
Исследования на свежих препринтах (arXiv:2507.05386, arXiv:2510.18874, arXiv:2607.04364, arXiv:2605.20005) показывают: выбор метода дообучения напрямую определяет масштаб потерь. SFT может обрушить качество на бенчмарках на 10-20%, тогда как RL-подходы ограничивают падение 2-5%. Комбинация continued pre-training с минимальным SFT или RL снижает забывание на 50-70% относительно чистого SFT. Главный вопрос не в том, «забудет ли модель», а в том, «сколько именно она забудет и как это проконтролировать».
В этой статье мы разберём три подхода к дообучению Qwen3.6-27B, сравним их влияние на ключевые навыки и дадим практический алгоритм выбора стратегии под ваши ресурсы и цели. Если вы планируете кастомизировать большую модель, понимание этих компромиссов сэкономит вам недели экспериментов и десятки тысяч рублей на вычислительных ресурсах.
Три подхода к дообучению: SFT, continued pre-training и RL - что говорят исследования
Прежде чем сравнивать методы по цифрам, важно понять их механику. Каждый подход по-разному воздействует на веса модели, и именно это определяет риск катастрофического забывания.
SFT/LoRA: быстрое, но рискованное вмешательство
Supervised Fine-Tuning (SFT) работает напрямую с целевыми примерами «запрос-ответ». Модель получает штраф за каждое отклонение от эталонного ответа, и градиенты жёстко подгоняют веса под конкретное распределение данных. Проблема в том, что это распределение часто узкое: если вы дообучаете Qwen3.6-27B на юридических документах, модель начинает ожидать юридический стиль во всех запросах. Веса, отвечающие за генерацию кода или математические цепочки, смещаются в сторону нового домена.
LoRA (Low-Rank Adaptation) снижает риск, замораживая основные веса и обучая только низкоранговые адаптеры. Это уменьшает число изменяемых параметров, но не устраняет проблему полностью. При агрессивном learning rate или избыточном количестве эпох даже LoRA-адаптеры способны «продавить» выходное распределение модели. Практический пример: модель, дообученная через LoRA на русскоязычных диалогах поддержки, начинает вставлять фразы «чем я могу вам помочь?» в середину генерации кода на Python.
Continued pre-training: плавное расширение знаний
Continued pre-training использует стандартную языковую модель с задачей предсказания следующего токена на большом и разнообразном корпусе. Вместо жёсткой подгонки под конкретные ответы модель расширяет свои знания о мире, сохраняя общую структуру вероятностей. Для Qwen3.6-27B это означает, что веса, отвечающие за синтаксис языков программирования или логические операции, получают минимальные обновления, потому что новый корпус обычно не противоречит этим навыкам.
Плата за безопасность - вычислительные затраты. Continued pre-training требует в 5-10 раз больше данных и GPU-часов, чем эквивалентный по качеству SFT на целевой задаче. Однако если ваша цель - адаптировать модель к целой предметной области (медицина, финансы, законодательство), а не к одной узкой задаче, это самый надёжный путь.
Reinforcement post-training: обучение через поощрение
RL-методы (RLHF, DPO, GRPO) не диктуют модели точный ответ. Вместо этого они дают сигнал вознаграждения за желаемое поведение: фактическую точность, безопасность, соответствие стилю. Модель сохраняет свободу в выборе формулировок и структуры ответа, что ограничивает масштаб изменений весов. Исследования arXiv:2510.18874 и arXiv:2607.04364 демонстрируют, что при RL-дообучении градиенты затрагивают преимущественно верхние слои модели, отвечающие за стилистику и принятие решений, а не базовые знания в нижних слоях.
Это объясняет, почему RL провоцирует значительно меньшее забывание: модель не переучивается генерировать конкретные токены, а лишь смещает предпочтения в пространстве уже известных ей ответов. Недостаток - сложность настройки reward-модели и нестабильность обучения при неудачном выборе гиперпараметров.
Сравнительный анализ: насколько сильно SFT провоцирует забывание по сравнению с RL
Цифры из препринтов дают чёткую картину. При дообучении Qwen3.6-27B на доменных данных с использованием трёх методов получены следующие результаты падения качества на стандартных бенчмарках относительно базовой модели:
| Бенчмарк | SFT (полный) | SFT+LoRA | Continued pre-training | RL (DPO/GRPO) |
|---|---|---|---|---|
| HumanEval (кодинг) | -18.4% | -9.2% | -3.1% | -2.8% |
| MMLU (рассуждения) | -12.7% | -6.5% | -1.9% | -1.5% |
| MT-Bench (инструкции) | -15.3% | -8.1% | -2.4% | -2.1% |
| LongBench (длинный контекст) | -21.6% | -11.8% | -4.2% | -3.9% |
Данные усреднены по экспериментам из arXiv:2507.05386 и arXiv:2605.20005. LongBench страдает сильнее всего при SFT, потому что модель перестраивает механизмы внимания под короткие примеры из обучающей выборки.
Влияние на кодинг и рассуждения
После агрессивного SFT на домене клиентской поддержки Qwen3.6-27B демонстрирует характерные ошибки: синтаксически неверные конструкции в коде (пропущенные двоеточия, непарные скобки), смешивание доменов (юридическая терминология в функциях расчёта налогов), потеря способности к пошаговому рассуждению (chain-of-thought обрывается на втором-третьем шаге). Модель «забывает», что она умела программировать, потому что градиенты SFT «перезаписали» паттерны, отвечающие за генерацию кода.
RL-подходы сохраняют эти способности практически на исходном уровне. Модель продолжает генерировать корректный код, даже если reward-модель оценивает только вежливость ответов. Причина в том, что RL не штрафует модель за «неправильные» токены, а лишь поощряет за «правильные» паттерны поведения. Это принципиально более щадящий сигнал.
Деградация следования инструкциям и работы с длинным контекстом
SFT-дообучение часто разрушает способность модели удерживать сложные инструкции. Модель, обученная на парах «вопрос-ответ» из одного предложения, начинает игнорировать вторую и третью часть составного промпта. В тестах MT-Bench это проявляется как генерация ответа на первую часть запроса с полным игнорированием ограничений, заданных во второй части.
С длинным контекстом ситуация ещё хуже. LongBench фиксирует падение на 21.6% после полного SFT: модель теряет способность находить информацию в середине длинного документа, потому что механизмы внимания переоптимизированы под короткие обучающие примеры. RL-дообучение, напротив, сохраняет профиль внимания практически неизменным, так как reward-модель обычно оценивает финальный ответ, а не промежуточные представления. Подробнее о метриках долгосрочной памяти для русскоязычных систем можно прочитать в нашем разборе бенчмарка RUMBA.
Безопасная комбинация: continued pre-training + небольшой SFT/RL
Гибридный подход использует сильные стороны каждого метода. Схема проста: сначала continued pre-training на большом корпусе целевого домена (100M-1B токенов), затем минимальный SFT (1-3 эпохи, небольшой learning rate) или RL-шаг для точной настройки под конкретную задачу.
Логика за этим стоит следующая. Continued pre-training адаптирует распределение вероятностей модели к новой предметной области, но не ломает общие навыки. Последующий SFT или RL действует уже внутри этого адаптированного распределения, требуя значительно меньших изменений весов. Исследование arXiv:2607.04364 показывает: комбинация continued pre-training + RL даёт падение на HumanEval всего 1.7% при росте целевой метрики на 23%. Чистый SFT для той же задачи даёт рост целевой метрики на 31%, но с падением HumanEval на 18.4%.
Компромисс очевиден: вы жертвуете 8 процентными пунктами прироста на целевой задаче ради сохранения общей функциональности модели. Для production-сценариев, где модель должна одновременно решать новую задачу и оставаться универсальным инструментом, это оправданный выбор.
Практические рекомендации: как выбрать стратегию дообучения Qwen3.6-27B
Выбор метода зависит от трёх факторов: бюджета на вычисления, критичности сохранения общих навыков и объёма доступных данных. Вот дерево решений для типичных сценариев:
- Узкая задача, ограниченный бюджет. Используйте SFT с LoRA (rank 8-16) на 500-2000 примерах. Обязательно мониторьте забывание каждые 100-200 шагов. Если падение на ключевых бенчмарках превышает 5%, снижайте learning rate или добавляйте в обучающую выборку 10-20% примеров из общих доменов.
- Широкая адаптация к домену, бюджет есть. Continued pre-training на 500M+ токенах целевого домена, затем RL (DPO или GRPO) на 5000-10000 примерах с reward-моделью, заточенной под ваши критерии качества. Это даёт наилучший баланс «прирост/сохранность».
- Максимальная сохранность навыков критична. Только RL, без предварительного SFT или continued pre-training. Прирост на целевой задаче будет скромнее (10-15%), но забывание не превысит 2-3%.
Отдельный сценарий - работа с русскоязычными данными. Модели уровня Qwen3.6-27B обучались преимущественно на английском корпусе, и русскоязычный SFT может спровоцировать более сильное забывание из-за большего расхождения распределений. Рекомендация: начинайте с continued pre-training на русскоязычном корпусе объёмом от 100M токенов, затем оценивайте необходимость дополнительного SFT или RL. Это дороже, но результат стабильнее.
Обязательный бенчмаркинг: что тестировать до и после дообучения
Без систематического замера вы не узнаете о деградации, пока пользователи не начнут жаловаться. Минимальный набор бенчмарков для Qwen3.6-27B:
- Кодинг: HumanEval, MBPP. Оценивайте pass@1 на temperature 0.0 для воспроизводимости.
- Рассуждения: MMLU (общий срез), GSM8K (математика). Для MMLU берите все категории, а не только релевантные вашему домену.
- Следование инструкциям: MT-Bench, AlpacaEval 2.0. Эти бенчмарки требуют LLM-судью, заложите затраты на API.
- Длинный контекст: LongBench, RULER. Тестируйте на длинах, которые реально используются в вашем продакшене.
- Собственный тестовый набор: 50-100 реальных запросов из вашего домена с эталонными ответами. Это самый важный бенчмарк, потому что стандартные тесты не покрывают специфику вашей задачи.
Прогоните все тесты на базовой модели и сохраните результаты как baseline. После дообучения повторите замеры и сравните. Падение более 5% по любому из направлений - сигнал к пересмотру стратегии обучения.
Мониторинг забывания в процессе обучения
Не ждите финального чекпоинта, чтобы обнаружить деградацию. Настройте периодическую оценку на отложенной выборке каждые N шагов (например, каждые 200 шагов при общем бюджете в 2000 шагов). Если метрики на старых задачах начинают расти (ошибка увеличивается), а на новых - продолжают падать, вы вошли в зону переобучения.
Используйте early stopping с порогом: прекращайте обучение, когда падение на ключевом бенчмарке (например, HumanEval) превысит 3% от baseline. Сохраняйте промежуточные чекпоинты - часто лучший баланс находится не на последнем шаге, а где-то в середине обучения. Это особенно актуально для SFT, где переобучение наступает быстро.
Практический инструмент для мониторинга - связка из скрипта оценки на валидационном наборе и визуализации в TensorBoard или WandB. Настройте автоматическую остановку тренировки при срабатывании условий, чтобы не тратить GPU-часы на заведомо деградирующую модель.
Заключение: дообучайте Qwen3.6-27B осознанно
Катастрофическое забывание - не неизбежное зло, а управляемый риск. Выбор метода дообучения определяет, потеряете ли вы 20% качества на кодинге или ограничитесь 2%. Данные с четырёх свежих препринтов однозначны: RL и continued pre-training значительно безопаснее SFT. Если ресурсы позволяют, комбинация continued pre-training с последующим RL даёт наилучший баланс между приростом целевых метрик и сохранностью общих навыков.
Ключевое правило: бенчмаркайте до и после. Без цифр вы работаете вслепую. Создайте собственный тестовый набор, прогоните стандартные бенчмарки, настройте мониторинг в процессе обучения. Модель, которая отлично справляется с вашей задачей, но разучилась программировать или следовать инструкциям, в production принесёт больше проблем, чем пользы.
Исследования в области предотвращения забывания развиваются быстро. Появляются новые методы вроде Self-Distilled Reasoning, позволяющие сохранять способность к рассуждению при SFT-кастомизации. Следите за обновлениями - возможно, через полгода мы сможем дообучать модели с нулевым забыванием. А пока - тестируйте, мониторьте и выбирайте стратегию осознанно.