Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Селективное подавление знаний: как дообучить LLM без катастрофического забывания и лишних затрат

Разбираем метод селективного подавления знаний из arXiv (2604.19089): как дообучить LLM на новых данных без потери старых навыков и радикально снизить вычислите

Коротко

Что будет в материале

  1. 01

    Проблема катастрофического забывания при дообучении LLM

  2. 02

    Селективное подавление знаний: основной принцип

  3. 03

    Сравнение с традиционным подходом: вычислительные затраты и эффективность

  4. 04

    Практическое применение: сценарии и ограничения

Проблема катастрофического забывания при дообучении LLM

Дообучение языковой модели на новых данных почти всегда приводит к деградации старых навыков. Модель, которую вы тщательно файнтюнили на юридических контрактах, внезапно перестаёт писать связные эссе или путается в базовой арифметике. Этот феномен - катастрофическое забывание - известен с первых дней глубокого обучения и остаётся одной из главных проблем continued pretraining.

Традиционное решение выглядит прямолинейно: смешать новые данные с фрагментами старого датасета и обучать на этой смеси. Проблема в том, что старый датасет часто измеряется терабайтами. Его хранение, загрузка и обработка увеличивают стоимость обучения на порядок. Для команды, которая хочет адаптировать модель к своему домену, это превращается в инфраструктурный кошмар.

Исследователи из arXiv (2604.19089) предложили альтернативу: метод селективного подавления знаний. Вместо того чтобы тащить за собой весь исторический корпус, алгоритм определяет, какие параметры модели критичны для сохранения старых знаний, и замораживает их. Остальные веса свободно обновляются под новые данные. Результат - модель усваивает новое, не теряя старого, а вычислительные затраты радикально снижаются.

Практическая боль здесь знакома каждому, кто занимался дообучением Qwen3.6-27B: SFT, continued pre-training или RL. Выбор стратегии дообучения напрямую влияет на то, насколько сильно модель забудет кодинг, рассуждения и работу с длинным контекстом. Селективное подавление добавляет в этот арсенал принципиально новый инструмент.

Селективное подавление знаний: основной принцип

Ключевая идея метода - не в том, чтобы «напомнить» модели старые данные через реплей, а в том, чтобы физически запретить изменять параметры, отвечающие за критически важные концепции. Модель не забывает, потому что нейронные пути, кодирующие старые знания, остаются нетронутыми.

Алгоритм работает в три этапа. Сначала он оценивает важность каждого параметра для сохранения ранее усвоенной информации. Затем выбирает порог: параметры с оценкой выше порога замораживаются, остальные остаются доступными для обновления. На третьем этапе запускается стандартный процесс обучения, но градиенты применяются только к незамороженным весам.

Главное отличие от полного переобучения или смешивания датасетов - в объёме данных, которые нужно обработать. Вам не нужен старый датасет. Достаточно самой модели и процедуры оценки важности параметров, которая выполняется один раз перед дообучением.

Как определяются критичные параметры?

Авторы используют подход на основе анализа чувствительности функции потерь. Для каждого параметра вычисляется, насколько сильно изменится выход модели на старых данных, если этот параметр слегка сдвинуть. Параметры с наибольшей чувствительностью помечаются как критичные.

Технически это реализуется через оценку диагонали матрицы Фишера или через прямое вычисление градиентов потерь на репрезентативной выборке из старого домена. Выборка может быть небольшой - достаточно нескольких тысяч примеров, покрывающих ключевые концепции, которые нужно сохранить. Это радикально снижает требования к памяти и вычислительным ресурсам по сравнению с хранением полного датасета.

Метод автоматически выделяет подмножество параметров, изменение которых минимально влияет на старые знания, но позволяет модели адаптироваться к новым. Важный нюанс: заморозка не бинарная. В некоторых конфигурациях можно задать разную скорость обучения для разных групп параметров, что даёт более тонкий контроль над балансом между сохранением и адаптацией.

Сравнение с традиционным подходом: вычислительные затраты и эффективность

Традиционный подход со смешиванием датасетов требует хранить, загружать и обрабатывать полный исторический корпус. Для модели масштаба LLaMA-70B это сотни гигабайт данных, которые нужно прогонять через пайплайн на каждой эпохе. Затраты на инфраструктуру вырастают кратно.

Метод селективного подавления заменяет эту работу однократным прогоном небольшой репрезентативной выборки для оценки важности параметров. После этого обучение идёт только на новых данных, а критичные веса заморожены. Вычислительная экономия достигается за счёт трёх факторов: отсутствия старого датасета в пайплайне, меньшего эффективного числа обучаемых параметров и отсутствия необходимости в сложных стратегиях сэмплирования для балансировки старых и новых данных.

Исследование показывает снижение затрат на порядок по сравнению со смешиванием датасетов. Конкретные цифры зависят от архитектуры модели и объёма новых данных, но ключевой выигрыш - в устранении зависимости от исторического корпуса. Для команд, работающих с ограниченными ресурсами, это разница между «можем дообучить» и «не можем себе позволить».

Стоит сопоставить этот подход с другими методами повышения эффективности обучения. Например, 20B Looping Model демонстрирует 10-кратную эффективность обучения за счёт архитектурных инноваций. Селективное подавление решает ортогональную задачу - не ускоряет предобучение с нуля, а делает дообучение безопасным и дешёвым.

Практическое применение: сценарии и ограничения

Метод наиболее полезен в сценариях, где модель уже обладает широкими общими знаниями, и требуется добавить узкую доменную экспертизу без деградации базовых способностей. Типичные кейсы: адаптация к юридической или медицинской терминологии, дообучение на новом языке, обновление фактологических знаний за определённый период.

Ограничения метода связаны с его новизной. Исследование из arXiv (2604.19089) - препринт, и независимая верификация на широком спектре архитектур пока отсутствует. Эффективность зависит от того, насколько корректно выбрана репрезентативная выборка для оценки важности параметров. Неудачная выборка может привести к заморозке не тех весов и, как следствие, к неоптимальному балансу между сохранением и адаптацией.

Метод также может требовать тонкой настройки порога заморозки. Слишком агрессивная заморозка оставляет модели мало свободы для усвоения нового. Слишком мягкая - не предотвращает забывание. Оптимальный порог зависит от конкретной задачи и архитектуры, и его поиск требует экспериментов.

Пример: дообучение на специализированном корпусе

Представьте модель, предобученную на общих текстах и демонстрирующую хорошие результаты в написании эссе, кодинге и логических рассуждениях. Вы хотите дообучить её на корпусе юридических документов, чтобы она могла анализировать контракты и составлять процессуальные документы.

При стандартном файнтюнинге модель через несколько эпох теряет способность писать связные тексты вне юридической тематики. Её словарь смещается в сторону формальной лексики, а креативность падает. С методом селективного подавления вы сначала прогоняете репрезентативную выборку из общих текстов, определяете параметры, критичные для общих языковых способностей, замораживаете их и дообучаете оставшиеся веса на юридическом корпусе. Модель приобретает юридическую экспертизу, сохраняя общие навыки.

Альтернативные методы борьбы с забыванием

Селективное подавление знаний - не первый метод, пытающийся решить проблему катастрофического забывания. Elastic Weight Consolidation (EWC) также оценивает важность параметров и штрафует их изменение, но делает это через добавление регуляризационного члена в функцию потерь, а не через жёсткую заморозку. EWC требует хранения информации Фишера для всех параметров, что может быть затратно для больших моделей.

Progressive Neural Networks идут другим путём: они добавляют новые слои под каждую новую задачу, фиксируя старые. Это гарантирует отсутствие забывания, но приводит к линейному росту числа параметров с каждой новой задачей - непрактично для сценариев с частыми дообучениями.

Replay-методы сохраняют подмножество старых данных и подмешивают их в обучение. Это наиболее близкий к традиционному подходу метод, но он требует хранения и обработки исторических данных. Селективное подавление выигрывает в простоте и снижении затрат: не нужен старый датасет, не нужны дополнительные слои, не нужен сложный регуляризационный член. Достаточно один раз определить важные параметры и заморозить их.

Интересно сопоставить этот подход с методами динамического управления слоями, такими как PoLar, который ускоряет инференс на 20-40%. Оба метода основаны на идее избирательного использования параметров модели, но решают разные задачи: PoLar оптимизирует инференс, селективное подавление - обучение.

Выводы: стоит ли внедрять селективное подавление знаний?

Метод селективного подавления знаний решает конкретную и дорогую проблему: как дообучить LLM на новых данных без катастрофического забывания и без необходимости хранить старый датасет. Для команд, которые регулярно адаптируют модели к новым доменам, это потенциально снижает вычислительные затраты на порядок.

Рекомендация: попробовать на небольших масштабах. Взять модель размером 1-3B параметров, воспроизвести логику оценки важности весов на репрезентативной выборке, заморозить критичные параметры и сравнить результаты с обычным файнтюнингом по метрикам сохранения общих способностей. Если метод покажет себя на малом масштабе, масштабирование на более крупные модели становится вопросом инженерной реализации.

Исследование предварительное, но направление многообещающее. Если независимая верификация подтвердит результаты, селективное подавление может стать стандартной практикой при continued pretraining, заменив ресурсоёмкое смешивание датасетов. Следите за развитием метода - это тот случай, когда академическая работа имеет прямой путь к промышленному внедрению.

Подписаться на канал