Дообучение модели на целевом датасете без цепочек рассуждений (CoT-traces) обнуляет её способность решать логические задачи. Точность падает с 70% до 0% на контрольных метриках. Self-Distilled Reasoning (SDR) - техника, которая предотвращает эту деградацию. Базовая модель генерирует собственные reasoning-трейсы, вы добавляете их в тренировочные данные и получаете прирост таргетной производительности более чем на 6,5% относительно лучших чекпоинтов с model merging. Общие способности, включая математическое рассуждение на уровне Math ≈ 68%, сохраняются.
SDR решает конкретную проблему: стандартное SFT на данных без CoT-трейсов вызывает катастрофическое забывание. Модель перестаёт рассуждать и выдает ответы, которые выглядят правдоподобно, но логически ошибочны. В этом руководстве разобран механизм подавления рассуждений, пошаговый процесс самодистилляции, выбор учительской модели между Amazon Nova 2 Lite и Pro, работа с неполными данными и сравнение с альтернативами. Все цифры взяты из практических экспериментов с семейством Amazon Nova 2.
Что такое Self-Distilled Reasoning и зачем он нужен при SFT
SFT-кастомизация без CoT-трейсов выглядит как быстрое решение: берёте датасет из пар «вопрос-ответ», дообучаете модель и получаете специализированную версию. Проблема в том, что модель теряет способность строить промежуточные шаги рассуждения. Внешне ответы остаются связными, но логическая структура разрушается. SDR восстанавливает этот баланс через механизм самодистилляции, где модель выступает и учителем, и учеником.
Почему обычное SFT убивает рассуждения: феномен reasoning suppression
Reasoning suppression - прямое следствие распределения вероятностей в тренировочных данных. Когда каждый пример в датасете состоит только из вопроса и финального ответа, модель обучается минимизировать путь к решению. Она перестаёт генерировать промежуточные токены, содержащие логические шаги. На задачах, требующих многоходового рассуждения, это приводит к катастрофическому провалу.
Цифры из экспериментов с Amazon Nova 2: стандартное SFT на доменном датасете без CoT-трейсов снижает точность на контрольных метриках с 70% до 0%. Модель не просто ошибается - она полностью теряет способность решать задачи, которые ранее обрабатывала уверенно. Это классическое катастрофическое забывание в контексте LLM, где новые веса перезаписывают паттерны, отвечающие за рассуждение.
Поверхностные решения не работают. Добавление случайных примеров с рассуждениями из других доменов не восстанавливает логику. Model merging частично возвращает способности, но даёт нестабильные результаты. Требуется системный подход, который сохраняет структуру рассуждений именно для целевых задач.
Как SDR восстанавливает баланс: ключевая идея самодистилляции
SDR работает в три этапа. Первый: базовая модель (учитель) получает на вход примеры из целевого датасета и генерирует полные цепочки рассуждений - reasoning-трейсы. Второй: эти трейсы добавляются к исходным парам «вопрос-ответ», создавая расширенный тренировочный датасет. Третий: та же модель (ученик) дообучается на расширенных данных, где каждый пример содержит не только финальный ответ, но и путь к нему.
Ключевое отличие SDR от классической дистилляции: учитель и ученик - одна и та же модель. Никакой внешней более сильной модели не требуется. Базовая версия генерирует трейсы, которые затем использует для собственного обучения. Это устраняет проблему несоответствия стилей рассуждений между разными моделями и снижает затраты на инференс.
Результат: модель сохраняет способность рассуждать в целевом домене и одновременно улучшает таргетные метрики. Прирост более 6,5% относительно лучших чекпоинтов с model merging подтверждает, что самодистилляция эффективнее механического смешивания весов. Math ≈ 68% показывает, что общие математические способности не деградируют.
Пошаговое применение SDR для кастомизации Amazon Nova 2
Практическое внедрение SDR начинается с выбора учительской модели и определения объёма данных для генерации трейсов. Эксперименты на семействе Amazon Nova 2 дают конкретные рекомендации, которые можно перенести на другие модели со схожей архитектурой. Два основных сценария: полная кастомизация со 100% покрытием трейсов и работа с частичными данными, где менее 50% примеров получают цепочки рассуждений.
Процесс генерации трейсов требует промпта, который инструктирует модель выдавать пошаговое рассуждение перед финальным ответом. Формат данных для SFT: каждый пример дополняется полем reasoning, содержащим сгенерированную цепочку. Интеграция в пайплайн стандартна - расширенный датасет подаётся на вход тому же скрипту дообучения, который использовался бы для обычного SFT.
Выбор учительской модели: почему Nova 2 Lite выигрывает у Pro
Интуитивно кажется, что более сильная модель - Nova 2 Pro - сгенерирует более качественные трейсы и даст лучший результат. Практика показывает обратное. Nova 2 Lite как учитель обеспечивает лучший баланс между качеством рассуждений и сохранением общих способностей ученика.
Причина в характере генерируемых трейсов. Nova 2 Pro склонна к избыточно детализированным рассуждениям, которые содержат шум и специфические паттерны, не характерные для целевого домена. Эти паттерны при самодистилляции переносятся в ученика и могут конфликтовать с целевыми данными. Nova 2 Lite генерирует более сжатые и релевантные цепочки, которые лучше интегрируются в тренировочный процесс.
Дополнительный фактор - стоимость. Инференс Nova 2 Lite дешевле, а качество итоговой модели оказывается выше. Для продуктовых сценариев, где важна каждая копейка вычислительного бюджета, это двойной выигрыш: меньше затраты на генерацию трейсов и лучше финальные метрики.
Сценарий с неполными данными: SDR при менее 50% reasoning-трейсов
Генерация трейсов для всего датасета может быть дорогой или технически невозможной из-за ограничений API. SDR сохраняет эффективность даже когда только часть примеров дополнена цепочками рассуждений. Эксперименты с покрытием менее 50% показывают, что модель всё ещё избегает катастрофического забывания и улучшает таргетные метрики.
Практическая рекомендация: распределяйте трейсы равномерно по категориям датасета. Если у вас 10 000 примеров и бюджет на генерацию 4 000 трейсов, выберите по 400 из каждой категории, а не 4 000 из одной. Это обеспечивает репрезентативное покрытие и предотвращает перекос в сторону одного типа рассуждений.
Метрики при частичном покрытии ожидаемо ниже, чем при 100% трейсов, но значительно превосходят результаты стандартного SFT без рассуждений. Падение точности с 70% до 0% не происходит. Модель сохраняет способность рассуждать, хотя и с несколько меньшей глубиной, чем при полной самодистилляции.
SDR против альтернатив: сравнение с model merging и другими подходами
Model merging - популярная техника сохранения способностей при дообучении. Методы вроде TIES и DARE смешивают веса базовой и дообученной моделей, пытаясь сохранить общие навыки. SDR даёт прирост более 6,5% относительно лучших чекпоинтов, полученных через merging. Разница принципиальна: merging механически комбинирует веса, а SDR учит модель рассуждать в целевом домене.
Другие подходы - replay (добавление старых данных в тренировочный сет) и EWC (elastic weight consolidation) - имеют свои ограничения. Replay требует доступа к оригинальным тренировочным данным, что не всегда возможно из-за лицензионных или технических ограничений. EWC замедляет обучение на новых данных и не гарантирует сохранение reasoning именно в том виде, который нужен для целевых задач.
SDR не требует доступа к старым данным. Все трейсы генерируются из текущего состояния модели. Это особенно ценно в сценариях, где исходный датасет недоступен или его распространение ограничено. Плата за это - ресурсы на инференс для генерации трейсов, но затраты линейны относительно размера датасета и хорошо прогнозируются.
Метрики и результаты: что даёт SDR на практике
Количественные результаты SDR на семействе Amazon Nova 2: таргетная производительность вырастает более чем на 6,5% относительно лучших чекпоинтов с model merging. Это не просто статистическая погрешность - разница воспроизводится на нескольких доменных датасетах и сохраняется при варьировании гиперпараметров.
Метрики измерялись стандартными методами: accuracy на отложенной выборке целевого датасета для таргетной производительности, Math-бенчмарки для оценки сохранения общих способностей. Важно, что результаты получены в контролируемых условиях с фиксированными сидами и одинаковыми вычислительными бюджетами. Прямое сравнение с model merging проводилось на одних и тех же чекпоинтах базовой модели.
Сохранение общих способностей: Math и не только
Math ≈ 68% - ключевая метрика, демонстрирующая сохранение reasoning. Это не максимально возможный результат для модели такого размера, но он показывает, что математические способности не деградировали до нуля, как при стандартном SFT. Модель сохраняет универсальность и может решать задачи за пределами целевого домена.
Для продуктовых сценариев это критически важно. Чат-бот, обученный на документации конкретного продукта, должен не только отвечать на вопросы о продукте, но и понимать арифметику в запросах пользователя. Модель, потерявшая Math, не сможет посчитать сумму заказа или сравнить даты. SDR гарантирует, что базовые когнитивные способности остаются нетронутыми.
Аналогичный подход применим к другим общим метрикам: логическое рассуждение, понимание естественного языка, следование инструкциям. SDR сохраняет их на уровне, достаточном для практического использования, в отличие от стандартного SFT, которое обнуляет эти способности.
Ограничения SDR и когда стоит выбрать другой подход
SDR не универсальное решение. Первое ограничение - стоимость генерации трейсов для очень больших датасетов. Если у вас 10 миллионов примеров, инференс для каждого обойдётся в значительную сумму. В таких случаях рассмотрите гибридный подход: SDR для подмножества критически важных категорий и стандартное SFT для остальных данных.
Второе ограничение - специфические домены, где базовая модель не способна сгенерировать качественные рассуждения. Если целевая задача требует экспертных знаний, которых нет в предобученной модели, сгенерированные трейсы будут содержать ошибки. Эти ошибки затем закрепятся при самодистилляции. Решение: привлечение доменных экспертов для валидации трейсов или использование внешней модели с релевантными знаниями в качестве учителя.
Третье ограничение - латентность. Трейсы добавляют токены в тренировочные примеры, что увеличивает время инференса итоговой модели. Для сценариев с жёсткими требованиями к скорости ответа (real-time системы) дополнительные токены рассуждений могут быть неприемлемы. Альтернатива: дистилляция рассуждений в скрытые состояния модели без генерации текстовых трейсов - активно исследуемая область, но готовых production-решений пока нет.
Когда SDR неоптимален: датасеты размером в десятки миллионов примеров, домены с уникальной терминологией вне предобучения модели, системы с предельно низкой латентностью. В этих случаях рассмотрите комбинацию model merging с выборочным replay или адаптеры (LoRA) с заморозкой части весов.
Практические рекомендации и следующий шаг
Ключевые takeaways из этого руководства: используйте SDR с Amazon Nova 2 Lite в роли учителя, начинайте с малого датасета для валидации подхода, обязательно мониторьте общие метрики (Math, логическое рассуждение) наряду с таргетной точностью. Не полагайтесь на model merging как на единственный метод сохранения способностей - SDR даёт прирост более 6,5% сверх лучших результатов merging.
Порядок действий для эксперимента: возьмите 500-1000 примеров из целевого датасета, сгенерируйте reasoning-трейсы через Nova 2 Lite, добавьте их в тренировочные данные, проведите SFT и сравните метрики с baseline без трейсов. Если результат положительный, масштабируйте на весь датасет, начиная с наиболее критичных категорий.
Методология самодистилляции активно развивается. Появляются техники, которые сокращают стоимость генерации трейсов через адаптивный роутинг и дистилляцию шаблонов. Методология A.L.F.R.E.D. показывает, как малые модели с шаблонами превосходят гигантов на 35B параметров при четырёхкратном ускорении. Эти подходы можно комбинировать с SDR для дальнейшей оптимизации.
AI-MANUAL продолжит отслеживать и документировать техники кастомизации LLM. Если вы провели собственные эксперименты с SDR на других моделях или доменах - результаты и наблюдения помогут сообществу быстрее находить рабочие конфигурации. Практические данные ценнее теоретических обещаний.