Перейти к содержанию
Публикация AiManual

Точная калибровка квантования Qwen3.8-27B: защита критических весов и влияние на качество

Какие веса Qwen3.8-27B защищать при квантовании? Разбираем KL-дивергенцию по 14 группам, неожиданные выводы об attn_v и attn_gate, чувствительность toolcalling

Коротко

Что будет в материале

  1. 01

    Введение: зачем нужна точная калибровка квантования для Qwen3.8-27B

  2. 02

    Методология: измерение KL-дивергенции для каждой группы весов

  3. 03

    Ключевые находки: какие веса действительно важны

  4. 04

    Парная защита token_embd и output_weight: влияние на категории задач

Квантование снижает затраты на инференс, но для гибридных архитектур стандартный подход часто приводит к непредсказуемой деградации. Qwen3.8-27B сочетает DeltaNet-слои и полные attention-блоки, поэтому чувствительность разных групп весов к потере точности распределена неравномерно. Исследование с измерением KL-дивергенции по 14 категориям весов показало: ключевые рычаги влияния - attn_qkv и ffn_down, а защита attn_v и attn_gate в комбинированной модели не дает эффекта. Парная защита token_embd и output_weight улучшает отдельные категории задач, а toolcalling деградирует сильнее всего. Три сборки - Bedrock, Tightrope и Gambit - демонстрируют разные компромиссы между размером и качеством.

Этот материал полезен ML-инженерам, которые разворачивают Qwen3.8-27B на ограниченном железе и хотят сохранить максимум точности без лишнего расхода памяти. Мы разбираем методологию, неожиданные результаты и практические рекомендации, которые можно перенести на другие LLM с гибридной архитектурой.

Введение: зачем нужна точная калибровка квантования для Qwen3.8-27B

Рост популярности LLM ставит перед командами задачу снижения стоимости инференса. Квантование весов - основной инструмент: модель сжимается с BF16 до Q4, Q3 или еще ниже, занимает меньше VRAM и работает быстрее. Проблема в том, что равномерное квантование всех слоев игнорирует разную чувствительность компонентов модели. Один слой может терять 0,1% точности, другой - 5%, и это напрямую влияет на итоговые метрики.

Qwen3.8-27B интересна тем, что ее архитектура неоднородна. Часть слоев использует DeltaNet - эффективный механизм обработки последовательностей с линейной сложностью, часть - классические attention-блоки с полным вычислением внимания. Такая гибридность означает, что распределение значимости весов отличается от стандартных transformer-моделей. Интуитивные предположения вроде «защищай все attention-веса» здесь не работают.

Цель исследования - измерить чувствительность каждой группы весов к квантованию через KL-дивергенцию, выявить критические компоненты и предложить стратегии сборки, которые дают лучший баланс размера и качества.

Методология: измерение KL-дивергенции для каждой группы весов

Подход строится на разбиении модели на 14 категорий весов. Для каждой группы измеряется KL-дивергенция между распределениями выходов оригинальной модели и версии, где квантована только эта группа. Затем измерения повторяются для комбинаций групп, чтобы увидеть, как эффекты складываются или компенсируются.

KL-дивергенция показывает, насколько сильно распределение вероятностей на выходе квантованной модели отклоняется от эталонного. Чем выше значение, тем больше информации теряется. Этот метод чувствительнее, чем сравнение финальных метрик на бенчмарках, потому что улавливает искажения на промежуточных слоях, которые могут не проявиться в конкретном тесте, но накапливаться в реальных сценариях.

Ограничение исследования: конкретные числовые значения KL-дивергенции не публикуются, качественные выводы при этом надежны и воспроизводимы. Методология применима к любой LLM, если есть доступ к промежуточным активациям.

Гибридная архитектура Qwen3.8-27B: DeltaNet и attention-блоки

Qwen3.8-27B чередует два типа слоев. DeltaNet обрабатывает последовательности с линейной сложностью по длине контекста, что ускоряет инференс на длинных входных данных. Полные attention-блоки вычисляют классическое скалярное произведение query, key и value, обеспечивая высокую выразительность на коротких и средних контекстах.

Гибридная архитектура меняет распределение значимости весов. В DeltaNet-слоях часть параметров работает как гейты и проекции состояния, в attention-блоках - как матрицы запросов, ключей и значений. Квантование одного и того же типа весов в разных типах слоев может давать разный эффект. Поэтому анализ по категориям, а не по слоям, дает более точную картину.

14 категорий весов: что измерялось

Модель разбита на следующие группы:

  • attn_qkv - объединенная матрица query, key, value в attention-блоках
  • attn_v - отдельная матрица value, если она выделена из QKV
  • attn_gate - гейт внимания, управляющий вкладом attention-выхода
  • attn_out - выходная проекция attention-блока
  • ffn_up - проекция вверх в feed-forward сети
  • ffn_down - проекция вниз после активации
  • ffn_gate - гейт в feed-forward сети
  • token_embd - матрица эмбеддингов входных токенов
  • output_weight - матрица выходного слоя, проецирующая скрытое состояние в логиты токенов
  • delta_state - параметры состояния DeltaNet
  • delta_gate - гейты DeltaNet-слоев
  • delta_proj - проекции внутри DeltaNet
  • norm - параметры нормализации
  • other - прочие веса, не вошедшие в перечисленные группы

Каждая группа квантовалась отдельно, затем в комбинациях с другими. Это позволило отделить индивидуальную чувствительность от эффектов взаимодействия.

Ключевые находки: какие веса действительно важны

Результаты опровергают часть интуитивных предположений. Наиболее сильное влияние на качество оказывают attn_qkv и ffn_down. Защита этих групп в высокой точности значительно снижает KL-дивергенцию и улучшает метрики на бенчмарках. В то же время attn_v и attn_gate, которые часто считаются критическими, в комбинированной модели не дают заметного эффекта при защите.

Почему защита attn_v и attn_gate неэффективна

При изолированном квантовании attn_v и attn_gate могут показывать заметную KL-дивергенцию. Но когда квантуются все группы одновременно, эффект от защиты этих весов нивелируется. Возможная причина - избыточность: другие компоненты, такие как attn_qkv и ffn_down, компенсируют искажения, вносимые квантованными attn_v и attn_gate.

Этот результат подчеркивает важность тестирования комбинаций, а не только отдельных групп. Если бы исследование ограничилось изолированными измерениями, выводы были бы ошибочными: attn_v и attn_gate выглядели бы важными, хотя в реальной сборке их защита не дает выгоды.

attn_qkv и ffn_down: главные рычаги влияния

attn_qkv объединяет вычисление query, key и value. Ошибки в этой матрице искажают механизм внимания на каждом слое, что каскадно влияет на все последующие представления. Даже небольшая потеря точности здесь приводит к заметному росту KL-дивергенции.

ffn_down - проекция после активации в feed-forward сети. Она формирует выходное представление слоя, которое передается дальше. Квантование ffn_down напрямую искажает информацию, которую модель передает между слоями. Защита этой группы в BF16 или Q8 дает наибольший прирост качества на единицу дополнительной памяти.

Практический вывод: при ограниченном бюджете точности в первую очередь защищайте attn_qkv и ffn_down, а остальные группы квантуйте агрессивнее.

Парная защита token_embd и output_weight: влияние на категории задач

token_embd и output_weight работают с одним и тем же пространством токенов. Первая преобразует входные токены в векторы, вторая - скрытое состояние в логиты для предсказания следующего токена. Их совместная защита дает синергетический эффект: ошибки в эмбеддингах и выходной матрице складываются, искажая лексическое представление модели.

Парная защита этих групп улучшает качество генерации для задач, требующих точного воспроизведения лексики: генерация кода, фактические ответы, работа с именами и терминами. В этих сценариях модель должна выдавать точные токены, а не просто семантически близкие. Квантование token_embd и output_weight по отдельности дает меньший эффект, чем их совместная защита.

Для задач с высокой толерантностью к перефразированию, например, суммаризации или креативного письма, выгода от парной защиты ниже. Здесь можно квантовать эти группы сильнее без заметной потери качества.

Чувствительность toolcalling к квантованию

Toolcalling - вызов внешних инструментов - требует точного следования формату. Модель должна генерировать корректные имена функций, параметры и типы данных. Даже небольшие искажения весов приводят к ошибкам: неправильное имя инструмента, неверный тип аргумента, нарушение JSON-структуры.

В тестах toolcalling показал наибольшую деградацию среди всех категорий задач. Причина в том, что этот сценарий не прощает даже единичных ошибок в токенах. Если модель в свободной генерации может перефразировать ответ, то в toolcalling любое отклонение от схемы ломает вызов.

Рекомендация: для моделей, ориентированных на агентные сценарии, используйте более высокую точность квантования или дополнительно калибруйте на задачах toolcalling. Если Qwen3.8-27B планируется для вызова инструментов, рассмотрите сборку Gambit или защиту attn_qkv, ffn_down, token_embd и output_weight в BF16.

Сравнение трех сборок: Bedrock, Tightrope, Gambit

Три сборки демонстрируют спектр компромиссов между размером и качеством:

  • Bedrock - базовая сборка без специальной защиты. Все группы квантованы равномерно. Наименьший размер, но заметная деградация на чувствительных задачах.
  • Tightrope - сбалансированная защита ключевых весов. attn_qkv и ffn_down сохранены в более высокой точности, остальные группы квантованы агрессивнее. Хороший компромисс для большинства сценариев.
  • Gambit - агрессивная защита многих групп. Дополнительно защищены token_embd, output_weight и часть DeltaNet-параметров. Наилучшее качество, но больший размер.

Метрики и компромиссы

Конкретные числовые значения метрик не публикуются, но относительные различия ясны. Bedrock показывает наибольшую KL-дивергенцию и худшие результаты на бенчмарках, особенно на toolcalling. Tightrope значительно улучшает качество за счет защиты двух ключевых групп при умеренном росте размера. Gambit дает наилучшие метрики, приближаясь к оригинальной модели, но требует больше VRAM.

Выбор сборки зависит от сценария. Для чат-ботов и генерации текста Tightrope обеспечивает оптимальный баланс. Для агентных систем и точных ответов лучше выбрать Gambit. Bedrock подходит для экспериментов и задач с высокой толерантностью к ошибкам.

Практические рекомендации по калибровке квантования LLM

Результаты исследования Qwen3.8-27B обобщаются в следующие принципы:

  1. Проводите анализ чувствительности весов с помощью KL-дивергенции перед квантованием. Это дешевле, чем перебор конфигураций на бенчмарках.
  2. Не полагайтесь на интуицию. Некоторые веса, которые кажутся важными, могут оказаться незначимыми в комбинации с другими.
  3. Защищайте attn_qkv и ffn_down в первую очередь. Эти группы дают наибольший прирост качества на единицу памяти.
  4. Рассмотрите парную защиту token_embd и output_weight для задач, чувствительных к лексике: код, факты, имена.
  5. Для toolcalling используйте более высокую точность или дополнительную калибровку на агентных задачах.
  6. Тестируйте несколько конфигураций, как Bedrock, Tightrope и Gambit, и выбирайте по метрикам, релевантным вашему сценарию.

Методология применима к другим LLM. Если вы работаете с квантованием DeepSeek, Gemma или других моделей, измерение KL-дивергенции по группам весов поможет избежать типичных ошибок. Полезные материалы по теме: тестирование квантованных версий DeepSeek Flash 0731 и SLQ - новый стандарт квантизации LLM.

Заключение: точная калибровка как путь к эффективному квантованию

Измерение KL-дивергенции по группам весов выявляет критически важные компоненты и позволяет оптимизировать квантование без слепого перебора. Для Qwen3.8-27B ключевыми оказались attn_qkv и ffn_down, а защита attn_v и attn_gate неэффективна в комбинированной модели. Парная защита token_embd и output_weight улучшает задачи, чувствительные к лексике, а toolcalling требует особого внимания.

Три сборки - Bedrock, Tightrope, Gambit - дают спектр компромиссов. Выбор зависит от сценария использования. Применяйте подобный анализ в своих проектах, чтобы достичь лучшего баланса между размером модели и качеством ответов. Больше о локальных моделях и их квантизации: сравнение локальных LLM на бенчмарке SWE-Verified.

Подписаться на канал