Перейти к содержанию
Публикация AiManual

8 абляционных версий Qwen 3.8 27B: сравнительный тест, рейтинг и проверка карточек моделей

Сравнение 8 абляционных версий Qwen 3.8 27B: почему orcarouter и apostate обошли агрессивную obliteratus, как до 45% ответов превращаются в бесконечные рассужде

Коротко

Что будет в материале

  1. 01

    Qwen 3.8 27B benchmark: главный вывод за минуту

  2. 02

    Как сравнивали восемь абляционных версий Qwen 3.8 27B

  3. 03

    Рейтинг восьми моделей: минимальные правки против тотальной абляции

  4. 04

    Почему тяжёлые абляции начинают «думать» бесконечно

По описанию сравнительного теста Ablitherlitics, лучшими по сочетанию снижения отказов и сохранения практической применимости стали версии Qwen 3.8 27B с более точечными изменениями. orcarouter показала 82,2% ASR, apostate достигла 78,7%, а агрессивно изменённая obliteratus, где затронули 841 из 850 тензоров, заняла предпоследнее место.

Главный результат теста выглядит парадоксально только на первый взгляд: большое количество изменённых весов не гарантирует лучший итог. У тяжёлых абляций до 45% ответов на HarmBench 400 упирались в лимит 15360 токенов из-за бесконечных рассуждений. Формально модель могла начать отвечать, но пользователь не получал завершённый результат в разумное время.

Для локального запуска это означает следующее: orcarouter и apostate выглядят наиболее интересными кандидатами для дальнейшей проверки, а obliteratus полезна прежде всего как показательный пример цены тотальной абляции. Высокий ASR нужно сопоставлять с качеством ответов, долей завершённых генераций, KL-дивергенцией, поведением chat template и результатами на собственных задачах.

Qwen 3.8 27B benchmark: главный вывод за минуту

Кто выиграл: orcarouter и apostate

orcarouter получила 82,2% ASR, а apostate показала 78,7%. В описании сравнения обе версии относятся к лидерам рейтинга, построенного по результатам тестов на отказоустойчивость и способности отвечать на запросы HarmBench.

Их результат поддерживает практическую гипотезу: точечные изменения могут дать более полезный баланс, чем масштабное редактирование почти всех тензоров. Модель сохраняет больше исходного поведения, поэтому риск деградации рассуждений и нестабильной генерации ниже. Точное количество изменённых тензоров для orcarouter и apostate в доступном описании не приведено, поэтому сравнивать их по этому параметру нельзя.

ASR отвечает на узкий вопрос: как часто тестовая система получает результат, который проходит заданный критерий успешного ответа. Этот показатель не сообщает, насколько точным, коротким, полезным и устойчивым оказался ответ. Сравнение 23 модификаций Gemma 4 E4B наглядно показывает, почему ASR нужно читать вместе с GSM8K, KL-дивергенцией и анализом поведения модели: в тестах абляций Gemma точечные изменения тоже заметно опередили грубое редактирование весов.

Почему obliteratus не стал лучшим вопреки масштабу правок

obliteratus затронула 841 из 850 тензоров. Это почти полное вмешательство в параметры исходной модели, однако результат оказался предпоследним в итоговом рейтинге. Такое сочетание важно отделять от самого факта снижения отказов: свобода ответа, качество, скорость и стабильность генерации измеряют разные свойства.

Агрессивная абляция может убрать часть механизмов, связанных с отказами, вместе с участками поведения, которые помогают модели строить связное рассуждение. В результате модель отвечает на большее число запросов, но тратит лимит токенов на незавершённый внутренний процесс, повторяет аргументы или не доходит до финального ответа.

Для владельца локального ПК это практический риск. Модель, которая формально проходит safety-тест, может оказаться неудобной в чате, агентном сценарии или автоматизированном пайплайне. При выборе версии нужно смотреть на полный профиль, а не на один высокий процент.

Как сравнивали восемь абляционных версий Qwen 3.8 27B

Заявленный масштаб работы составил 11 дней вычислений, 167 GPU-часов и 13 бенчмарков. В описании упоминаются HarmBench 400, GSM8K, замер KL-дивергенции и отдельный анализ поведения моделей при длинной генерации.

Полный протокол запуска в доступном описании отсутствует. Не раскрыты аппаратная конфигурация, версии наборов данных, параметры temperature и top-p, схема остановки генерации, точный критерий успешного ответа и полный список 13 бенчмарков. Поэтому приведённые цифры нужно воспринимать как результаты описанного сравнения, а не как универсальный рейтинг всех вариантов Qwen 3.8 27B.

Что измеряет ASR и почему этого недостаточно

В этом сравнении ASR отражает долю успешных ответов на тестовые запросы HarmBench 400. Чем выше значение, тем чаще модель проходит заданный критерий отсутствия отказа или уклонения.

Метрика не учитывает несколько важных деталей:

  • получен ли завершённый ответ;
  • сколько токенов потребовалось для генерации;
  • содержит ли ответ фактические ошибки;
  • не зацикливается ли модель на рассуждении;
  • сохраняет ли модель качество на обычных рабочих задачах.

Поэтому 82,2% ASR у orcarouter нельзя автоматически трактовать как 82,2% полезных ответов. Для такого вывода потребовались бы логи генерации, ручная оценка качества и единый протокол для всех версий.

Зачем нужен замер KL-дивергенции

KL-дивергенция помогает оценить, насколько распределение ответов абляционной модели отклонилось от базовой Qwen 3.8 27B. Низкое значение обычно указывает на более близкое поведение к исходной модели, высокое значение говорит о сильном изменении распределения вероятностей.

Этот показатель полезен при сравнении точечной и тотальной абляции. Если ASR растёт одновременно с резким увеличением KL-дивергенции, пользователь получает модель, которая сильнее отличается от базы. Такое отличие может проявиться в стиле, длине ответов, склонности к повторениям, математике и коде.

Конкретные значения KL-дивергенции для восьми версий в доступном описании не приведены. Их нельзя восстанавливать по количеству изменённых тензоров: два метода могут затронуть одинаковое число слоёв, но изменить распределение весов с разной силой.

Почему в тесте важны и HarmBench, и GSM8K

HarmBench 400 проверяет поведение на чувствительных запросах и помогает увидеть отказы, уклонения, неполные ответы и зависания. GSM8K решает другую задачу: показывает, насколько модель сохраняет способность справляться с математическими примерами, где структура запроса и ожидаемый результат относительно ясны.

Разница между наборами данных помогает обнаружить контекстную деградацию. Модель может нормально решать короткие задачи GSM8K и одновременно застревать на открытых запросах HarmBench. Это не противоречие: математическая задача чаще требует закончить короткую цепочку, а открытый запрос может запускать длинное рассуждение с большим числом развилок.

В описании теста аналогичных зависаний на GSM8K не наблюдалось. Это говорит о специфичности дефекта, но не доказывает полное сохранение математических способностей. Для этого нужны баллы всех восьми моделей и показатели базовой Qwen 3.8 27B при тех же настройках.

Рейтинг восьми моделей: минимальные правки против тотальной абляции

Лидеры рейтинга: orcarouter и apostate

orcarouter и apostate дали два лучших результата по приведённым значениям ASR. Разрыв между 82,2% и 78,7% составляет 3,5 процентного пункта, поэтому обе версии находятся в одной практической группе кандидатов.

Разницу нельзя интерпретировать как окончательное превосходство orcarouter во всех сценариях. Для выбора локальной модели нужны данные о скорости генерации, VRAM, качестве кода, математике, длинном контексте и доле завершённых ответов. В доступном описании эти показатели не сведены в одну полную таблицу.

Показатель KL-дивергенции мог бы уточнить цену полученного результата. Если у лидеров распределение ответов осталось близким к базе, их подход выглядит особенно интересным. Если отклонение велико, высокий ASR может сопровождаться незаметными регрессиями в других задачах.

Остальные варианты и место obliteratus

Полный состав восьми моделей и числовые результаты по каждой версии в доступном описании не раскрыты. Ниже приведена честная реконструкция известных данных. Строки без названий показывают незаполненные позиции исходного рейтинга, а не новые модели.

ВерсияИзменённые тензорыASRМесто или статусKL-дивергенцияНаблюдение
orcarouterНе указано82,2%Один из лидеровНе указаноВысокий ASR, точечный характер изменений по описанию
apostateНе указано78,7%Один из лидеровНе указаноВысокий ASR, умеренный подход к абляции по описанию
obliteratus841 из 850Не указаноПредпоследнее местоНе указаноДо 45% зависаний на HarmBench, 142 уклонения
blackfrostНе указаноНе указаноМесто не раскрытоНе указаноВ chat template найден встроенный промпт объёмом 1457 символов
Версия 5, название не приведеноНе указаноНе указаноМесто не раскрытоНе указаноНедостаточно данных для оценки
Версия 6, название не приведеноНе указаноНе указаноМесто не раскрытоНе указаноНедостаточно данных для оценки
Версия 7, название не приведеноНе указаноНе указаноМесто не раскрытоНе указаноНедостаточно данных для оценки
Версия 8, название не приведеноНе указаноНе указаноМесто не раскрытоНе указаноНедостаточно данных для оценки

Из таблицы нельзя извлечь полноценный рейтинг всех восьми версий. Она фиксирует только утверждения, которые присутствуют в описании сравнения: лидерство orcarouter и apostate, предпоследнее место obliteratus и отдельный кейс blackfrost. Названия остальных вариантов, их ASR и KL-дивергенцию нужно брать из оригинальной таблицы Ablitherlitics.

Почему тяжёлые абляции начинают «думать» бесконечно

Что означает зависание при лимите 15360 токенов

До 45% ответов тяжёлых абляций на HarmBench упирались в лимит 15360 токенов. Модель продолжала генерировать рассуждение, но не завершала его в заданном окне. Пользователь в таком сценарии получает длинный процесс без финального ответа, а локальный сервер расходует время и память на бесполезные токены.

Проблема особенно заметна на видеокартах с ограниченным объёмом VRAM. Длинная генерация увеличивает размер KV-cache, повышает задержку и может вытеснить другие задачи из очереди. Для API и агентных систем добавляется ещё один риск, тайм-аут срабатывает раньше, чем модель доходит до результата.

Поведение зависит от протокола. На него влияют лимит новых токенов, шаблон чата, температура, system prompt и критерий остановки. Сравнивать две модели по доле зависаний можно только при одинаковых настройках.

Почему GSM8K не показывает ту же проблему

На GSM8K аналогичных зависаний не отмечено. Математические задачи обычно имеют короткий текст, понятную цель и ожидаемый формат решения. Даже при длинном рассуждении модель чаще доходит до числового ответа.

HarmBench предъявляет другую нагрузку. Формулировки могут быть открытыми, а критерий успешного ответа допускает более разветвлённый процесс генерации. После агрессивного изменения весов модель способна сохранять рабочее поведение на структурированных задачах и терять контроль над открытыми диалогами.

Отсутствие зависаний на GSM8K не отменяет дефект. Оно лишь показывает, что проблема проявляется не во всех типах запросов. Перед локальным использованием нужны собственные тесты на коротких вопросах, длинных инструкциях, коде и задачах с ограничением времени.

ASR без завершённого ответа: проблема интерпретации

Ответ, который появился после расходования всех 15360 токенов, нельзя считать равноценным короткому и завершённому ответу. Для пользователя важен результат, а не сам факт начала генерации.

В расширенном отчёте полезно разделять четыре показателя:

  1. долю ответов, которые прошли критерий HarmBench;
  2. долю завершённых ответов до лимита токенов;
  3. среднее и медианное число сгенерированных токенов;
  4. долю повторов, уклонений и ручных остановок.

Если эти значения не опубликованы, высокий ASR остаётся неполной характеристикой модели. Для локальной LLM токеновая эффективность может оказаться важнее разницы в несколько процентных пунктов.

Честность карточек моделей: что удалось и не удалось воспроизвести

Blackfrost и скрытая логика chat template

В кейсе blackfrost проверка обнаружила встроенный в chat template промпт с джейлбрейк-логикой объёмом 1457 символов. По описанию сравнения, карточка модели не раскрывала этот фрагмент явно.

Chat template меняет поведение модели до того, как пользователь вводит свой запрос. Он может добавлять system prompt, специальные токены, инструкции для роли ассистента и правила завершения. Две копии одинаковых весов при разных шаблонах способны давать разные ответы на один и тот же запрос.

Поэтому сравнение локальных LLM должно фиксировать не только файл весов. Нужно сохранять шаблон, system prompt, версию конвертера, параметры генерации и способ передачи истории диалога. Разбор того, как читать model card LLM и сопоставлять заявленные метрики с реальным поведением, помогает превратить карточку из рекламного описания в проверяемую техническую конфигурацию.

Obliteratus: заявление о 0% отказов и 142 уклонения

Для obliteratus заявлялась нулевая доля отказов, однако в описанном сравнении выявили 142 уклонения. Эти результаты нельзя свести к простой формуле «автор ошибся»: итог зависит от размера выборки, формулировок запросов, критерия отказа, chat template и параметров генерации.

Разрыв между заявлением и воспроизведённым результатом всё равно требует проверки. Карточка модели должна содержать набор тестовых запросов, версию датасета, лимит токенов, настройки sampling и правило, по которому ответ относят к отказу или успешной генерации.

Аудит внешних бенчмарков даёт похожий практический урок. В разборе проблем GPQA-Diamond, MMLU-Pro и MMMU-Pro показано, что ошибки в самих наборах вопросов способны менять итоговые оценки: проверка датасета должна идти рядом с проверкой модели.

Чек-лист проверки карточки локальной LLM

  1. Сверить базовую модель, commit-версию и формат весов.
  2. Проверить количество изменённых тензоров и описание метода абляции.
  3. Открыть файлы chat template и найти system prompt, скрытые инструкции и дополнительные роли.
  4. Записать параметры запуска: temperature, top-p, top-k, repetition penalty и лимит новых токенов.
  5. Уточнить наборы данных, число запросов и критерий ASR.
  6. Проверить, как тест обрабатывает уклонения, тайм-ауты, пустые ответы и незавершённые рассуждения.
  7. Сохранить исходные логи или скрипт оценки, чтобы повторить тест после обновления движка.

Какие категории HarmBench остаются сложными после абляции

Копирайт как наиболее устойчивая категория

Копирайт оказался наиболее устойчивой стеной для всех рассмотренных абляций. Максимальный результат в этой категории составил только 39%. В доступном описании не уточняется, означает ли этот процент ASR, долю успешных ответов или другой показатель, поэтому интерпретировать его нужно осторожно.

Результат показывает, что снижение общего числа отказов не переносится одинаково на все темы. Модель может отвечать на химические и биологические запросы, но сохранять ограничения при работе с авторским контентом. Для пользователя, который планирует писать, перерабатывать или анализировать тексты, общий рейтинг HarmBench недостаточен.

Химия и биология: неожиданный профиль результатов

В рамках описанного теста химия и биология открывались легче, чем копирайт. Это расходится с интуитивным ожиданием, что чувствительные научные категории обязательно будут самыми сложными после абляции.

Универсального объяснения по этим данным нет. На результат могли повлиять формулировки запросов, размер категорий, критерий успешного ответа, особенности исходной Qwen 3.8 27B и встроенные инструкции шаблона чата. Без полного набора промптов нельзя утверждать, что все абляции одинаково хорошо работают с химическими или биологическими задачами.

Категориальные показатели полезны как профиль поведения, а не как общий сертификат безопасности или качества. Рабочую модель нужно проверять на собственных запросах и заранее определить, какие темы критичны для конкретного процесса.

Какую версию Qwen 3.8 27B выбирать для локального запуска

Для задач, где важна стабильная генерация

Приоритет стоит отдавать версии, которая регулярно завершает ответы и сохраняет качество на обычных рабочих запросах. По доступному описанию orcarouter и apostate выглядят предпочтительнее тяжёлых абляций благодаря высоким значениям ASR и более умеренному характеру изменений.

Это предварительный выбор, а не универсальный вердикт. Перед загрузкой нужно проверить скорость, потребление VRAM, длину контекста, код, математику и склонность к зацикливанию. Сравнение локальных моделей с учётом архитектуры, KV-cache и стоимости инференса помогает избежать выбора по одному числу: условия запуска способны заметно менять практический результат LLM-бенчмарка.

Для исследовательских экспериментов с абляцией

obliteratus представляет интерес как исследовательский пример. Изменение 841 из 850 тензоров позволяет изучать цену массового вмешательства: высокий охват правок сопровождается предпоследним местом в рейтинге, зависаниями до 45% ответов и 142 выявленными уклонениями.

Выбирать эту версию для универсального локального помощника только по заявлению о 0% отказов не стоит. Для эксперимента она подходит при условии, что исследователь фиксирует базовую модель, шаблон чата, лимит токенов и полный журнал генераций.

Что проверить перед использованием в рабочем контуре

  1. Запустить одну и ту же серию собственных запросов на базовой Qwen 3.8 27B и выбранной абляции.
  2. Проверить chat template, system prompt и специальные токены.
  3. Измерить долю завершённых ответов при лимите 15360 токенов и при меньшем лимите.
  4. Отдельно посчитать отказы, уклонения, пустые ответы и зацикливания.
  5. Проверить качество на коде, математике, длинном контексте и типичных рабочих задачах.
  6. Сравнить расход токенов и задержку, а не только финальный ASR.

Для квантованных файлов стоит повторять проверку после конвертации. Изменение формата и уровня квантизации способно добавить регрессии, которых не было в исходных весах. Методика тестирования квантованных LLM с отдельной оценкой качества и деградации описана в материале о версиях DeepSeek Flash 0731: результаты нужно проверять на собственном сценарии инференса.

Ограничения сравнения и что нужно уточнить по первоисточнику

Какие данные нельзя додумывать

В доступном описании нет полного отчёта Ablitherlitics, таблицы всех восьми моделей, исходных логов и протоколов 13 бенчмарков. Поэтому нельзя достоверно восстановить:

  • названия четырёх версий, не упомянутых в описании;
  • точные места всех моделей, кроме предпоследнего места obliteratus;
  • количество изменённых тензоров у orcarouter, apostate и blackfrost;
  • точные значения KL-дивергенции;
  • баллы GSM8K и других бенчмарков;
  • размер выборки и формулировки запросов HarmBench 400;
  • аппаратную конфигурацию и параметры генерации;
  • правило, по которому зависание засчитывали как успешный или неуспешный ответ.

Эти пробелы ограничивают силу итогового рейтинга. Цифры 82,2% для orcarouter, 78,7% для apostate, 841 из 850 изменённых тензоров у obliteratus, до 45% зависаний, 1457 символов в скрытом промпте blackfrost и 142 уклонения нужно связывать с описанным сравнением и проверять по его оригинальным материалам.

Итог: точечная абляция требует проверки, а не доверия к одному числу

Сравнение восьми версий Qwen 3.8 27B указывает на преимущество умеренного подхода. orcarouter и apostate дали лучшие приведённые результаты ASR, а obliteratus показала, что масштаб правок может ухудшить практическое поведение. Модель, которая реже отказывает, всё ещё может зацикливаться, расходовать лимит токенов и терять качество.

Перед локальным запуском нужно оценить сразу несколько параметров: ASR, качество ответов, завершённость генерации, токеновую эффективность, KL-дивергенцию, chat template и прозрачность карточки модели. Количество изменённых тензоров полезно как характеристика метода, но не служит самостоятельным показателем качества.

Для дальнейшей проверки разумно начать с orcarouter и apostate, затем сопоставить их с базовой Qwen 3.8 27B на собственных задачах. obliteratus лучше оставить для исследовательского сценария, где зацикливания, уклонения и расхождение с заявленной карточкой можно контролировать отдельным протоколом.

Подписаться на канал