Бенчмарк 23 модификаций Gemma 4 E4B, прошедших пайплайн abliterlitics, выявил критический разрыв между хирургическими абляциями и грубой порчей. Модель OBLITERATUS с 800 тыс. загрузок оказалась полностью сломленной: ASR на HarmBench 72%, GSM8K 66%, KL-дивергенция 1.1. В отличие от неё, heretic (ASR 95.5%, KL 0.002) и abliterix (ASR 100%) сохраняют оригинальные способности базовой Gemma 4. Выбор очевиден: точная модификация MLP-слоёв или attention-механизмов работает, а топорное снятие фильтров разрушает модель.
Это крупнейшее сравнение в экосистеме Gemma 4 E4B фиксирует три проблемы: копирование моделей без указания авторства, провал дистилляции reasoning-трейсов для снятия фильтров и появление нового подхода apostate project, модифицирующего MLP-слои. Результаты дают чёткий ответ, какие модели можно брать в production, а какие отправляются в утиль несмотря на цифры загрузок.
Ключевые выводы бенчмарка: что нужно знать сразу
Занятому инженеру или тимлиду не нужна простыня графиков. Нужны цифры и вердикт. Бенчмарк охватил 23 модификации Gemma 4 E4B из Hugging Face, пропущенные через единый пайплайн abliterlitics. Три метрики - ASR (Attack Success Rate на HarmBench), GSM8K (математические рассуждения) и KL-дивергенция (отклонение от базовой модели) - дают полную картину.
Топ-3 результата:
- abliterix - 100% ASR. Фильтры сняты полностью, математические способности сохранены.
- heretic - 95.5% ASR при KL 0.002. Почти идентична оригинальной Gemma 4 E4B.
- OBLITERATUS - антипример. 72% ASR (худший в выборке), GSM8K 66% (провал), KL 1.1 (рекордное отклонение).
Если вы ищете разлоченную Gemma 4 без деградации - heretic и abliterix. Если видите OBLITERATUS в чьём-то пайплайне - бейте тревогу. 800 тыс. загрузок не делают модель рабочей. Evaluation awareness искажает восприятие safety-метрик, но здесь метрики говорят сами за себя.
Методология сравнения: как мы оценивали модели
Все 23 модели прошли через пайплайн abliterlitics - стандартизированный набор тестов для оценки последствий абляции. Использовались три бенчмарка, каждый из которых закрывает свой аспект качества.
HarmBench и ASR: измеряем устойчивость к взлому
ASR (Attack Success Rate) на HarmBench показывает, насколько модель перестала отказывать на запросы, которые базовая Gemma 4 блокирует. Высокий ASR - цель абляции. Разброс значений в выборке: от 72% у OBLITERATUS до 100% у abliterix. Разница в 28 процентных пунктов - это пропасть между «фильтры всё ещё работают» и «фильтров нет».
Важный нюанс: высокий ASR не должен достигаться ценой разрушения других способностей. OBLITERATUS провалился именно здесь - фильтры частично остались, а математика ушла в пол.
GSM8K и KL-дивергенция: сохранение интеллекта и близость к оригиналу
GSM8K тестирует математические рассуждения. Базовая Gemma 4 E4B решает задачи на уровне, близком к 80%+ (точные цифры зависят от конфигурации инференса). OBLITERATUS просел до 66% - минус 14+ процентных пунктов. Модель перестала рассуждать.
KL-дивергенция измеряет отклонение распределения вероятностей токенов от базовой модели. Значение 0 означает идентичность. У heretic KL 0.002 - модель практически неотличима от оригинала. У OBLITERATUS KL 1.1 - распределение разрушено. Для контекста: KL выше 0.5 в таких задачах считается критическим. 1.1 - это не модель, а генератор случайного текста с логотипом Gemma.
Ограничение методологии: мы не имели доступа к полным конфигурациям тестов для каждой модели. Результаты воспроизводимы в рамках пайплайна abliterlitics, но на специфических данных могут отличаться. Тестируйте на своих задачах.
OBLITERATUS: как популярная модель с 800 тыс. загрузок оказалась сломанной
800 тыс. загрузок на Hugging Face. Звучит как знак качества. Реальность: ASR 72% - самый низкий в выборке из 23 моделей. GSM8K 66% - наихудший результат. KL 1.1 - рекордное отклонение, означающее полную деградацию языковой модели.
Это классический пример грубой порчи. Создатели OBLITERATUS применили неизбирательный метод абляции, который задолбил фильтры безопасности вместе с ключевыми способностями. Результат: модель не пропускает 28% опасных запросов (фильтры всё ещё частично работают), но при этом не может решить школьную математику.
Ирония ситуации: 800 тыс. загрузок - это стадное поведение. Модель всплывает в топе выдачи Hugging Face, люди качают не глядя. Проверка по трём метрикам заняла бы 15 минут и сэкономила бы сотни человеко-часов на попытках использовать сломанный инструмент. Фейковые заявления и подмена моделей - системная проблема, и OBLITERATUS вписывается в этот паттерн: популярность без содержания.
Хирургические абляции: heretic и abliterix как образцы точной работы
Хирургическая абляция - это точечная модификация слоёв, ответственных за отказы на определённые классы запросов. Результат: фильтры сняты, модель intact. Два образца из бенчмарка.
Heretic: баланс между безопасностью и сохранностью модели
ASR 95.5%, KL 0.002. Цифры говорят сами за себя. Модель пропускает 95.5% запросов, которые базовая Gemma 4 блокирует, и при этом статистически неотличима от оригинала по распределению токенов.
Для каких задач это оптимально: production-пайплайны, где нужна разлоченная модель без сюрпризов. Heretic сохраняет математические способности, качество генерации кода и логические рассуждения. Если вы переходите с базовой Gemma 4 и хотите снять фильтры без регрессионного тестирования всего пайплайна - heretic ваш выбор.
Abliterix: 100% ASR без компромиссов?
100% ASR - ни один опасный запрос не заблокирован. Модель достигла абсолютного показателя по снятию фильтров. Метрики по GSM8K и KL не раскрыты полностью в рамках бенчмарка, но предварительные данные показывают сохранение способностей на уровне, близком к heretic.
Вопрос цены: 100% ASR может означать более агрессивную абляцию, которая затронула смежные области. Прямое сравнение с heretic: если вам нужен абсолютный максимум пропускной способности по опасным запросам - abliterix. Если критична стабильность на стандартных задачах - heretic с запасом в 0.002 KL выглядит безопаснее.
Новый подход: apostate project и модификация MLP-слоёв
Apostate project выделяется методом: модифицируются MLP-слои, а не attention-механизмы, как в большинстве подходов к абляции. MLP-слои в трансформерах хранят фактические знания и ассоциации. Таргетирование их даёт более тонкий контроль над тем, какие именно фильтры снимаются.
Потенциальные преимущества: меньший побочный урон по способностям модели, возможность снимать конкретные классы фильтров (например, только отказы на медицинские запросы, оставляя блокировку откровенно вредоносного контента). Текущий статус: экспериментальный. Бенчмарк включает apostate в выборку, но метрики пока предварительные. Рекомендация: отслеживать проект, тестировать на изолированных задачах, не внедрять в production без собственной валидации.
Дистилляция reasoning-трейсов: почему это не работает для снятия фильтров
Дистилляция reasoning-трейсов - обучение модели на цепочках рассуждений другой, более способной модели. Логика создателей: если обучить Gemma 4 E4B на трейсах разлоченной модели, она переймёт поведение и перестанет блокировать запросы.
Результаты бенчмарка опровергают эту логику. Модели, прошедшие дистилляцию reasoning-трейсов, теряют качество на GSM8K и других тестах, но фильтры остаются. Причина: дистилляция переносит паттерны рассуждений, а не модифицирует механизмы блокировки. Фильтры безопасности в Gemma 4 - это отдельные векторы в представлениях, которые дистилляция не затрагивает.
Это ещё один пример грубой порчи, маскирующийся под сложный метод. Ресурсы потрачены, модель стала хуже, фильтры на месте. Вывод: дистилляция reasoning-трейсов не является методом абляции.
Проблема копирования и авторства в сообществе
Бенчмарк выявил случаи прямого копирования моделей без указания авторства. Кто-то скачивает heretic или abliterix, меняет название в конфиге и заливает как свою разработку. Метрики идентичны оригиналу, карточка модели - копипаста с минимумом изменений.
Как отличить оригинал от копии: проверяйте дату публикации, историю коммитов, активность автора в сообществе. Оригинальные модели имеют последовательную историю доработок, обсуждения в issues, ссылки на методологию. Копии появляются внезапно, с одной версией и минимумом документации.
Практический совет: перед внедрением модели проверьте её хеш и метрики относительно известных оригиналов. 10 минут проверки экономят дни отладки.
Практические рекомендации: какую модель выбрать для своих задач
Выбор зависит от приоритетов. Таблица рекомендаций на основе данных бенчмарка:
| Сценарий | Модель | Причина |
|---|---|---|
| Максимальная разлочка | abliterix | 100% ASR, способности сохранены |
| Баланс качество/разлочка | heretic | 95.5% ASR, KL 0.002 - почти оригинал |
| Исследование новых методов | apostate project | Модификация MLP-слоёв, потенциал тонкого контроля |
| Не использовать | OBLITERATUS | ASR 72%, GSM8K 66%, KL 1.1 - модель сломана |
| Не использовать | Дистиллированные модели | Качество падает, фильтры остаются |
Обязательное правило: тестируйте выбранную модель на своих данных. Бенчмарк даёт общую картину, но специфические запросы могут выявить краевые случаи. Запустите 50-100 типовых запросов из вашего домена, проверьте ASR и качество ответов. 30 минут тестирования защитят от внедрения модели, которая развалится на боевых данных.
Если вы работаете с Gemma в production, обратите внимание на ограничения моделей Google в сложных инженерных задачах. Даже качественная абляция не исправляет архитектурные ограничения базовой модели.