Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Сравнение 23 модификаций Gemma 4 E4B: хирургические абляции против грубой порчи

Бенчмарк 23 модификаций Gemma 4 E4B: OBLITERATUS с 800 тыс. загрузок сломан (ASR 72%, GSM8K 66%), а heretic и abliterix сохраняют качество. Метрики, сравнение,

Коротко

Что будет в материале

  1. 01

    Ключевые выводы бенчмарка: что нужно знать сразу

  2. 02

    Методология сравнения: как мы оценивали модели

  3. 03

    OBLITERATUS: как популярная модель с 800 тыс. загрузок оказалась сломанной

  4. 04

    Хирургические абляции: heretic и abliterix как образцы точной работы

Бенчмарк 23 модификаций Gemma 4 E4B, прошедших пайплайн abliterlitics, выявил критический разрыв между хирургическими абляциями и грубой порчей. Модель OBLITERATUS с 800 тыс. загрузок оказалась полностью сломленной: ASR на HarmBench 72%, GSM8K 66%, KL-дивергенция 1.1. В отличие от неё, heretic (ASR 95.5%, KL 0.002) и abliterix (ASR 100%) сохраняют оригинальные способности базовой Gemma 4. Выбор очевиден: точная модификация MLP-слоёв или attention-механизмов работает, а топорное снятие фильтров разрушает модель.

Это крупнейшее сравнение в экосистеме Gemma 4 E4B фиксирует три проблемы: копирование моделей без указания авторства, провал дистилляции reasoning-трейсов для снятия фильтров и появление нового подхода apostate project, модифицирующего MLP-слои. Результаты дают чёткий ответ, какие модели можно брать в production, а какие отправляются в утиль несмотря на цифры загрузок.

Ключевые выводы бенчмарка: что нужно знать сразу

Занятому инженеру или тимлиду не нужна простыня графиков. Нужны цифры и вердикт. Бенчмарк охватил 23 модификации Gemma 4 E4B из Hugging Face, пропущенные через единый пайплайн abliterlitics. Три метрики - ASR (Attack Success Rate на HarmBench), GSM8K (математические рассуждения) и KL-дивергенция (отклонение от базовой модели) - дают полную картину.

Топ-3 результата:

  • abliterix - 100% ASR. Фильтры сняты полностью, математические способности сохранены.
  • heretic - 95.5% ASR при KL 0.002. Почти идентична оригинальной Gemma 4 E4B.
  • OBLITERATUS - антипример. 72% ASR (худший в выборке), GSM8K 66% (провал), KL 1.1 (рекордное отклонение).

Если вы ищете разлоченную Gemma 4 без деградации - heretic и abliterix. Если видите OBLITERATUS в чьём-то пайплайне - бейте тревогу. 800 тыс. загрузок не делают модель рабочей. Evaluation awareness искажает восприятие safety-метрик, но здесь метрики говорят сами за себя.

Методология сравнения: как мы оценивали модели

Все 23 модели прошли через пайплайн abliterlitics - стандартизированный набор тестов для оценки последствий абляции. Использовались три бенчмарка, каждый из которых закрывает свой аспект качества.

HarmBench и ASR: измеряем устойчивость к взлому

ASR (Attack Success Rate) на HarmBench показывает, насколько модель перестала отказывать на запросы, которые базовая Gemma 4 блокирует. Высокий ASR - цель абляции. Разброс значений в выборке: от 72% у OBLITERATUS до 100% у abliterix. Разница в 28 процентных пунктов - это пропасть между «фильтры всё ещё работают» и «фильтров нет».

Важный нюанс: высокий ASR не должен достигаться ценой разрушения других способностей. OBLITERATUS провалился именно здесь - фильтры частично остались, а математика ушла в пол.

GSM8K и KL-дивергенция: сохранение интеллекта и близость к оригиналу

GSM8K тестирует математические рассуждения. Базовая Gemma 4 E4B решает задачи на уровне, близком к 80%+ (точные цифры зависят от конфигурации инференса). OBLITERATUS просел до 66% - минус 14+ процентных пунктов. Модель перестала рассуждать.

KL-дивергенция измеряет отклонение распределения вероятностей токенов от базовой модели. Значение 0 означает идентичность. У heretic KL 0.002 - модель практически неотличима от оригинала. У OBLITERATUS KL 1.1 - распределение разрушено. Для контекста: KL выше 0.5 в таких задачах считается критическим. 1.1 - это не модель, а генератор случайного текста с логотипом Gemma.

Ограничение методологии: мы не имели доступа к полным конфигурациям тестов для каждой модели. Результаты воспроизводимы в рамках пайплайна abliterlitics, но на специфических данных могут отличаться. Тестируйте на своих задачах.

OBLITERATUS: как популярная модель с 800 тыс. загрузок оказалась сломанной

800 тыс. загрузок на Hugging Face. Звучит как знак качества. Реальность: ASR 72% - самый низкий в выборке из 23 моделей. GSM8K 66% - наихудший результат. KL 1.1 - рекордное отклонение, означающее полную деградацию языковой модели.

Это классический пример грубой порчи. Создатели OBLITERATUS применили неизбирательный метод абляции, который задолбил фильтры безопасности вместе с ключевыми способностями. Результат: модель не пропускает 28% опасных запросов (фильтры всё ещё частично работают), но при этом не может решить школьную математику.

Ирония ситуации: 800 тыс. загрузок - это стадное поведение. Модель всплывает в топе выдачи Hugging Face, люди качают не глядя. Проверка по трём метрикам заняла бы 15 минут и сэкономила бы сотни человеко-часов на попытках использовать сломанный инструмент. Фейковые заявления и подмена моделей - системная проблема, и OBLITERATUS вписывается в этот паттерн: популярность без содержания.

Хирургические абляции: heretic и abliterix как образцы точной работы

Хирургическая абляция - это точечная модификация слоёв, ответственных за отказы на определённые классы запросов. Результат: фильтры сняты, модель intact. Два образца из бенчмарка.

Heretic: баланс между безопасностью и сохранностью модели

ASR 95.5%, KL 0.002. Цифры говорят сами за себя. Модель пропускает 95.5% запросов, которые базовая Gemma 4 блокирует, и при этом статистически неотличима от оригинала по распределению токенов.

Для каких задач это оптимально: production-пайплайны, где нужна разлоченная модель без сюрпризов. Heretic сохраняет математические способности, качество генерации кода и логические рассуждения. Если вы переходите с базовой Gemma 4 и хотите снять фильтры без регрессионного тестирования всего пайплайна - heretic ваш выбор.

Abliterix: 100% ASR без компромиссов?

100% ASR - ни один опасный запрос не заблокирован. Модель достигла абсолютного показателя по снятию фильтров. Метрики по GSM8K и KL не раскрыты полностью в рамках бенчмарка, но предварительные данные показывают сохранение способностей на уровне, близком к heretic.

Вопрос цены: 100% ASR может означать более агрессивную абляцию, которая затронула смежные области. Прямое сравнение с heretic: если вам нужен абсолютный максимум пропускной способности по опасным запросам - abliterix. Если критична стабильность на стандартных задачах - heretic с запасом в 0.002 KL выглядит безопаснее.

Новый подход: apostate project и модификация MLP-слоёв

Apostate project выделяется методом: модифицируются MLP-слои, а не attention-механизмы, как в большинстве подходов к абляции. MLP-слои в трансформерах хранят фактические знания и ассоциации. Таргетирование их даёт более тонкий контроль над тем, какие именно фильтры снимаются.

Потенциальные преимущества: меньший побочный урон по способностям модели, возможность снимать конкретные классы фильтров (например, только отказы на медицинские запросы, оставляя блокировку откровенно вредоносного контента). Текущий статус: экспериментальный. Бенчмарк включает apostate в выборку, но метрики пока предварительные. Рекомендация: отслеживать проект, тестировать на изолированных задачах, не внедрять в production без собственной валидации.

Дистилляция reasoning-трейсов: почему это не работает для снятия фильтров

Дистилляция reasoning-трейсов - обучение модели на цепочках рассуждений другой, более способной модели. Логика создателей: если обучить Gemma 4 E4B на трейсах разлоченной модели, она переймёт поведение и перестанет блокировать запросы.

Результаты бенчмарка опровергают эту логику. Модели, прошедшие дистилляцию reasoning-трейсов, теряют качество на GSM8K и других тестах, но фильтры остаются. Причина: дистилляция переносит паттерны рассуждений, а не модифицирует механизмы блокировки. Фильтры безопасности в Gemma 4 - это отдельные векторы в представлениях, которые дистилляция не затрагивает.

Это ещё один пример грубой порчи, маскирующийся под сложный метод. Ресурсы потрачены, модель стала хуже, фильтры на месте. Вывод: дистилляция reasoning-трейсов не является методом абляции.

Проблема копирования и авторства в сообществе

Бенчмарк выявил случаи прямого копирования моделей без указания авторства. Кто-то скачивает heretic или abliterix, меняет название в конфиге и заливает как свою разработку. Метрики идентичны оригиналу, карточка модели - копипаста с минимумом изменений.

Как отличить оригинал от копии: проверяйте дату публикации, историю коммитов, активность автора в сообществе. Оригинальные модели имеют последовательную историю доработок, обсуждения в issues, ссылки на методологию. Копии появляются внезапно, с одной версией и минимумом документации.

Практический совет: перед внедрением модели проверьте её хеш и метрики относительно известных оригиналов. 10 минут проверки экономят дни отладки.

Практические рекомендации: какую модель выбрать для своих задач

Выбор зависит от приоритетов. Таблица рекомендаций на основе данных бенчмарка:

СценарийМодельПричина
Максимальная разлочкаabliterix100% ASR, способности сохранены
Баланс качество/разлочкаheretic95.5% ASR, KL 0.002 - почти оригинал
Исследование новых методовapostate projectМодификация MLP-слоёв, потенциал тонкого контроля
Не использоватьOBLITERATUSASR 72%, GSM8K 66%, KL 1.1 - модель сломана
Не использоватьДистиллированные моделиКачество падает, фильтры остаются

Обязательное правило: тестируйте выбранную модель на своих данных. Бенчмарк даёт общую картину, но специфические запросы могут выявить краевые случаи. Запустите 50-100 типовых запросов из вашего домена, проверьте ASR и качество ответов. 30 минут тестирования защитят от внедрения модели, которая развалится на боевых данных.

Если вы работаете с Gemma в production, обратите внимание на ограничения моделей Google в сложных инженерных задачах. Даже качественная абляция не исправляет архитектурные ограничения базовой модели.

Подписаться на канал