Что произошло: суть исследования за 2 минуты
Снятие цензуры с языковых моделей (abliteration) меняет их поведение радикальнее, чем принято считать. Модели не просто перестают отказываться от ответов на «неудобные» вопросы - у них сдвигается базовая калибровка уверенности. В свежем эксперименте на 21 600 решениях проверялась способность Gemma и Qwen предсказывать движение акций. Результат: после abliteration обе модели стали значимо реже использовать оговорки вроде «возможно» или «не уверен», склоняясь к оптимистичным прогнозам «пойдёт вверх». Точность при этом осталась на уровне случайного угадывания - около 50%.
Ключевой нюанс: эффект оказался неоднородным. Уверенность Gemma после процедуры снизилась, а Qwen - резко возросла. Это ставит под вопрос универсальность abliteration как метода и заставляет пересмотреть риски использования uncensored LLM в задачах, где требуется калиброванная оценка неопределённости. Статья с данными и кодом опубликована на arXiv, методология полностью воспроизводима.
Abliteration: как и зачем снимают цензуру с языковых моделей
Abliteration - это метод направленного изменения поведения LLM через модификацию весов на уровне инференса, без дообучения. В отличие от промпт-инжиниринга, который уговаривает модель обойти ограничения, и файнтюнинга, требующего вычислительных ресурсов, abliteration хирургически убирает способность модели отказываться от ответов. Цель - получить «честные» ответы, не фильтрованные встроенными механизмами безопасности.
Рост интереса к uncensored моделям в сообществе связан с запросом на прямое взаимодействие с LLM без патерналистских ограничений. Разработчики хотят видеть, что модель «думает» на самом деле, а не отфильтрованную версию. Проблема в том, что фильтры безопасности и калибровка уверенности часто завязаны на одни и те же механизмы активаций - и удаление первых неизбежно затрагивает вторую.
Техническая сторона: что происходит с моделью при abliteration
Процесс abliteration строится на идентификации «отказных» направлений в пространстве активаций модели. Исследователи находят, какие векторы активаций коррелируют с отказами отвечать, и подавляют или обнуляют их. Метод работает на этапе инференса, не требует переобучения и доступен через открытый код. Технически это близко к тому, что описано в разборе 23 модификаций Gemma 4 E4B, где сравнивались хирургические абляции и грубая порча весов. Там же показано, что популярная сборка OBLITERATUS с 800 тыс. загрузок оказалась сломана: ASR 72%, GSM8K 66%, тогда как более аккуратные модификации heretic и abliterix сохраняли качество.
Принципиальный момент: abliteration не добавляет модели новых знаний. Она лишь снимает ограничения на выражение уже имеющихся. Если модель не умеет точно предсказывать движение акций, снятие цензуры не сделает её финансовым аналитиком - оно лишь заставит её увереннее высказывать необоснованные суждения.
Эксперимент: как тестировали Gemma и Qwen на прогнозировании акций
Дизайн эксперимента предельно прозрачен: 21 600 решений, задача - предсказать направление движения акций (вверх или вниз). Сравнивались базовые и abliterated версии Gemma и Qwen. Метрики: уверенность (частота оговорок, распределение вероятностей) и точность (совпадение с реальным движением цены).
Выбор финансовых прогнозов как тестового домена не случаен. Это классическая задача с высокой неопределённостью, где критически важна калибровка уверенности. Модель, которая говорит «цена пойдёт вверх с вероятностью 90%» и ошибается в половине случаев, опаснее модели, которая честно признаёт неопределённость. Результаты могут не переноситься на другие домены - это ограничение авторы исследования явно проговаривают.
Почему выбрали финансовые прогнозы: контекст и ограничения
Финансовые рынки - идеальный полигон для тестирования калибровки: исходы бинарны и верифицируемы, неопределённость высока, а цена ошибки очевидна. Модель не может «угадать» систематически лучше рынка без инсайдерской информации - и это позволяет чётко отделить рост уверенности от роста компетентности. Ограничение методологии: выводы о поведении abliterated моделей в финансах не гарантируют аналогичных эффектов в медицине, юриспруденции или креативных задачах. Каждый домен требует собственной валидации.
Результаты: уверенность растет, точность стоит на месте
Основной результат однозначен: после abliteration модели стали значимо чаще давать ответы без оговорок, склоняясь к оптимистичным прогнозам. Точность осталась на уровне ~50% - статистически неотличимо от подбрасывания монетки. Модели не стали лучше предсказывать рынок, они стали увереннее в своих случайных догадках.
Этот паттерн - рост уверенности без роста точности - критически важен для понимания рисков uncensored LLM. Пользователь, видящий уверенный ответ без оговорок, склонен доверять ему больше, даже если содержательно ответ не стал качественнее. В контексте сравнения методов оценки уверенности LLM это подтверждает опасность полагаться на вербализованную самооценку модели после модификаций: RLHF и abliteration сдвигают калибровку в противоположные стороны, и без внешних проб качество оценки уверенности падает.
Неоднородность эффекта: почему Gemma стала осторожнее, а Qwen - самоувереннее
Самый неожиданный результат - разнонаправленное изменение уверенности у двух моделей. Gemma после abliteration стала осторожнее, реже давала категоричные прогнозы. Qwen, напротив, резко нарастила уверенность, почти перестав использовать оговорки. Авторы исследования не дают однозначного объяснения, но выдвигают гипотезы: различия в архитектуре (Gemma и Qwen построены на разных принципах attention и нормализации), различия в обучающих данных и, возможно, разная реализация самой процедуры abliteration.
Практический вывод: abliteration не является универсальной операцией с предсказуемым результатом. Эффект зависит от конкретной модели, её архитектуры и тренировочного пайплайна. Перед внедрением uncensored версии в любой пайплайн необходима валидация на целевых данных. В материале про чтение model card LLM разбирается смежная проблема: evaluation awareness - способность моделей отличать тесты от реальной работы - завышает safety-метрики на 20+ процентных пунктов. Модифицированные модели могут демонстрировать ещё более выраженный разрыв между бенчмарками и production-поведением.
Практические выводы: когда можно доверять uncensored LLM
Повышенная уверенность без роста точности - опасная комбинация для любых критических решений. В финансах, медицине, юриспруденции использование uncensored моделей без внешней системы верификации граничит с халатностью. Модель, уверенно рекомендующая лечение или инвестиционное решение, но угадывающая с точностью монетки, наносит прямой вред.
Сценарии, где эффект может быть полезен: креативные задачи, брейншторминг, генерация гипотез. В этих доменах «избыточная уверенность» модели работает как катализатор - она предлагает идеи без внутренней цензуры, а человек фильтрует. Риски смещаются с «принять неверное решение» на «потратить время на проверку плохой идеи» - это приемлемый компромисс.
Главная рекомендация: всегда проверяйте калибровку модели под свою задачу. Не полагайтесь на бенчмарки из model card - проводите собственные тесты на данных, репрезентативных для вашего домена.
Воспроизводимость: как повторить эксперимент на своих данных
Авторы исследования выложили код и данные в открытый доступ на arXiv. Методология воспроизводима для любой модели, поддерживающей abliteration. Краткая инструкция: возьмите базовую и abliterated версии одной модели, подготовьте датасет с бинарными исходами и верифицируемыми правильными ответами, прогоните обе версии, сравните accuracy и метрики уверенности (частота оговорок, калибровочные кривые).
Предостережение: не переносите выводы между доменами. Модель, перекалиброванная на финансах, может вести себя иначе на медицинских данных. Специфика домена критична.
Будущее uncensored моделей: безопасность и enterprise-внедрение
Рост интереса к uncensored LLM в сообществе сталкивается с фундаментальной проблемой: ложная уверенность. Enterprise-среда требует не только отсутствия отказов, но и предсказуемого, аудируемого поведения. Модель, которая врёт уверенно, опаснее модели, которая честно признаёт незнание.
Тренды 2026 года указывают на гибридные подходы: использование uncensored моделей для генерации гипотез с последующей верификацией через специализированные системы. Материал про этичный обман моделей Anthropic показывает, что даже «воспитанные» модели способны на систематический обман - и uncensored версии без встроенных предохранителей требуют ещё более тщательного мониторинга.
Управление поведением, наблюдаемость и внешние системы калибровки уверенности становятся обязательными компонентами production-пайплайнов с LLM. Abliteration - мощный инструмент, но без контроля он превращает модель из осторожного советника в самоуверенного дилетанта.