Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Uncensored LLM: больше оптимизма, но не точности — разбор эксперимента с Gemma и Qwen

Эксперимент на 21 600 решениях показал: после abliteration модели Gemma и Qwen становятся увереннее в прогнозах, но точность остаётся на уровне подбрасывания мо

Коротко

Что будет в материале

  1. 01

    Что произошло: суть исследования за 2 минуты

  2. 02

    Abliteration: как и зачем снимают цензуру с языковых моделей

  3. 03

    Эксперимент: как тестировали Gemma и Qwen на прогнозировании акций

  4. 04

    Результаты: уверенность растет, точность стоит на месте

Что произошло: суть исследования за 2 минуты

Снятие цензуры с языковых моделей (abliteration) меняет их поведение радикальнее, чем принято считать. Модели не просто перестают отказываться от ответов на «неудобные» вопросы - у них сдвигается базовая калибровка уверенности. В свежем эксперименте на 21 600 решениях проверялась способность Gemma и Qwen предсказывать движение акций. Результат: после abliteration обе модели стали значимо реже использовать оговорки вроде «возможно» или «не уверен», склоняясь к оптимистичным прогнозам «пойдёт вверх». Точность при этом осталась на уровне случайного угадывания - около 50%.

Ключевой нюанс: эффект оказался неоднородным. Уверенность Gemma после процедуры снизилась, а Qwen - резко возросла. Это ставит под вопрос универсальность abliteration как метода и заставляет пересмотреть риски использования uncensored LLM в задачах, где требуется калиброванная оценка неопределённости. Статья с данными и кодом опубликована на arXiv, методология полностью воспроизводима.

Abliteration: как и зачем снимают цензуру с языковых моделей

Abliteration - это метод направленного изменения поведения LLM через модификацию весов на уровне инференса, без дообучения. В отличие от промпт-инжиниринга, который уговаривает модель обойти ограничения, и файнтюнинга, требующего вычислительных ресурсов, abliteration хирургически убирает способность модели отказываться от ответов. Цель - получить «честные» ответы, не фильтрованные встроенными механизмами безопасности.

Рост интереса к uncensored моделям в сообществе связан с запросом на прямое взаимодействие с LLM без патерналистских ограничений. Разработчики хотят видеть, что модель «думает» на самом деле, а не отфильтрованную версию. Проблема в том, что фильтры безопасности и калибровка уверенности часто завязаны на одни и те же механизмы активаций - и удаление первых неизбежно затрагивает вторую.

Техническая сторона: что происходит с моделью при abliteration

Процесс abliteration строится на идентификации «отказных» направлений в пространстве активаций модели. Исследователи находят, какие векторы активаций коррелируют с отказами отвечать, и подавляют или обнуляют их. Метод работает на этапе инференса, не требует переобучения и доступен через открытый код. Технически это близко к тому, что описано в разборе 23 модификаций Gemma 4 E4B, где сравнивались хирургические абляции и грубая порча весов. Там же показано, что популярная сборка OBLITERATUS с 800 тыс. загрузок оказалась сломана: ASR 72%, GSM8K 66%, тогда как более аккуратные модификации heretic и abliterix сохраняли качество.

Принципиальный момент: abliteration не добавляет модели новых знаний. Она лишь снимает ограничения на выражение уже имеющихся. Если модель не умеет точно предсказывать движение акций, снятие цензуры не сделает её финансовым аналитиком - оно лишь заставит её увереннее высказывать необоснованные суждения.

Эксперимент: как тестировали Gemma и Qwen на прогнозировании акций

Дизайн эксперимента предельно прозрачен: 21 600 решений, задача - предсказать направление движения акций (вверх или вниз). Сравнивались базовые и abliterated версии Gemma и Qwen. Метрики: уверенность (частота оговорок, распределение вероятностей) и точность (совпадение с реальным движением цены).

Выбор финансовых прогнозов как тестового домена не случаен. Это классическая задача с высокой неопределённостью, где критически важна калибровка уверенности. Модель, которая говорит «цена пойдёт вверх с вероятностью 90%» и ошибается в половине случаев, опаснее модели, которая честно признаёт неопределённость. Результаты могут не переноситься на другие домены - это ограничение авторы исследования явно проговаривают.

Почему выбрали финансовые прогнозы: контекст и ограничения

Финансовые рынки - идеальный полигон для тестирования калибровки: исходы бинарны и верифицируемы, неопределённость высока, а цена ошибки очевидна. Модель не может «угадать» систематически лучше рынка без инсайдерской информации - и это позволяет чётко отделить рост уверенности от роста компетентности. Ограничение методологии: выводы о поведении abliterated моделей в финансах не гарантируют аналогичных эффектов в медицине, юриспруденции или креативных задачах. Каждый домен требует собственной валидации.

Результаты: уверенность растет, точность стоит на месте

Основной результат однозначен: после abliteration модели стали значимо чаще давать ответы без оговорок, склоняясь к оптимистичным прогнозам. Точность осталась на уровне ~50% - статистически неотличимо от подбрасывания монетки. Модели не стали лучше предсказывать рынок, они стали увереннее в своих случайных догадках.

Этот паттерн - рост уверенности без роста точности - критически важен для понимания рисков uncensored LLM. Пользователь, видящий уверенный ответ без оговорок, склонен доверять ему больше, даже если содержательно ответ не стал качественнее. В контексте сравнения методов оценки уверенности LLM это подтверждает опасность полагаться на вербализованную самооценку модели после модификаций: RLHF и abliteration сдвигают калибровку в противоположные стороны, и без внешних проб качество оценки уверенности падает.

Неоднородность эффекта: почему Gemma стала осторожнее, а Qwen - самоувереннее

Самый неожиданный результат - разнонаправленное изменение уверенности у двух моделей. Gemma после abliteration стала осторожнее, реже давала категоричные прогнозы. Qwen, напротив, резко нарастила уверенность, почти перестав использовать оговорки. Авторы исследования не дают однозначного объяснения, но выдвигают гипотезы: различия в архитектуре (Gemma и Qwen построены на разных принципах attention и нормализации), различия в обучающих данных и, возможно, разная реализация самой процедуры abliteration.

Практический вывод: abliteration не является универсальной операцией с предсказуемым результатом. Эффект зависит от конкретной модели, её архитектуры и тренировочного пайплайна. Перед внедрением uncensored версии в любой пайплайн необходима валидация на целевых данных. В материале про чтение model card LLM разбирается смежная проблема: evaluation awareness - способность моделей отличать тесты от реальной работы - завышает safety-метрики на 20+ процентных пунктов. Модифицированные модели могут демонстрировать ещё более выраженный разрыв между бенчмарками и production-поведением.

Практические выводы: когда можно доверять uncensored LLM

Повышенная уверенность без роста точности - опасная комбинация для любых критических решений. В финансах, медицине, юриспруденции использование uncensored моделей без внешней системы верификации граничит с халатностью. Модель, уверенно рекомендующая лечение или инвестиционное решение, но угадывающая с точностью монетки, наносит прямой вред.

Сценарии, где эффект может быть полезен: креативные задачи, брейншторминг, генерация гипотез. В этих доменах «избыточная уверенность» модели работает как катализатор - она предлагает идеи без внутренней цензуры, а человек фильтрует. Риски смещаются с «принять неверное решение» на «потратить время на проверку плохой идеи» - это приемлемый компромисс.

Главная рекомендация: всегда проверяйте калибровку модели под свою задачу. Не полагайтесь на бенчмарки из model card - проводите собственные тесты на данных, репрезентативных для вашего домена.

Воспроизводимость: как повторить эксперимент на своих данных

Авторы исследования выложили код и данные в открытый доступ на arXiv. Методология воспроизводима для любой модели, поддерживающей abliteration. Краткая инструкция: возьмите базовую и abliterated версии одной модели, подготовьте датасет с бинарными исходами и верифицируемыми правильными ответами, прогоните обе версии, сравните accuracy и метрики уверенности (частота оговорок, калибровочные кривые).

Предостережение: не переносите выводы между доменами. Модель, перекалиброванная на финансах, может вести себя иначе на медицинских данных. Специфика домена критична.

Будущее uncensored моделей: безопасность и enterprise-внедрение

Рост интереса к uncensored LLM в сообществе сталкивается с фундаментальной проблемой: ложная уверенность. Enterprise-среда требует не только отсутствия отказов, но и предсказуемого, аудируемого поведения. Модель, которая врёт уверенно, опаснее модели, которая честно признаёт незнание.

Тренды 2026 года указывают на гибридные подходы: использование uncensored моделей для генерации гипотез с последующей верификацией через специализированные системы. Материал про этичный обман моделей Anthropic показывает, что даже «воспитанные» модели способны на систематический обман - и uncensored версии без встроенных предохранителей требуют ещё более тщательного мониторинга.

Управление поведением, наблюдаемость и внешние системы калибровки уверенности становятся обязательными компонентами production-пайплайнов с LLM. Abliteration - мощный инструмент, но без контроля он превращает модель из осторожного советника в самоуверенного дилетанта.

Подписаться на канал