Готовые открытые guard-модели проваливают русскоязычные джейлбрейки. Llama Guard 4 на 12B параметров и GPT-OSS Safeguard на 20B в режиме zero-shot дали F1 0.45-0.57 на атаках и 38-45% ложных срабатываний на безопасных русскоязычных запросах. Это цифры команды R&D Just AI, которая отвечает за guard-модели и бенчмарки для продукта Jay Guard.
Дообученная DeBERTa на 184M параметров показала на той же задаче F1 0.93 и 1.7% ложных блокировок. Модель в 65 раз меньше Llama Guard 4 и в 108 раз меньше GPT-OSS Safeguard, но ошибается на порядок реже. Причина не в архитектуре, а в данных: русскоязычных примеров атак в открытых наборах почти нет, а те, что есть, собраны в 2023 году и не покрывают инъекции в данные, атаки на инструменты агента и многоходовые сценарии.
Ниже разбор того, как устроен такой детектор, откуда брать данные для обучения, почему перевод английских джейлбрейков на русский не решает задачу и что делать после обучения, когда модель уже работает с реальным трафиком. Исходный материал команды Just AI опубликован на Habr.
Почему защита AI-агентов от джейлбрейков важна и для безопасности, и для UX
Jay Guard - это AI-Security слой между приложением и моделью: через него проходят проверки на атаки, нежелательный контент и персональные данные. Детектор джейлбрейков решает одну задачу до вызова LLM: понять, пытается ли пользователь обойти ограничения модели. Если да, запрос блокируется раньше, чем модель начнёт его обрабатывать.
Отдельный слой нужен потому, что системный промпт и встроенные фильтры модели гарантий не дают. Модель можно уговорить, запутать или переключить в другой режим. Внешний детектор оценивает запрос независимо от того, насколько убедительно тот сформулирован.
Что такое джейлбрейк и чем он опасен для агента
Джейлбрейк - это специально сформулированный запрос, который обходит ограничения модели: через роль, гипотетический сценарий, разбиение задачи на шаги, смену языка или кодировку текста. Для чат-бота последствия ограничиваются неприемлемым ответом. Для агента добавляется слой действий: вызов инструментов, чтение файлов, запросы к API, отправка писем.
Показательный случай: в 2025 году Microsoft закрыла уязвимость EchoLeak (CVE-2025-32711) в M365 Copilot. Злоумышленник отправлял сотруднику письмо со спрятанными инструкциями для ассистента, и сотрудник мог письмо даже не открывать, поскольку атака относилась к классу zero-click.
Случаи последних двух лет включают получение данных тенантов Microsoft 365 и содержимого приватных каналов Slack через AI-ассистентов. Общий признак один: классического эксплойта нет, вредоносная инструкция приходит как обычный контент.
Другие векторы атак на агентов, включая промпт-инъекции и отравление данных, разобраны в статье про защиту LLM и AI-агентов на практике.
Почему ложные срабатывания так же опасны, как пропущенные атаки
38-45% ложных срабатываний означают, что блокируется каждый второй-третий безопасный запрос. В пересчёте на 1000 обращений это 380-450 отказов там, где атаки не было.
Дальше всё предсказуемо. Пользователь задаёт нормальный вопрос, получает блокировку, переформулирует, снова получает блокировку и перестаёт пользоваться функцией. Во внутренних продуктах это выглядит как провал запуска: сотрудники возвращаются к старым инструментам. В клиентских - как отток, жалобы и нагрузка на поддержку.
Задача guard-модели не в том, чтобы блокировать как можно больше, а в том, чтобы точно разделять атаки и нормальные запросы. Поэтому 1.7% ложных блокировок у дообученной DeBERTa - сильное преимущество перед 38-45% у больших моделей, а не мелкая деталь отчётности.
Llama Guard 4 и GPT-OSS Safeguard на русском: цифры провала
Llama Guard 4 (12B параметров) и GPT-OSS Safeguard (20B параметров) в zero-shot дали F1 0.45-0.57 на русскоязычных джейлбрейках и 38-45% ложных срабатываний на безопасных русскоязычных запросах. F1 в этом диапазоне означает, что детектор угадывает и ошибается примерно одинаково часто.
| Модель | Параметры | F1 на джейлбрейках | Ложные срабатывания на безопасных русскоязычных запросах |
|---|---|---|---|
| Llama Guard 4 | 12B | 0.45-0.57 | 38-45% |
| GPT-OSS Safeguard | 20B | 0.45-0.57 | 38-45% |
| DeBERTa, дообученная командой Just AI | 184M | 0.93 | 1.7% |
Метрики у Llama Guard 4 и GPT-OSS Safeguard совпадают, хотя модели различаются по размеру. Рост числа параметров результат не улучшил: причина не в мощности, а в данных, на которых модели обучались.
Почему zero-shot не работает для русского языка
Guard-модели обучают на размеченных парах «запрос - безопасно/небезопасно». Если в выборке нет русскоязычных атак, у модели нет их паттернов. Zero-shot означает ровно это: модель применяет английские шаблоны к русскому тексту и ошибается на обоих классах.
Русскоязычные атаки отличаются лексикой, иронией, культурными отсылками, транслитерацией и смешением языков. Английский джейлбрейк про вымышленную страну без правил и его русский аналог могут не иметь ни одного общего слова. Модель, натренированная на первый, второй не узнает.
Аналогия удобная и честная: искать английские ругательства в русском тексте по словарю. Часть совпадений найдётся, большинство пропустится, а безобидные слова, похожие на английские, дадут ложные срабатывания. Именно это показывают 38-45% ложных блокировок.
Из этого не следует, что модели плохие. На английских данных они могут работать хорошо. Проблема в том, что перенос знаний на русский язык не происходит автоматически.
Сравнение с дообученной DeBERTa: 184M против 12B и 20B
Дообученная DeBERTa на 184M параметров показала F1 0.93 и 1.7% ложных блокировок. По размеру это в 65 раз меньше Llama Guard 4 и в 108 раз меньше GPT-OSS Safeguard.
DeBERTa - encoder-модель, не генеративная. Она выдаёт вероятность класса, а не текст ответа вида safe/unsafe, поэтому инференс быстрее и дешевле. Такую модель можно держать рядом с приложением и не выделять GPU уровня, который требуется для 12B или 20B.
Оговорка, без которой сравнение было бы некорректным: замер сделан на одной задаче и одном наборе данных. Это не доказывает, что компактная encoder-модель всегда лучше большой guard-модели. Результат говорит о другом: на русскоязычных джейлбрейках качество даёт релевантный датасет, а не число параметров.
Почему открытые датасеты джейлбрейков не подходят для русскоязычных агентов
Разбор популярных открытых датасетов джейлбрейков, который сделала команда Just AI, вскрыл три системные проблемы:
- устаревание: наборы собраны в 2023 году и не отражают техники, появившиеся позже;
- слепые зоны по типам атак: инъекции в данные, атаки на инструменты агента, многоходовые сценарии;
- ошибки разметки: часть примеров отнесена к неверному классу.
Вывод практический: открытый набор годится как отправная точка, но как единственный источник он даёт модели противоречивые и неполные сигналы.
Инъекции в данные: атака, которую не видно в чате
При инъекции в данные пользователь может вообще не писать вредоносный запрос. Инструкция спрятана в документе, письме, веб-странице или ответе внешнего API, который агент читает по ходу задачи. EchoLeak - ровно такой случай: письмо со скрытыми инструкциями, срабатывание без клика.
Детектор, который смотрит только на текст запроса пользователя, такую атаку не увидит. Проверять нужно и входящие данные, которые попадают в контекст агента: вложения, результаты поиска, содержимое страниц, ответы сервисов. Это отдельный класс атак, и в датасетах джейлбрейков 2023 года его почти нет.
Механика промпт-инъекций, отравления данных и атак через инструменты разобрана в материале про угрозы безопасности AI-агентов.
Атаки на инструменты агента и многоходовые сценарии
Агент умеет вызывать функции: ходить в базы данных, отправлять письма, обращаться к внутренним API. Атака на инструмент заставляет агента вызвать его с вредоносными параметрами или вытащить данные через легитимный вызов. Запрос пользователя при этом выглядит безопасно, потому что опасность в комбинации аргументов и прав доступа.
Многоходовые сценарии размазывают атаку по нескольким сообщениям. Первое задаёт контекст, второе уточняет детали, третье просит выполнить действие. Каждая реплика по отдельности безобидна. Детектор, который анализирует только последнее сообщение, атаку пропустит; классификатор, который видит весь диалог, поймает.
Датасеты 2023 года такие последовательности почти не содержат: тогда в фокусе были одиночные запросы к чат-моделям, а не цепочки вызовов инструментов.
Как собрать датасет для детектора джейлбрейков: конвейер из пяти источников
Just AI построила конвейер из пяти источников данных, чтобы закрыть перечисленные пробелы. Поимённый состав в опубликованном разбое не раскрыт, поэтому разумно говорить о классах данных, из которых складывается такая выборка, и о рисках каждого класса.
- Открытые датасеты джейлбрейков. Готовая база, которую не нужно размечать с нуля. Ограничения: возраст, слепые зоны, ошибки разметки.
- Синтетическая генерация атак. Позволяет покрыть редкие и новые типы атак, которых нет в публичных наборах. Требует проверки: генератор воспроизводит свои же шаблоны, а часть примеров оказывается нерабочей.
- Перевод англоязычных атак на русский с адаптацией. Даёт объём, но без переписывания под русскую лексику теряет смысл.
- Реальный пользовательский трафик. Самый ценный источник: живые формулировки, которые не придумает генератор. Нужны фильтрация, разметка и соблюдение политики по персональным данным.
- Краудсорсинг через игру justgandalf.ru. Пользователи сами пробуют обойти ограничения модели и тем самым создают примеры атак.
Ни один источник не даёт полного покрытия. Публичные наборы устарели, синтетика однородна, перевод искажает паттерны, реальный трафик смещён к типовым запросам, краудсорсинг требует чистки. Работает комбинация.
Конвейер имеет смысл строить воспроизводимо: с версионированием наборов, фиксацией правил отбора и возможностью повторить сборку через полгода. Иначе сравнить две версии модели будет нечем.
Сложности перевода атак на русский язык
Прогнать английские джейлбрейки через переводчик и обучить модель не получится. Атаки часто держатся на игре слов, двусмысленности, культурных отсылках и специфической лексике, и при переводе этот каркас рассыпается.
Пример: английский джейлбрейк, построенный на идиоме, при дословном переводе на русский либо теряет смысл, либо становится безобидной фразой. Бывает и обратное: нейтральное английское предложение после перевода даёт формулировку, похожую на атаку, и добавляет ложных срабатываний в обучающую выборку.
Русскоязычные атаки дополнительно используют транслитерацию, смесь языков, намеренные опечатки и обфускацию. Машинный перевод такие приёмы не создаёт, а стирает, поэтому нужна адаптация с участием человека, а не автоперевод.
Разметка данных: как не повторить ошибки открытых датасетов
Ошибки разметки в открытых наборах - одна из причин, по которой модель учится на противоречивых примерах. Чтобы не повторить это, нужны письменные критерии: что считать джейлбрейком, что безопасным запросом, как размечать пограничные случаи вроде вопросов про саму безопасность или про исторические события.
Снижают шум две практики: перекрёстная разметка, когда один пример оценивают несколько аннотаторов, и арбитраж спорных случаев третьей стороной. Для русскоязычных данных аннотатору мало знать язык, нужно понимать контекст атак: сарказм, отсылки, локальные реалии, интернет-сленг.
Часть атак разумнее не размечать вручную, а получать управляемым процессом. Методики и открытые наборы собраны в гайде по red-teaming LLM.
Обучение и оценка: почему DeBERTa на 184M параметров обошла модели на 12B и 20B
DeBERTa - encoder-модель, и для классификации текста это естественный выбор. Она выдаёт вероятность класса, а обучение и инференс обходятся дешевле, чем у генеративных guard-моделей на 12B и 20B, которые порождают ответ токен за токеном.
Решающий вклад дал не выбор архитектуры, а датасет. F1 0.93 и 1.7% ложных блокировок получены на том же типе задачи, где большие модели в zero-shot давали F1 0.45-0.57. Детали замеров и логика сравнения описаны в разборе команды Just AI.
Для продакшена важны скорость инференса, стоимость и требования к железу. Модель на 184M параметров помещается в память рядом с приложением и может считаться на CPU, чего не скажешь про 12B и 20B.
Метрики: что означают F1 0.93 и 1.7% ложных блокировок на практике
F1 - гармоническое среднее точности (precision) и полноты (recall). Значение 0.93 означает, что модель одновременно редко пропускает атаки и редко блокирует нормальные запросы. Значение 0.45-0.57 говорит о том, что один из показателей серьёзно проседает.
Ложные блокировки удобно считать на 1000 запросов. При 1.7% блокируется около 17 безопасных обращений, при 38-45% - от 380 до 450.
Ориентироваться на один F1 мало. Цена ошибок разная: пропущенная атака на агента с доступом к инструментам стоит дороже лишней блокировки. Порог срабатывания подбирается под задачу: выше recall при большем числе ложных срабатываний или выше precision при риске пропусков. Раздельные precision и recall по этой модели в публичном разборе не приведены, поэтому порог придётся настраивать на своём трафике.
Что происходит после обучения: регрессионные наборы и постоянное обновление
Ключевой тезис команды: обучение модели оказалось только началом, а основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике. Атаки меняются, потому что на каждую новую защиту сообщество ищет обход.
Каркас поддержки качества - регрессионные наборы: фиксированные примеры атак и безопасных запросов, на которых прогоняется каждая новая версия модели. Без такого набора невозможно понять, стало лучше или модель просто сместила ошибки в другую сторону.
Наборы нужно обновлять вместе с появлением новых техник. Если добавить свежие атаки в обучение, но не внести их в регрессию, следующая версия может снова их пропускать, и никто этого не заметит до инцидента.
Как понять, что детектор устарел
Сигналы приходят из продакшена: растёт доля ложных срабатываний на реальном трафике, появляются типы атак, которые модель стабильно пропускает, меняется поведение пользователей. Полезно мониторить долю блокировок, долю апелляций и обращения в поддержку.
Резкий рост доли блокировок говорит о том, что модель стала слишком агрессивной или изменилась природа трафика. Резкое падение - что она пропускает атаки. Конкретные пороги зависят от продукта и объёма обращений: универсальных значений здесь нет, их выводят из своей статистики.
justgandalf.ru и планы Just AI по открытию датасета
Just AI запустила игру justgandalf.ru, чтобы собирать русскоязычный датасет джейлбрейков. Механика простая: пользователь пытается обойти ограничения модели, а удачные попытки становятся примерами атак. Собранный датасет планируется опубликовать на Hugging Face.
Ценность для сообщества в дефиците. Русскоязычных датасетов джейлбрейков мало, и открытие набора даст другим командам материал для обучения своих детекторов без сбора данных с нуля. Сроки публикации и объём набора не объявлены.
К данным из игры стоит относиться как к сырью: это не лабораторная разметка, а пользовательские попытки разной степени изобретательности. Перед обучением такой набор нуждается в фильтрации, дедупликации и повторной разметке. Тот же принцип команда описывает и для остальных источников: обучение модели оказалось только началом.
Практические выводы: что делать, если вы защищаете русскоязычного AI-агента
- Не рассчитывайте на готовые guard-модели в zero-shot для русского языка: F1 0.45-0.57 и 38-45% ложных срабатываний делают такой детектор вредным для продукта.
- Считайте ложные блокировки метрикой первого класса наравне с пропущенными атаками: 17 блокировок на 1000 запросов и 380-450 - это разные продукты.
- Обучайте компактную модель на своём русскоязычном датасете. DeBERTa на 184M дала F1 0.93 и 1.7% ложных блокировок, но выбор архитектуры зависит от вашей задачи и объёма размеченных данных.
- Не берите открытые датасеты 2023 года как единственный источник: они не покрывают инъекции в данные, атаки на инструменты и многоходовые сценарии, а часть примеров размечена с ошибками.
- Собирайте данные из нескольких источников и проверяйте каждый: синтетика однородна, перевод искажает паттерны, реальный трафик требует фильтрации по персональным данным.
- Проверяйте данные, которые агент читает по ходу задачи: запроса пользователя для этого мало, а EchoLeak показал, что атака приходит письмом и работает без клика.
- Заложите регрессионные наборы и обновляйте их вместе с появлением новых техник атак.
- Следите за игрой justgandalf.ru и публикацией датасета на Hugging Face: открытый русскоязычный набор упростит обучение детекторов у всей отрасли.
Архитектурные контроли вокруг агента, включая изоляцию, права доступа и мониторинг, разобраны в материале про трёхфазную защиту AI-агентов.
Все метрики в статье приведены по данным команды R&D Just AI и независимыми источниками не подтверждены; сравнение сделано на одной задаче и одном наборе данных, поэтому переносить выводы на другие продукты и языки без собственной проверки не стоит.