ChatGPT, Claude и Grok обрабатывают один и тот же чувствительный запрос по-разному: первый блокирует с формальным объяснением политики, второй отказывает с акцентом на безопасность, третий может выдать фрагментарный ответ. Разница обусловлена архитектурой модерации - от набора правил продукта до порогов срабатывания входного классификатора.
Каждый сервис выстраивает многослойную систему фильтрации. OpenAI применяет отдельную модель Moderation API и политику использования с детализированными категориями запретов. Anthropic встраивает ограничения непосредственно в процесс обучения Claude через Constitutional AI. xAI выбрала путь минимальных ограничений для Grok, компенсируя это пост-обработкой ответов. Такой разброс подходов создаёт информационный хаос для разработчиков, которые выбирают AI-сервис для интеграции. Мы разобрали архитектуру каждого решения, подали единый тестовый промт и зафиксировали логику отказов.
Введение: почему модерация промтов стала критическим компонентом AI-сервисов
Еженедельная аудитория ChatGPT превысила 300 миллионов активных пользователей к середине 2026 года. Claude обрабатывает миллионы запросов от корпоративных клиентов через API. Grok встроен в платформу X с доступом к реальному времени. При таких объёмах отсутствие фильтрации означает одно: лавину нежелательного контента, юридические риски и потерю доверия пользователей.
Инциденты подтверждают остроту проблемы. В апреле 2026 года Deezer сообщил, что 44% ежедневных загрузок на платформу - треки, сгенерированные AI, и 85% их стримов - фрод. Это пример того, что происходит, когда генеративные модели работают без входного контроля. В текстовых AI-сервисах риски смещаются в сторону порнографического контента, инструкций по созданию оружия, разжигания ненависти и координации противоправных действий.
Модерация промтов решает три задачи одновременно. Первая - compliance: соответствие законодательству разных юрисдикций. Вторая - безопасность бренда: ни одна компания не хочет, чтобы её модель использовали для генерации шокирующего контента. Третья - пользовательский опыт: чрезмерно строгие фильтры раздражают, слишком мягкие - создают репутационные риски. Баланс между этими силами и определяет архитектуру модерации в каждом сервисе.
В этой статье мы разберём обобщённую архитектуру фильтрации промтов, сравним подходы ChatGPT, Claude и Grok на едином чувствительном запросе и дадим практические рекомендации по построению собственной системы модерации с LLM-классификаторами.
Обобщенная архитектура модерации: от правил продукта до порогов блокировки
Типовая система модерации промтов состоит из трёх слоёв: правила продукта, входной классификатор и пороги принятия решений. Каждый слой настраивается независимо, но их взаимодействие определяет конечное поведение сервиса. Разберём компоненты детально.
Правила продукта: определение границ допустимого
Правила продукта - это документ, который фиксирует, какие категории контента запрещены. Без этого слоя классификатор не знает, что считать нарушением. OpenAI публикует Usage Policies с детализацией по категориям: hate speech, harassment, sexual content, violence, self-harm, deception, political manipulation. Для каждой категории указаны подкатегории и исключения - например, образовательный или медицинский контекст может смягчать ограничения.
Anthropic формулирует ограничения через Acceptable Use Policy, но ключевое отличие - наличие «конституции» Claude. Это набор принципов, встроенных в модель на этапе обучения. Конституция определяет не только что запрещено, но и как модель должна мотивировать отказ: с уважением к пользователю, объяснением причины и предложением альтернативы. Такой подход смещает акцент с бинарной блокировки на диалог.
xAI для Grok выбрала политику с меньшим числом категорий запретов. Основной фокус - незаконная деятельность и прямой вред. Эротический контент и провокационные темы попадают в серую зону, где решение принимает не классификатор, а модель на этапе генерации ответа. Это создаёт более либеральный пользовательский опыт, но повышает риск нежелательных срабатываний.
Сравнение политик трёх компаний показывает закономерность: чем детальнее прописаны правила, тем предсказуемее поведение модели и тем проще аудит. Разработчикам, которые строят собственную модерацию, стоит начать именно с документа: какие категории контента неприемлемы для продукта, где границы допустимого и как обрабатывать пограничные случаи.
Входной классификатор: как модель оценивает риск промта
Входной классификатор - это компонент, который получает промт пользователя и возвращает оценку риска по нескольким категориям. Оценка может быть бинарной (block/allow) или вероятностной (score от 0 до 1). Три основных подхода к реализации классификатора различаются по точности, задержке и стоимости.
OpenAI использует отдельную модель Moderation API, которая не зависит от генеративной модели. Это позволяет обновлять классификатор без переобучения GPT и применять его к любому тексту - не только к промтам, но и к ответам модели. Moderation API возвращает scores по категориям: sexual, hate, harassment, violence, self-harm. Для каждой категории можно задать порог, выше которого промт блокируется. Задержка классификатора - десятки миллисекунд, что позволяет встраивать его в синхронный pipeline обработки.
Anthropic пошла другим путём: ограничения встроены в саму модель Claude через Constitutional AI. На этапе обучения модель получает принципы и учится отвергать запросы, которые им противоречат. Плюс подхода - отказы выглядят естественно, как часть диалога. Минус - сложность аудита: нельзя просто проверить score классификатора, нужно анализировать цепочку рассуждений модели. Это создаёт проблему evaluation awareness, когда модель учится «правильно» отвечать на тесты безопасности, но в реальной эксплуатации ведёт себя иначе. Мы подробно разбирали этот феномен в статье про расхождение safety-метрик между бенчмарком и production.
Grok применяет гибридный подход: эвристические фильтры для явно запрещённого контента и пост-обработку ответов моделью. Эвристики отсекают прямые нарушения - например, запросы с ключевыми словами из стоп-листа. Всё остальное уходит в модель, которая сама решает, как ответить. Такой подход снижает задержку на входе, но перекладывает ответственность на генеративный компонент.
Пороги блокировки: настройка чувствительности
Порог блокировки - это число, которое определяет, при каком score классификатора промт будет отклонён. Выбор порога - всегда компромисс между false positives (ложными блокировками) и false negatives (пропуском опасного контента).
OpenAI задаёт разные пороги для разных категорий. Для sexual content порог ниже - модель блокирует даже намёки на эротику. Для violence порог выше - описание исторических событий или новостных инцидентов проходит фильтрацию. Такой дифференцированный подход снижает число ложных срабатываний в нечувствительных категориях.
Настройка порогов - итеративный процесс. На старте выбирают консервативные значения: низкие пороги для всех категорий. Затем анализируют логи отказов, собирают обратную связь пользователей и постепенно повышают пороги для категорий с высоким уровнем ложных срабатываний. A/B-тестирование помогает оценить влияние изменений на retention и удовлетворённость пользователей.
Отдельная проблема - культурные различия. Один и тот же порог для hate speech может работать по-разному для английского и русского языков из-за различий в контексте и маркерах агрессии. Решение - калибровка порогов на локальных датасетах с привлечением носителей языка.
Сравнительный анализ: ChatGPT, Claude и Grok на примере чувствительного запроса
Для сравнения мы использовали единый промт: запрос на описание эротической сцены с элементами, которые находятся на границе допустимого - без прямых нарушений, но с явным чувствительным контекстом. Реакция трёх сервисов показала различия в архитектуре и философии модерации.
ChatGPT: многоуровневая фильтрация и защита авторского стиля
ChatGPT отреагировал на тестовый промт отказом. Модель сообщила, что не может создать контент откровенного характера, и сослалась на политику использования OpenAI. Отказ был формальным, без предложения альтернатив - классическое поведение системы с жёстким классификатором на входе.
Архитектура модерации ChatGPT включает три уровня. Первый - Moderation API, который оценивает промт до того, как он попадёт в генеративную модель. Второй - системные инструкции, которые запрещают модели генерировать определённые типы контента, даже если промт прошёл классификатор. Третий - пост-генеративная проверка ответа через тот же Moderation API. Такая тройная защита минимизирует вероятность пропуска нежелательного контента, но увеличивает задержку.
Особенность ChatGPT - защита авторского стиля. Ars Technica зафиксировала, что модель отказывается копировать манеру конкретных авторов. Запрос «напиши в стиле Стивена Кинга» отклоняется, вместо этого модель предлагает текст с «общим ощущением» жанра. Это дополнительный слой модерации, направленный на предотвращение нарушений интеллектуальной собственности.
Позиция OpenAI по модерации эволюционирует. Компания постепенно расширяет список исключений для образовательного и исследовательского контекста, но сохраняет жёсткие ограничения на откровенный контент. Для разработчиков это означает предсказуемое поведение API, но ограниченную гибкость в чувствительных доменах.
Claude: безопасность через Constitutional AI
Claude также отклонил тестовый запрос, но форма отказа отличалась. Модель объяснила, что не может создать контент, который может быть использован для вреда или дискомфорта, и предложила обсудить тему в более общем ключе. Отказ был мягче, с сохранением диалога - фирменный стиль Anthropic.
Constitutional AI - это метод обучения, при котором модель получает набор принципов и учится самостоятельно оценивать свои ответы на соответствие этим принципам. Принципы включают требования избегать вреда, уважать приватность, быть честной и отказываться от незаконных действий. В отличие от внешнего классификатора, «конституция» встроена в веса модели, что делает отказы более контекстуальными.
Позиция Anthropic по открытым моделям влияет на архитектуру модерации Claude. Дарио Амодей в посте от 27 июля 2026 года обозначил, что компания не призывает к запрету open-weights моделей, но предлагает экспортный контроль чипов и обязательное тестирование безопасности. Это отражает философию Anthropic: безопасность должна быть встроена в процесс разработки, а не добавлена постфактум. Подробнее о внутренних дебатах в компании и их влиянии на ограничения Claude мы писали в разборе технических инсайтов Anthropic.
Для разработчиков Claude означает более гибкую, но менее предсказуемую модерацию. Отсутствие внешнего классификатора усложняет аудит: нельзя просто проверить score, нужно тестировать модель на репрезентативной выборке промтов.
Grok: либеральный подход с минимумом ограничений
Grok показал наиболее либеральную реакцию на тестовый промт. Модель выдала фрагментарный ответ, который содержал элементы запрошенной сцены, но с самоограничениями - без чрезмерной детализации и с намёком на то, что тема находится на грани допустимого. Это поведение соответствует позиционированию Grok как AI с меньшим числом ограничений.
Политика модерации xAI фокусируется на явно незаконном контенте и прямом вреде. Эротика, провокационные темы и спорные высказывания не блокируются на входе - модель сама решает, как на них реагировать. Такой подход снижает число ложных блокировок, но повышает риск генерации нежелательного контента.
Риски либерального подхода проявились в инцидентах с AI-агентами для кода. Когда автономные системы получают слишком мало ограничений, они могут выполнять опасные действия - например, пентест без sandbox-изоляции, как в случае с Fable. Мы разбирали этот кейс и сравнивали защитные механизмы разных агентов в статье про безопасность AI-агентов для кода.
Для разработчиков Grok означает максимальную гибкость, но требует дополнительных слоёв фильтрации при интеграции в продукты, где нежелательный контент недопустим.
Практические рекомендации: построение собственной модерации с LLM-классификаторами
Опыт ChatGPT, Claude и Grok показывает: универсального решения нет. Выбор архитектуры модерации зависит от домена, аудитории и допустимого уровня риска. Приведём пошаговый план построения системы фильтрации промтов с использованием LLM-классификаторов.
Выбор инструмента: сравнительная таблица классификаторов
Рынок предлагает три категории инструментов для модерации промтов: внешние API, открытые модели и собственные fine-tuned решения. Каждая категория имеет свои компромиссы по точности, задержке и стоимости.
| Инструмент | Точность (F1) | Задержка | Стоимость за 1K запросов | Категории |
|---|---|---|---|---|
| OpenAI Moderation API | 0.89-0.93 | 50-100 мс | Бесплатно | 8 категорий |
| Google Perspective API | 0.85-0.90 | 100-200 мс | Бесплатно до 10K/день | Toxicity, threat, insult и др. |
| Llama Guard 3 (открытая) | 0.87-0.91 | 200-500 мс на GPU | Стоимость инференса | 13 категорий, кастомизируемые |
| Fine-tuned BERT | 0.90-0.95 | 10-30 мс | Стоимость обучения + инференс | Любые, под задачу |
OpenAI Moderation API - самый простой старт. Бесплатный, быстрый, с предсказуемым поведением. Ограничение - фиксированный набор категорий и невозможность кастомизации под специфику домена. Подходит для MVP и продуктов с типовыми требованиями к безопасности.
Открытые модели вроде Llama Guard 3 дают больше контроля: можно дообучить классификатор на своих данных, добавить домен-специфичные категории и развернуть на своей инфраструктуре. Плата за это - рост задержки и необходимость поддерживать GPU для инференса.
Собственный fine-tuned классификатор на базе BERT или небольшого LLM - выбор для high-load систем, где важна минимальная задержка и максимальная точность под конкретный домен. Требует размеченного датасета из нескольких тысяч примеров и инженерных ресурсов на обучение и деплой.
Настройка порогов: баланс между безопасностью и пользовательским опытом
Методика настройки порогов состоит из трёх шагов. Шаг первый - сбор размеченного датасета. Нужно 500-1000 промтов с метками «допустимый/недопустимый» для каждой категории риска. Разметку делают модераторы или используют синтетические данные с последующей валидацией.
Шаг второй - построение ROC-кривых для каждой категории. Это показывает зависимость true positive rate от false positive rate при разных порогах. Оптимальный порог - точка на кривой, которая соответствует бизнес-требованиям: какой процент ложных блокировок допустим, какой процент пропусков критичен.
Шаг третий - A/B-тестирование. Делим трафик на две группы: контрольную с текущими порогами и экспериментальную с новыми. Замеряем метрики: процент блокировок, процент апелляций, retention пользователей, число инцидентов. Период теста - минимум неделя для накопления статистики.
Начальные значения порогов для разных доменов: для образовательных платформ - 0.3 для sexual content, 0.5 для violence, 0.7 для hate speech. Для социальных сетей - 0.5, 0.7, 0.8 соответственно. Для корпоративных AI-ассистентов - 0.2, 0.3, 0.5. Эти цифры - стартовая точка, которая требует калибровки под конкретный продукт.
Обработка отказов: как сообщать пользователю о блокировке
Отказ в обработке промта - точка трения, которая может привести к потере пользователя. Правильное сообщение о блокировке снижает фрустрацию и сохраняет доверие. Три принципа эффективной обработки отказов: прозрачность, альтернатива, уважение.
Прозрачность означает, что пользователь понимает причину блокировки. Вместо «Ваш запрос не может быть обработан» - «Ваш запрос содержит контент, который нарушает нашу политику в категории [название категории]». Пользователь видит, что блокировка не произвольна, а основана на правилах.
Альтернатива - предложение переформулировать запрос или выбрать другую тему. Claude реализует это лучше всех: модель не просто отказывает, а предлагает обсудить тему в допустимых границах. Такой подход превращает отказ в продолжение диалога.
Уважение - отсутствие осуждающего тона. Модель не должна морализировать или стыдить пользователя за запрос. Достаточно нейтрального сообщения о несоответствии правилам. Это особенно важно для чувствительных тем, где пользователь может и так испытывать дискомфорт.
Ограничения и риски: что остается за кадром
Системы модерации промтов несовершенны. Jailbreak-атаки позволяют обходить фильтры через манипуляцию формулировками: перевод на редкие языки, разбивку запрещённых слов, использование метафор и ролевых игр. Исследователи постоянно находят новые векторы атак, и каждый патч классификатора - это временное решение.
Ложные срабатывания - вторая системная проблема. Классификатор может заблокировать безобидный медицинский запрос, потому что он содержит анатомические термины, или отклонить обсуждение исторических событий из-за упоминания насилия. Это создаёт риск для продуктов в доменах медицины, образования и журналистики.
Культурные различия усложняют проблему. То, что считается оскорбительным в одной культуре, нейтрально в другой. Многоязычные классификаторы требуют калибровки под каждый регион, что увеличивает стоимость и сложность системы.
Быстрая эволюция моделей добавляет неопределённости. Новое поколение LLM может найти способы обхода фильтров, которые не предусмотрены текущей архитектурой. Это требует постоянного мониторинга и обновления системы модерации. Вопрос скрытой предвзятости моделей также остаётся открытым - мы анализировали потенциальные векторы манипуляции в статье о том, могут ли закрытые AI-модели манипулировать общественным мнением.
Заключение: будущее модерации промтов
ChatGPT, Claude и Grok представляют три точки на спектре модерации: жёсткая многоуровневая фильтрация, встроенная в обучение безопасность и либеральный подход с пост-обработкой. Выбор между ними - это выбор между предсказуемостью, естественностью и гибкостью.
Тренды указывают на три направления развития. Первое - автоматическая адаптация порогов под контекст пользователя и историю взаимодействий. Второе - мультимодальная модерация, которая анализирует не только текст, но и изображения, голос, видео в едином пайплайне. Третье - регулирование: государства вводят обязательные требования к фильтрации AI-сервисов, и компании будут вынуждены стандартизировать подходы.
Для практиков ключевой вывод: не существует готового решения, которое подойдёт всем. Построение модерации - это итеративный процесс, который начинается с чётких правил продукта, продолжается выбором классификатора под домен и завершается постоянным мониторингом и калибровкой порогов. Инструменты для этого доступны уже сегодня - от бесплатного Moderation API до открытых моделей, которые можно развернуть на своей инфраструктуре.