Что именно внедряет OpenAI: суть нововведения
OpenAI внедряет невидимые водяные знаки в текст, который генерируют ChatGPT и Codex, на территории Евросоюза. Компания объявила об этом официально. Метка создаётся фирменным методом textGrain: модель корректирует вероятности выбора слов прямо во время генерации. Скрытых символов, невидимых пробелов и особой пунктуации в тексте не появляется.
Повод юридический. Европейский закон об ИИ обязывает разработчиков генеративных моделей делать созданный ими контент распознаваемым для алгоритмов. Маркировка давно перестала быть доброй волей отдельной компании и превратилась в требование регулирования, под которое подстраиваются все крупные вендоры.
Что меняется на практике. В ближайшие недели метки появятся в ответах пользователей всех тарифов в странах ЕС, отключить их в интерфейсе нельзя. Клиенты API по всему миру получат функцию на выбор. Для русскоязычной аудитории вне ЕС прямых изменений пока нет, но если продукт работает с контентом для европейского рынка, метка будет появляться в его текстах.
Кого затронет маркировка: пользователи ЕС и клиенты API
Разделение простое, и его стоит держать в голове.
- Пользователи ChatGPT и Codex в ЕС. Метка включается автоматически для всех тарифов, включая бесплатный. Настроек для отказа нет.
- Клиенты API по всему миру. Функция опциональна, её можно включить или оставить выключенной. Тот, кто строит свой продукт на моделях OpenAI, решает это сам.
- Пользователи вне ЕС. В веб-интерфейсе принудительная маркировка привязана к европейскому сегменту, поэтому основные изменения стоит ждать именно там.
Смысл этой развилки в том, что обязательная маркировка привязана к географии и юридическому лицу, а не к самой модели. Одна и та же генерация для пользователя из Берлина и из Алматы может отличаться наличием метки.
Зачем это нужно: требования закона об ИИ
Европейский закон об ИИ требует, чтобы сгенерированный текст был распознаваем алгоритмами, а не только человеком. Отсюда и ставка на статистический сигнал, скрытый в словах: он не мешает чтению, но считывается детектором. Прозрачность здесь односторонняя: проверить текст может тот, у кого есть детектор и ключ, а не любой читатель. Детали сроков и юридических исключений в объявлении не раскрываются, поэтому конкретные даты приводить не стоит.
Как работает textGrain: статистический паттерн вместо скрытых символов
textGrain работает с вероятностями выбора слов, а не с символами. Модель на каждом шаге выбирает следующий токен, и этот выбор слегка смещается в сторону, заданную секретным ключом. В текст не попадают ни скрытые символы, ни невидимые пробелы, ни специальная пунктуация: система меняет вероятность выбора определённых слов или частей слов во время генерации. Похожие схемы на основе red/green list уже применяют другие вендоры, и их механику мы разбирали в отдельном материале про текстовую водяную метку в AI.
Масштаб вмешательства мал. Каждый отдельный выбор слова выглядит естественно, а статистический рисунок набирает силу только на длинном тексте и считывается специальным детектором. Именно поэтому метку невозможно заметить глазами: она проявляется в распределении, а не в конкретном месте.
Секретный ключ и сортировка вариантов следующего слова
Техническое описание метода OpenAI опубликовала одновременно с объявлением. Документ подготовлен совместно с исследователями Пенсильванского университета и Йельского университета, а в нём описан способ сортировки вариантов следующего слова с помощью секретного ключа: ключ задаёт порядок, в котором модель предпочитает эквивалентные варианты. У кого ключа нет, тот видит обычный текст. У кого есть, тот получает статистическое преимущество при проверке.
Детали алгоритма в открытом описании раскрыты не полностью, и достраивать их по догадкам смысла нет. Важно другое: сигнал рождается внутри процесса генерации, поэтому живёт ровно там, где модель выбирает формулировки.
Почему метка сохраняется при копировании
Признак содержится непосредственно в словах, а не в форматировании, метаданных или скрытых символах. Копирование и вставка такой сигнал не разрушают: переносится сам текст, а вместе с ним и статистический рисунок. Это принципиальное отличие textGrain от методов, которые прячут метку в невидимых символах или атрибутах документа. Там достаточно очистить форматирование, чтобы всё исчезло. Здесь так не получится.
Где textGrain ломается: ограничения детектора
Надёжность метки зависит от того, сколько свободы было у модели при генерации и сколько текста прошло через правки. Оба фактора работают против детектора, и OpenAI называет эти ограничения прямо.
Короткие тексты и точные дисциплины
Детектор хуже распознаёт короткие фрагменты: в паре предложений сигнал не успевает накопиться. Точные дисциплины вроде математики дают ту же проблему с другой стороны: выбор формулировок там сильно ограничен, эквивалентных вариантов мало, и ключу почти негде смещать вероятности. Переведённые тексты распознавать тоже труднее. Чем меньше у модели пространства для манёвра, тем слабее метка.
Что происходит при редактировании и переводе
Ручное редактирование разрушает метку быстрее всего. OpenAI приводит конкретные цифры: если заменить 10% слов синонимами в тексте из 400 токенов, точность распознавания падает с 92% до 66%, а замена четверти слов снижает её до 17%.
| Правки в тексте 400 токенов | Точность детектора |
|---|---|
| Без правок | 92% |
| Замена 10% слов синонимами | 66% |
| Замена 25% слов синонимами | 17% |
Вывод практический: если текст прошёл нормальную редактуру, детектор может его не узнать. Существенный рерайт, перефразирование и перевод ослабляют сигнал и делают обнаружение менее надёжным. Цифры взяты из описания OpenAI, независимых подтверждений нет, поэтому воспринимать их стоит как заявленные компанией характеристики, а не как результат сторонних тестов.
Что метка НЕ делает: приватность, промпты и достоверность
Водяной знак не содержит данных о пользователе, не раскрывает введённые промпты и не подтверждает фактическую достоверность написанного. Наличие сигнала не позволяет установить личность, аккаунт или запрос, который человек отправлял ChatGPT. Детектор не раскрывает переписку и не определяет, какую именно часть материала потом написал или отредактировал человек.
У метки есть и граница ответственности. Она говорит только о возможном происхождении текста, не подтверждает достоверность, не фиксирует авторские права и не показывает, правили ли текст после генерации.
Почему отсутствие метки ничего не доказывает
Отсутствие метки не доказывает авторство человека. Причин несколько: текст может быть слишком коротким, сильно отредактированным или созданным другой системой искусственного интеллекта. Любой из этих сценариев даёт чистый результат при проверке. Это ограничивает применение детектора в юридических и редакционных процессах: строить на нём обвинение в том, что текст написан нейросетью, нельзя.
Влияние на качество генерации: что говорят бенчмарки
По внутренним бенчмаркам OpenAI на флагманской модели Astra вмешательство textGrain практически не влияет на качество и точность генерации. Это оценка самой компании, и независимых подтверждений в Research Pack нет. Корректная формулировка звучит так: по данным OpenAI, просадки качества в её тестах не видно.
Технически этому есть объяснение. Ключ меняет выбор среди близких по вероятности вариантов, а не вынуждает модель брать маловероятные слова. На длинных ответах такие микро-сдвиги почти не читаются. Но именно это свойство вызывает отдельный интерес: любой вмешательство в выбор токенов меняет поведение модели, и эпизоды влияния маркировки на обход защит от вредных запросов уже фиксировались. Разбор таких случаев есть в статье про водяные знаки SynthID и поведение LLM. Переносить эти выводы на textGrain напрямую нельзя, но тестировать агентов с включённой маркировкой разумно.
Доступ к детектору и открытый код: что дальше
Доступ к детектору меток на первых порах откроют исключительно проверенным исследователям и профильным организациям. В дальнейшем OpenAI планирует опубликовать исходный код технологии. Для обычных пользователей и разработчиков это означает простое следствие: самостоятельно проверить текст на метку пока нельзя. Сроки открытия кода и условия доступа к детектору компания не называет, и додумывать их не стоит.
Похожий путь проходят конкуренты. Anthropic маркирует тексты Claude на базе SynthID-Text и тоже обсуждает API для детекции, о чём мы писали в разборе про водяные знаки Claude. Параллельно развивается независимая детекция: Substack подключил детектор AI-контента на базе Pangram, и в этой истории видно, как проверка встраивается прямо в платформы. Детали есть в материале про детектор AI-контента в Substack.
Практические выводы: что это значит для работы с AI-текстом
Собрать всё в рабочую картину можно в пять пунктов.
- Пользователям ЕС метки включат автоматически во всех тарифах, отказаться нельзя. Это часть требований европейского закона об ИИ.
- Клиенты API по всему миру получают выбор: функцию можно включить или оставить выключенной.
- Редактирование, перефразирование и перевод разрушают метку. Замена 10% слов синонимами роняет точность с 92% до 66%, замена четверти слов снижает её до 17%.
- Метка не несёт персональных данных и не раскрывает промпты, но и не гарантирует достоверность текста.
- Отсутствие метки не доказывает авторство человека.
Из этого следует практическая линия поведения. Не строить юридические и редакционные решения только на детекторе: он даёт вероятностный сигнал, а не доказательство. Если контент идёт на европейский рынок, рассчитывать, что сгенерированный текст будет автоматически промаркирован, и учитывать это в процессах проверки и раскрытия информации. Если вы разрабатываете на API и маркировка для вас критична, включайте её осознанно и тестируйте агентов и вызовы инструментов вместе с этим режимом: такой класс методов умеет влиять на поведение модели не только на уровне выбора слов.