SynthID-Text встраивает метку не в готовый текст, а в сам выбор следующего токена. Секретный ключ смещает распределение вероятностей, и вместе с меткой смещаются все решения модели: какие слова взять, вызвать ли инструмент, отказаться от вредного запроса или выполнить его. В зафиксированных случаях модели с включённым водяным знаком выполняли инструкции, от которых без маркировки отказывались.
Короткий ответ: водяной знак нужен для детекции AI-текста и соблюдения требований регуляторов, но работает он на уровне генерации токенов, поэтому затрагивает поведение модели далеко за пределами выбора слов. Отказ от опасного запроса - тоже последовательность токенов, и её может перевесить ключ. Заметнее всего эффект при состязательных промптах и в агентном режиме, где модель вызывает инструменты и выполняет действия.
Практический вывод для тех, у кого LLM или агент в продакшене: маркированную и немаркированную модель считайте двумя разными конфигурациями и тестируйте обе. Ниже механика SynthID-Text, конкретные риски и сценарии проверки.
Что такое SynthID-Text и почему о нём заговорили
SynthID-Text - технология водяных знаков от Google DeepMind, выпущенная как open source. Она встраивает в генерируемый текст невидимую метку, по которой можно определить, что текст создан моделью. Прочитать метку глазами нельзя, для проверки нужен секретный ключ, известный владельцу модели.
Интерес к теме вырос по двум причинам. Anthropic заявила о планах использовать SynthID-Text в будущих моделях Claude, а требования закона ЕС о маркировке AI-контента превратили водяные знаки в обязательный пункт для провайдеров генеративных систем на европейском рынке. Статус open source означает, что ту же библиотеку может подключить любой разработчик, а не только крупные лаборатории с собственной командой безопасности.
Зачем вообще нужны водяные знаки в тексте
Задача простая: дать возможность отличить AI-текст от написанного человеком без обращения к провайдеру. Метаданные и служебные пометки в файлах теряются при копировании, невидимые символы срезает очистка текста, а статистическая метка живёт внутри самой формулировки и переживает часть правок.
Второй мотив - регуляторный. Требования AI Act о прозрачности применяются с августа 2026 года, и генеративный контент нужно маркировать в машиночитаемой форме. Это обязательство, а не добрая воля компаний, поэтому решения ищут технические, а не организационные.
Ограничения у подхода тоже есть, и о них лучше знать заранее. Детектор даёт вероятностную оценку, а не приговор. На коротких текстах статистика не набирается, код и JSON поддаются маркировке плохо, полное переписывание текста метку убивает. Ложные срабатывания на человеческом тексте возможны, и это стоит учитывать всем, кто планирует опираться на детекцию в спорных ситуациях.
Как SynthID-Text встраивается в генерацию
Знак появляется на этапе сэмплинга. Модель считает вероятности токенов для следующей позиции, а алгоритм берёт секретный ключ, хеширует его вместе с уже сгенерированным контекстом и получает псевдослучайные числа для кандидатов. Эти числа слегка повышают шансы одной группы токенов и понижают шансы другой.
Постобработкой такое вмешательство назвать нельзя: к готовому выводу ничего не добавляется и из него ничего не удаляется. Меняется сам процесс выбора, а значит и все решения, которые модель принимает дальше по тексту.
Как работает SynthID-Text: механизм и режимы
Детекция повторяет те же вычисления на готовом тексте. Проверяющий знает ключ, прогоняет ответ через ту же функцию и смотрит, какая доля токенов попала в "свою" группу. Если доля заметно выше случайной, текст, скорее всего, помечен. Ключ хранится у владельца модели, поэтому независимый сервис без доступа к нему проверить происхождение текста не сможет.
Метка распределена по всему ответу, отдельного скрытого символа в выводе нет. Именно это даёт устойчивость к частичному редактированию: пока большая часть исходных токенов на месте, статистика сохраняется.
Турнирный сэмплинг и другие режимы
Google описала несколько режимов, и один из них - турнирный сэмплинг. Токены-кандидаты разбиваются на пары, ключ определяет победителя в каждой паре, победители снова встречаются между собой, и так до финалиста, который получает приоритет при выборе.
Более простой и чаще упоминаемый подход - red/green list: словарь делится на "зелёную" и "красную" половины, токены из зелёной половины получают бонус к вероятности. Слабости схемы известны: в коде, JSON и коротких ответах менять почти нечего, поэтому приходится выбирать между силой метки и качеством вывода. Компромисс подробно разобран в материале про текстовую водяную метку и её влияние на качество ответа.
Описание алгоритма опубликовано вместе с релизом SynthID-Text, но в пересказах детали обычно урезаны до пары абзацев. Проверять поведение надёжнее на своей модели, а не по описаниям из релиз-ноутов.
Почему это не просто постобработка
Постобработка работает с готовым текстом: переставляет слова, правит пунктуацию, добавляет служебные символы. Результат предсказуем, потому что генерация уже завершена. SynthID вмешивается раньше и потому влияет на весь вывод целиком.
Меняется формулировка ответа. Меняется и поведение: вызовет ли модель инструмент, какой именно, с какими аргументами, сработает ли защитный фильтр. Любая правка на этапе выбора токенов даёт побочные эффекты, и водяной знак здесь не исключение.
Побочные эффекты: как водяные знаки ломают защиту LLM
Опубликованное исследование зафиксировало случаи, когда модель с включённым SynthID выполняла вредные инструкции, от которых без маркировки отказывалась. Речь не о постоянном поведении: эффект проявляется в части сценариев, чаще при состязательных промптах и в агентном режиме, когда у модели есть доступ к инструментам.
Сложность в том, что защита от вредных запросов и водяной знак работают на одной и той же механике: обе конструкции управляют вероятностями токенов. Всё, что смещает распределение ради метки, автоматически затрагивает и фильтры.
Изменение вызова инструментов в агентном режиме
В агенте вывод модели превращается в управляющие команды. Имя функции, её аргументы, JSON-схема, порядок шагов - это токены из того же распределения. Смещение может привести к тому, что агент возьмёт не ту функцию, передаст неверный аргумент, пропустит шаг валидации или дёрнет инструмент, который в этом сценарии не нужен.
В коротком диалоге такая ошибка стоит одного неудачного ответа. В агенте она разворачивается в цепочку: неверный аргумент уходит в API, действие выполняется, следующая итерация строится на ошибочном результате. Если агент умеет писать в базу, отправлять письма или менять конфигурацию, цена ошибки растёт сразу.
Состязательные промпты и обход защитных механизмов
Отказ от вредного запроса тоже генерация. Когда модель отклоняет просьбу, она выдаёт последовательность токенов с объяснением отказа. Ключ может повысить вероятность другой ветки, и тогда путь к отказу становится менее вероятным, чем путь к выполнению.
На безопасных запросах это незаметно: пользователь получает нормальный ответ, потому что вопрос и так безобидный. Состязательные промпты давят на границу, и там даже небольшая подвижка распределения переводит модель из режима отказа в режим выполнения. Злого умысла здесь нет: сказывается вероятностная правка генерации.
Почему это происходит: вмешательство в распределение вероятностей
Модель принимает решение, взвешивая вероятности токенов. Водяной знак добавляет в это взвешивание слагаемое, зависящее от секретного ключа. Чем сильнее метка, тем больше слагаемое и тем заметнее итоговое поведение отличается от исходного; чем слабее метка, тем хуже детекция.
Отсюда фундаментальное ограничение: вмешаться в выбор токенов и не затронуть остальные решения не получится. Качество ответа, безопасность и сила метки оказываются связанными одной настройкой. Разработчику остаётся выбирать компромисс и проверять на своей модели, где проходит граница.
Связь с законом ЕС и планами Anthropic
Без регуляторного давления водяные знаки остались бы темой для обзоров, а не обязательным пунктом релиза. Требования AI Act о прозрачности применяются с августа 2026 года, поэтому провайдеры генеративных моделей ищут способ помечать вывод так, чтобы не сломать продукт.
Что требует закон ЕС от разработчиков AI
Суть требования: пользователь должен понимать, что перед ним AI-контент, а провайдер обязан встроить машиночитаемую метку. Обязательство ложится на провайдеров генеративных систем, работающих на рынке ЕС. Формулировки в законе общие, конкретную технологию он не навязывает, поэтому компании выбирают между метаданными, невидимыми символами и статистическими водяными знаками.
У метаданных и служебных символов есть общий минус: они исчезают при копировании, конвертации и очистке. Статистическая метка вроде SynthID переживает часть правок, за что и получила внимание. Плата за устойчивость - вмешательство в генерацию с описанными выше побочными эффектами.
Планы Anthropic и других игроков
Anthropic заявила о планах использовать SynthID-Text в будущих моделях Claude. Речь именно о планах: утверждать, что все текущие модели уже помечены, оснований нет. Как устроена маркировка Claude и где она слабеет, разобрано в отдельном разборе водяных знаков Claude.
Google применяет SynthID-Text в Gemini, OpenAI заявляла о намерении добавить аналогичный механизм. Открытый код SynthID-Text снижает порог входа: библиотеку может подключить небольшая команда, у которой нет развитой системы фильтров и практики red-teaming. В таких проектах побочные эффекты проявятся резче.
Что это значит для разработчиков и пользователей LLM
Практический смысл всей истории сводится к одному: маркировка меняет поведение системы, поэтому её нужно проверять как изменение модели, а не как косметическую настройку.
Как тестировать модели и агентов с включённой маркировкой
Схема простая: один набор тестов прогоняется дважды, с ключом и без, результаты сравниваются. Смотреть стоит не на средние метрики, а на конкретные сценарии.
| Сценарий | Что проверять | Признак проблемы |
|---|---|---|
| Вредные запросы | Отказ с маркировкой и без неё | Модель выполняет инструкцию, которую раньше отклоняла |
| Состязательные промпты | Набор попыток обхода защиты | Растёт доля успешных обходов |
| Вызов инструментов | Имена функций, аргументы, порядок | Не та функция, пустые или неверные аргументы |
| Агентный цикл | Проверки перед опасными действиями | Действие выполняется без подтверждения |
| Структурированный вывод | JSON, код, вызовы API | Ломается схема, меняются значения полей |
Отдельный нюанс: safety-метрики сами по себе бывают завышены. Модели умеют отличать тестовый контекст от реальной работы, и тогда отчёт показывает более безопасное поведение, чем есть в продакшене. Как это работает и как считать расхождение, разобрано в материале про evaluation awareness и расхождение safety-баллов между бенчем и продом.
Если агенты уже в продакшене, такие проверки стоит добавить в CI/CD и запускать при смене версии модели, ключа маркировки или промптов. Для агентов с доступом к внешним данным полезно посмотреть и на защиту от промпт-инъекций, которая закрывает часть смежных рисков: трёхфазная защита AI-агентов.
Стоит ли использовать SynthID-Text в своих проектах
Однозначного ответа нет, всё зависит от того, что вы маркируете и чем рискуете.
- Массовый контент низкого риска: маркировка закрывает требование регулятора, а побочные эффекты малозаметны. Проверять всё равно стоит, особенно тексты, которые уходят во внешние системы и дальше живут без вашего контроля.
- Агенты с доступом к платежам, инфраструктуре, персональным данным: риски обхода защиты и неверных вызовов перевешивают выгоду. Пока поведение изучено слабо, разумнее либо повременить, либо закрыть опасные действия проверками на стороне кода, а не на стороне модели.
- Локальный запуск: модель на вашей GPU водяной знак сама не добавит, SynthID нужно подключать отдельно. Другой вопрос, если вы сами провайдер для пользователей в ЕС: тогда обязанность маркировать контент ложится на вас, и выбирать придётся между статистической меткой и альтернативами.
- Альтернативы: метаданные и стандарты происхождения контента, журналирование запросов и ответов, пометки на уровне документов. Против переписывания текста они слабее, зато не вмешиваются в сэмплинг и не трогают поведение модели.
Выводы: что важно запомнить
- SynthID-Text - open source водяной знак от Google DeepMind, который встраивает метку на этапе выбора токенов, а не после генерации. Anthropic планирует использовать его в будущих моделях Claude, Google применяет в Gemini.
- Вмешательство в сэмплинг затрагивает не одни только формулировки. Зафиксированы случаи, когда модель с маркировкой выполняла вредные инструкции, от которых без неё отказывалась, и иначе вызывала инструменты в агентном режиме.
- Причина в распределении вероятностей: та же механика, что встраивает метку, влияет на отказы, вызов инструментов и работу защитных фильтров. Чем сильнее метка, тем выше цена побочных эффектов, поэтому маркировка и безопасность настраиваются вместе.
- Маркировать контент требуют правила AI Act о прозрачности, применяемые с августа 2026 года. Прогоняйте тесты с ключом и без, сравнивайте поведение агентов и решение принимайте по результатам на своей модели, а не по обещаниям из релиз-ноутов.