Водяной знак Claude — это не слой невидимых символов, который можно просто удалить. Anthropic описывает его как статистический паттерн в выборе моделью слов или токенов. Проверяющий алгоритм оценивает, насколько последовательность текста соответствует вероятностной схеме, характерной для генерации Claude.
Подход Meyer, по имеющимся сообщениям, использует немаркированную языковую модель для создания нескольких вариантов переписывания. Она подбирает синонимы и меняет структуру формулировок, стараясь сохранить исходный смысл. Такие изменения воздействуют непосредственно на рисунок выбора слов, по которому работает детектор.
Другие браузерные инструменты нацелены на иные особенности машинного текста: удаляют невидимые или похожие на обычные Unicode-символы, переставляют предложения и заменяют слова синонимами. Среди возможных способов нарушения статистического паттерна также называют сильное сокращение текста или перевод на другой язык с последующим переводом обратно. Однако это не следует путать с удалением самого текстового водяного знака Claude: Anthropic подчеркивает, что он не состоит из скрытых символов и не добавляется в виде текстовых метаданных.
Anthropic говорит, что использует вариант подхода SynthID-Text, разработанного Google DeepMind. При выборе между подходящими вариантами следующего слова Claude применяет управляемую секретным ключом случайность, связанную с предшествующими словами. Затем проверяющий алгоритм оценивает, насколько весь фрагмент статистически согласуется с таким процессом генерации.
Маркер должен оставаться невидимым для читателя, не добавлять символов и не требовать дополнительных токенов. По словам Anthropic, он также не должен заметно влиять на смысл, качество, творческий характер, читаемость или стоимость текста.
В водяном знаке нет сведений, позволяющих установить личность автора: его нельзя связать с конкретным человеком, организацией или чатом. Поэтому это сигнал об атрибуции, а не персональный цифровой отпечаток. Anthropic формулирует результат проверки как вероятность того, что Claude участвовал в создании текста. Такой результат не устанавливает, кто написал фрагмент, не доказывает, что человек не участвовал в его подготовке, не определяет авторство другой модели и ненадежен для коротких текстов.
Особенно важна эта оговорка, когда Claude используют для корректуры, легкого редактирования, пересказа или перевода. Anthropic признает: после незначительной правки в тексте может сохраниться лишь небольшой фрагмент сигнала — например, на словах, выбранных самой моделью. Его может оказаться недостаточно для надежного обнаружения.
Согласно публикации Wired, критика Meyer направлена не против атрибуции как таковой. Он отделяет установление возможного происхождения контента от невидимого маркера, который могут использовать как доказательство против конкретного человека. Его беспокоит, что вероятностный сигнал не различает существенное участие ИИ и ограниченную помощь — например, корректуру или редактирование.
Это часть более широкой проблемы происхождения текста. Положительный результат проверки говорит лишь о статистической совместимости фрагмента с участием Claude. Он не показывает, какая доля финального текста создана моделью, сколько изменил человек и кому принадлежат исходные идеи. После серьезного переписывания, перевода, сокращения или реконструкции граница между «текстом, созданным ИИ» и «текстом человека с помощью ИИ» становится еще менее четкой.
Доступные источники не указывают, что маркировка меняет право собственности на результат Claude или иные существенные права пользователей. Anthropic представляет ее как способ оценить возможное участие модели, а не как заявление о собственности на текст.
Статистическая маркировка зависит от рисунка, распределенного по множеству выборов слов. Если текст остается почти неизменным, этот рисунок может сохраняться при копировании и вставке и переживать некоторые виды редактирования. Но масштабный парафраз, перевод или самостоятельное переписывание способны изменить достаточно много формулировок, чтобы сигнал перестал обнаруживаться.
Исследователи, которых цитирует Nature, также сомневаются, что текстовые водяные знаки смогут надежно остановить мотивированного пользователя, решившего переписать результат ИИ — в том числе с помощью другой языковой модели. По их мнению, сигнал может исчезнуть при сохранении большей части смысла.
Это не делает водяные знаки бесполезными. Они могут быть машинно-читаемой подсказкой для стандартных проверок, если текст достаточно длинный и близок к первоначальному результату генерации. Но как устойчивое доказательство неизменного происхождения они работают значительно хуже, особенно после существенной человеческой правки.
Соответствующее требование ЕС в первую очередь адресовано поставщикам ИИ-систем: они должны внедрять технические решения для машинно-читаемой маркировки и обнаружения контента, созданного или измененного ИИ, с учетом технической осуществимости. Закон упоминает водяные знаки и другие методы как возможные подходы, но не гарантирует, что один метод будет надежен при любых обстоятельствах.
Предоставленные источники не подтверждают существование общего запрета в праве ЕС на создание или использование независимыми третьими сторонами инструментов для удаления водяных знаков. Они также не объясняют, почему Anthropic не могла сначала ограничить функцию пользователями из ЕС. Вместо этого компания выбрала глобальное применение маркировки везде, где доступны поддерживаемые модели Claude.
Запуск маркировки Claude одновременно показал пользу и хрупкость текстовых водяных знаков. Такой маркер может выступать вероятностным сигналом того, что Claude участвовал в подготовке фрагмента, но он не является скрытыми метаданными, персональным идентификатором или окончательным доказательством авторства итогового текста.
Появление инструмента Meyer всего через четыре часа демонстрирует, почему требование EU AI Act о машинно-читаемой маркировке следует воспринимать прежде всего как меру прозрачности, а не как безошибочную цепочку подтверждения происхождения.