Будущие модели Claude будут маркировать текст по всему миру в соответствии с требованиями EU AI Act
Anthropic добавит в будущие модели Claude текстовые водяные знаки на основе SynthID и учётные данные файлов C2PA по всему миру.
Anthropic встроит в будущие модели Claude машиночитаемые сигналы происхождения: статистические водяные знаки для сгенерированного текста и подписанные метаданные C2PA для поддерживаемых файлов. Хотя это изменение предназначено для соблюдения AI Act Европейского союза, Anthropic планирует применять текстовый водяной знак по всему миру, а не ограничивать его европейскими пользователями.
Политика распространяется на модели Claude, запущенные в ЕС 2 августа 2026 года или позднее. Эти модели будут поддерживать маркировку с момента запуска, тогда как Anthropic заявляет, что в ближайшие месяцы работает над расширением системы на модели, выпущенные до этой даты. Компания не назвала конкретную новую модель Claude, которая станет первой реализацией.
Водяной знак не будет отображаться в виде метки, скрытого символа Unicode или дополнительной строки в ответе. Вместо этого он изменит статистический процесс, который Claude использует для выбора токенов при генерации. Anthropic заявляет, что это не должно менять смысл, читаемость, задержку и цены, но компания пока не выпустила свой детектор, специфичный для Claude, не раскрыла пороговые значения, частоту ложноположительных результатов или полную техническую оценку.
1. Маркировка охватит продукты Claude и облачный доступ
Anthropic заявляет, что поддерживаемые модели будут применять текстовые водяные знаки в потребительском сервисе Claude, Claude Platform API, Claude Code, Claude Cowork и Claude Tag. Водяной знак также будет применяться при доступе к этим моделям через AWS, Google Cloud или Microsoft Foundry.
Эта реализация на уровне модели важна, поскольку метка не зависит от конкретного пользовательского интерфейса. Разработчик, вызывающий API, и человек, использующий Claude напрямую, должны получать текст, созданный с помощью одного и того же процесса нанесения водяного знака, если они используют поддерживаемую модель.
Развёртывание будет глобальным. Anthropic заявляет, что пока не располагает устойчивым способом ограничить этот механизм по регионам, поэтому поддерживаемые модели будут маркировать текст везде, где доступен Claude. Таким образом, требование ЕС о соблюдении законодательства становится изменением продукта и для пользователей Claude, и для разработчиков за пределами блока.
У широкого охвата есть оговорки. Подписанные метаданные файлов могут быть доступны не на каждой облачной платформе, не для каждой функции продукта или типа файла. Существующие модели Claude также могут оставаться немаркированными, пока Anthropic не обновит их. Следовательно, отсутствие обнаруживаемой метки не будет доказывать, что фрагмент был создан без Claude.
Anthropic заявляет, что водяной знак не содержит информации о пользователе, организации, аккаунте или разговоре, в котором был создан текст. Он идентифицирует статистический паттерн, связанный с процессом генерации Claude, а не индивидуальный источник. Механизм также не создаёт дополнительных выходных токенов, поэтому Anthropic заявляет, что он не увеличит плату за использование.
2. Claude будет использовать версию SynthID-Text
Текстовый водяной знак Claude основан на SynthID-Text — методе, описанном Google DeepMind в статье Nature 2024 года и впоследствии предоставленном другим разработчикам моделей.
Языковая модель обычно выбирает каждый следующий токен из распределения вероятностей, обусловленного предшествующим текстом. Во многих фрагментах есть места, где несколько вариантов были бы одинаково уместны. Система нанесения водяных знаков может использовать эти варианты для создания повторяющегося статистического паттерна, не вставляя видимый символ или отдельное поле метаданных.
Anthropic описывает свою реализацию как использующую закрытый ключ и предшествующие слова для определения источника случайности, применяемого для допустимых вариантов выбора. Детектор, имеющий доступ к соответствующему ключу, может исследовать фрагмент и оценить, насколько его последовательность согласуется с процессом генерации Claude с водяным знаком.
Эталонная реализация Google описывает SynthID-Text как обработчик логитов, применяемый после фильтрации top-k и top-p. Псевдослучайная функция назначает оценки по словарю модели, а конфигурация водяного знака влияет на выбор токенов. Дополнительное обучение модели не требуется, однако ключ и конфигурация должны оставаться закрытыми; иначе третьи стороны могли бы воспроизводить сигнал.
Следовательно, водяной знак является частью сгенерированных формулировок и обычно сохраняется при копировании и вставке. Лёгкие правки или выдержки могут сохранять достаточно паттерна, чтобы оставаться обнаруживаемыми. Тщательная переработка, перевод или смешивание с другим текстом могут снизить уверенность детектора или устранить пригодный для использования сигнал.
Плотность водяного знака также зависит от задачи. Открытый прозаический текст предлагает много малозначимых вариантов выбора слов, тогда как фактические ответы содержат больше токенов, для которых одно продолжение явно точнее альтернатив. Anthropic заявляет, что не будет применять подталкивание для нанесения водяного знака, если оно может поставить под угрозу корректность.
То же ограничение касается исходного кода. Точный синтаксис, идентификаторы и поведение программы ограничивают число взаимозаменяемых вариантов токенов, поэтому код может содержать менее обнаруживаемую маркировку, чем проза. Комментарии или другие произвольные формулировки всё ещё могут нести этот паттерн. При вычитке также может оставаться мало сигнала, если Claude сохраняет большую часть исходных формулировок человека, тогда как перевод с большей вероятностью будет нести водяной знак, поскольку Claude выбирает каждое слово в переведённом выводе.
3. Файлы будут использовать метаданные C2PA, а не текстовый метод
Для поддерживаемых файлов, таких как результаты в форматах SVG, PNG и JPEG, Anthropic будет добавлять небольшую криптографически подписанную запись о происхождении в соответствии со стандартом Coalition for Content Provenance and Authenticity.
Учётные данные C2PA фиксируют информацию о происхождении файла и истории его обработки. Совместимый инструмент проверки может изучить подписанную запись и определить, изменялся ли файл таким образом, который нарушает его криптографическую связь с этой записью.
Этот механизм отличается от текстового водяного знака Claude. Информация C2PA находится в метаданных файла, а не статистически кодируется в пикселях или формулировках. Её наличие может сигнализировать, что Claude сгенерировал или обработал файл, но не устанавливает, что Claude создал каждый элемент внутри него.
Метаданные также легче потерять, чем статистический паттерн на уровне текста. Anthropic предупреждает, что преобразование формата, повторное сохранение, создание скриншота или другая обработка могут удалить учётные данные файла. Некоторые платформы могут изначально не сохранять или не поддерживать метаданные.
Следовательно, отсутствие учётных данных не доказывает, что Claude не участвовал в создании файла. И наоборот, действительные учётные данные устанавливают только зафиксированное событие обработки; это не суждение о том, является ли содержание точным, подлинным в более широком редакционном смысле или преимущественно созданным человеком.
4. Обнаружение остаётся вероятностным, а API Claude пока недоступен
Anthropic заявляет, что предложит API для обнаружения водяных знаков, но по состоянию на 27 августа не опубликовала этот API, дату его выпуска, пороговые значения решения или подробные результаты производительности, специфичные для Claude. В её справочной документации говорится, что дополнительное техническое руководство будет опубликовано позднее.
Отсутствующая информация не позволяет точно оценить вероятность ложноположительных результатов Claude. Обнаружение SynthID-Text по своей природе вероятностно, а публичная реализация Google может вернуть “watermarked,” “not watermarked,” или “uncertain.” Операторы настраивают пороговые значения, балансируя ложноположительные и ложноотрицательные результаты.
Детектор Anthropic будет отвечать на ограниченный вопрос: насколько вероятно, что Claude участвовал в создании хотя бы части представленного текста. Он не докажет, что Claude написал весь документ, не отличит генерацию от существенного редактирования, не идентифицирует пользователя и не обнаружит текст, созданный несвязанной моделью с другим ключом для водяного знака.
Положительный результат может относиться к материалу, чьи лежащие в основе идеи или исходные формулировки принадлежали человеку. Claude мог перевести, обобщить, переформатировать или существенно отредактировать этот материал. Отрицательный результат столь же неокончателен, поскольку фрагмент может быть слишком коротким, сильно переписанным, смешанным с другим текстом, сгенерированным более старой моделью Claude или созданным через неподдерживаемый интерфейс.
Anthropic сообщает, что её внутреннее тестирование не выявило влияния на содержание, креативность или читаемость, но не опубликовала лежащую в основе оценку Claude. Ближайшие публичные крупномасштабные данные получены в исследовании Google DeepMind по SynthID-Text: оно сравнило отзывы почти по 20 миллионам ответов Gemini с водяными знаками и без них и не выявило статистически значимой разницы в пользовательских оценках. Этот результат поддерживает общий метод, но не является независимым измерением нераскрытой реализации Anthropic.
Эти ограничения делают детектор непригодным в качестве самостоятельного доказательства при решениях в сфере занятости, образования, плагиата или дисциплинарных мер. Даже после появления API ответственное использование будет требовать опубликованного порогового значения, данных оценки, длины фрагмента, языка, истории редактирования и других доказательств происхождения.
5. Изменение реализует юридическое требование о маркировке
Статья 50 EU AI Act начала применяться 2 августа 2026 года. Она требует от поставщиков генеративных систем ИИ делать синтетические аудио-, графические, видеоматериалы и текстовые результаты обнаруживаемыми в машиночитаемом формате с использованием методов, которые являются эффективными, совместимыми, устойчивыми и надёжными в той мере, в какой это технически осуществимо.
Anthropic входит в число организаций, подписавших Кодекс практики ЕС по прозрачности контента, созданного ИИ. Кодекс является добровольным, но лежащие в его основе обязательства по статье 50 юридически обязательны. Европейская комиссия и Совет по ИИ признали кодекс рамочной основой, с помощью которой подписавшие стороны могут демонстрировать соблюдение требований.
Требование о маркировке со стороны поставщика отделено от правил, регулирующих видимое раскрытие информации. Поставщики, такие как Anthropic, должны встроить машиночитаемые сигналы в применимые системы. На развёртывающие стороны возлагаются дополнительные обязательства по маркировке дипфейков и некоторых текстов, созданных или изменённых ИИ и опубликованных для информирования общественности по вопросам общественного интереса, с учётом исключений, включая проверку человеком и редакционную ответственность.
Для разработчиков, встраивающих Claude в другой продукт, водяной знак Anthropic на уровне модели может обеспечить часть необходимой инфраструктуры происхождения, но не определяет собственные обязательства разработчика по соблюдению требований. Anthropic прямо советует последующим разработчикам оценивать, как статья 50 применяется к их продуктам и услугам.
Частые вопросы
Каждый ли ответ Claude уже содержит водяной знак?
Нет. Обязательство распространяется на поддерживаемые модели, запущенные 2 августа 2026 года или позднее, тогда как маркировка для более старых моделей всё ещё разрабатывается.
Может ли копирование текста Claude удалить водяной знак?
Обычное копирование и вставка должны сохранять его, поскольку паттерн кодируется в выборе слов. Значительная переработка, перевод или смешивание с другим текстом могут ослабить или удалить обнаруживаемый сигнал.
Может ли водяной знак доказать, что Claude написал весь документ?
Нет. Он может указывать, что Claude, вероятно, участвовал в работе, но не может отличить полную генерацию от существенного редактирования, перевода или обобщения.
Увеличивает ли нанесение водяных знаков расход токенов или цену Claude?
Anthropic заявляет, что дополнительные токены не создаются, а механизм оказывает пренебрежимо малое влияние на скорость генерации, поэтому цена не изменится из-за водяного знака.
Доступен ли детектор водяных знаков Claude публично?
Пока нет. Anthropic заявляет, что API обнаружения и дополнительная техническая документация появятся позднее, но не опубликовала дату выпуска или показатели ошибок, специфичные для Claude.
Источники
- Исходный пост DeepLearning.AI в X
- Anthropic: как работает текстовый водяной знак Claude
- Справочный центр Anthropic: как Claude маркирует контент, созданный ИИ
- Европейская комиссия: Кодекс практики по прозрачности контента, созданного ИИ
- Европейская комиссия: Руководство по обязательствам по прозрачности для поставщиков и развёртывающих сторон определённых систем ИИ
- Google AI for Developers: инструменты SynthID для нанесения водяных знаков и обнаружения текста, созданного LLM
- Nature: масштабируемое нанесение водяных знаков для идентификации результатов больших языковых моделей
- Axios: текстовые водяные знаки Anthropic сигнализируют о новом фронте в обнаружении ИИ
Share