欧盟《人工智能法案》规则下,未来 Claude 模型将在全球为文本添加水印
Anthropic 将在全球范围内为未来 Claude 模型添加基于 SynthID 的文本水印和 C2PA 文件凭证。
Anthropic 将在未来 Claude 模型中内置机器可读的溯源信号:为生成文本添加统计水印,并为受支持文件添加经签名的 C2PA 元数据。尽管这一变更旨在遵守欧盟《人工智能法案》,Anthropic 计划在全球应用该文本水印,而非仅限于欧洲用户。
该政策适用于自 2026 年 8 月 2 日起在欧盟推出的 Claude 模型。这些模型将从发布时起支持标记;Anthropic 表示,正在努力于未来数月内将该系统扩展至在该日期之前发布的模型。该公司尚未点名具体哪一款新 Claude 模型将率先实施。
水印不会以标签、隐藏 Unicode 字符或回复中的额外一行形式出现。相反,它会改变 Claude 在生成过程中选择词元时所使用的统计过程。Anthropic 表示,这不应改变含义、可读性、延迟或定价,但该公司尚未发布其 Claude 专用检测器、阈值、误报率或完整技术评估。
一、标记将覆盖 Claude 产品和云端访问
Anthropic 表示,受支持模型将在 Claude 消费者服务、Claude Platform API、Claude Code、Claude Cowork 和 Claude Tag 中应用文本水印。通过 AWS、Google Cloud 或 Microsoft Foundry 访问这些模型时,水印同样会生效。
这种模型层面的实施方式很重要,因为标记不依赖于某个特定用户界面。调用 API 的开发者和直接使用 Claude 的个人,在使用受支持模型时,都应获得通过同一水印流程生成的文本。
此次推出覆盖全球。Anthropic 表示,目前尚无持久可靠的方法可按地区限制该机制,因此只要 Claude 在某地提供服务,受支持模型就会在那里标记文本。这使一项欧盟合规要求也成为欧盟以外 Claude 用户和开发者的产品变更。
这一广泛范围也存在限定条件。经签名的文件元数据可能并非在每个云平台、产品功能或文件类型中都可用。现有 Claude 模型也可能在 Anthropic 更新前仍不带标记。因此,检测不到标记并不能证明某段文字不是由 Claude 生成的。
Anthropic 表示,水印不携带有关生成文本的用户、组织、账户或对话的信息。它识别的是与 Claude 生成过程相关的统计模式,而非某个个体来源。该机制也不会产生额外输出词元,因此 Anthropic 表示不会增加使用费用。
二、Claude 将使用 SynthID-Text 的一个版本
Claude 的文本水印基于 SynthID-Text,这一方法由 Google DeepMind 在 2024 年发表于《Nature》的论文中描述,随后向其他模型开发者开放。
语言模型通常会根据前文的条件概率分布选择下一个词元。许多段落中存在多个同样合适的选择。水印系统可以利用这些选择形成反复出现的统计模式,而无需插入可见符号或单独的元数据字段。
Anthropic 描述称,其实施方式会使用私钥和前面的词语,来确定适用于合格选择的随机性来源。能够访问相关密钥的检测器可以检查一段文字,并评估其词元序列与 Claude 带水印生成过程的一致程度。
Google 的参考实现将 SynthID-Text 描述为在 top-k 和 top-p 过滤后应用的 logits 处理器。一个伪随机函数会对模型词汇表中的词元分配分数,水印配置会影响词元选择。无需进行额外模型训练,但密钥和配置必须保持私密;否则第三方可能复现该信号。
因此,水印是生成措辞的一部分,通常能在复制和粘贴后保留。轻度编辑或摘录可能仍保留足够的模式,从而可被检测。彻底改写、翻译或与其他文本混合,可能降低检测器的置信度,或消除可用信号。
水印密度也取决于任务。开放式文本提供了许多无关紧要的措辞选择,而事实性回答中有更多词元的某一种续写显然比其他选择更准确。Anthropic 表示,当水印引导可能损害正确性时,将避免施加这种引导。
同样的限制也会影响源代码。精确的语法、标识符和程序行为限制了可互换词元选择的数量,因此代码中可检测到的水印可能少于散文。不过,注释或其他任意措辞仍可能携带这一模式。校对也是如此:当 Claude 保留大部分个人原始措辞时,可能留下很少的信号;而翻译更可能携带水印,因为 Claude 会选择译文中的每一个词。
三、文件将使用 C2PA 元数据,而非文本技术
对于 SVG、PNG 和 JPEG 输出等受支持文件,Anthropic 将附加一份小型、经过加密签名的溯源记录,遵循内容溯源与真实性联盟的标准。
C2PA 凭证会记录文件的来源和处理历史。兼容的验证工具可以检查签名记录,并判断文件是否以破坏其与该记录加密关系的方式发生变化。
这一机制不同于 Claude 的文本水印。C2PA 信息位于文件元数据中,而不是以统计方式编码进像素或措辞之中。其存在可以表明 Claude 曾生成或处理某个文件,但不能证明 Claude 创作了其中的每一个元素。
元数据也比文本层面的统计模式更容易丢失。Anthropic 警告,格式转换、重新保存、截取屏幕截图或其他处理都可能剥离文件凭证。一些平台可能一开始就不保留或不支持该元数据。
因此,缺少凭证并不能证明 Claude 没有参与某个文件。反过来,有效凭证也只能证明已记录的处理事件;它并不是对内容是否准确、是否在更广泛的编辑意义上真实,或是否主要由人类创作的判断。
四、检测仍具有概率性,Claude API 尚未推出
Anthropic 表示将提供水印检测 API,但截至 8 月 27 日,尚未发布该 API、其上线日期、判定阈值或详细的 Claude 专用性能结果。其帮助文档称,进一步的技术指南即将发布。
这些缺失的信息使人们无法准确评估 Claude 的误报概率。SynthID-Text 检测本身具有概率性,Google 的公开实现可以返回“带水印”“不带水印”或“不确定”。运营者可以配置阈值,以权衡误报与漏报。
Anthropic 的检测器将回答一个有限的问题:Claude 参与生成所提交文本至少一部分的可能性有多大。它不能证明 Claude 撰写了整份文档,不能区分生成与大幅编辑,不能识别用户,也不能检测由使用不同水印密钥的无关模型生成的文本。
阳性结果可能覆盖其基本思想或原始措辞来自个人的材料。Claude 可能对这些材料进行了翻译、摘要、重新排版或大幅编辑。阴性结果同样没有定论,因为该段文字可能太短、经过大量改写、与其他写作混合、由较旧的 Claude 模型生成,或通过不受支持的界面产生。
Anthropic 报告称,其内部测试发现对内容、创造力或可读性没有影响,但尚未发布底层的 Claude 评估。最接近的公开大规模证据来自 Google DeepMind 的 SynthID-Text 研究:该研究比较了近 2,000 万条带水印和不带水印的 Gemini 回复的反馈,报告用户评分没有统计显著差异。这一结果支持这一通用方法,但并不是对 Anthropic 未披露实施方案的独立测量。
这些限制使检测器不适合作为就业、教育、抄袭或纪律处分决定中的独立证据。即使 API 推出后,负责任的使用仍需考虑已发布的阈值、评估数据、段落长度、语言、编辑历史及其他溯源证据。
五、这一变更落实了一项法定标记要求
欧盟《人工智能法案》第 50 条于 2026 年 8 月 2 日开始适用。该条要求生成式 AI 系统提供者使用在技术可行范围内有效、可互操作、稳健且可靠的技术,以机器可读格式使合成音频、图像、视频和文本输出可被检测。
Anthropic 是签署《AI 生成内容透明度行为准则》的组织之一。该准则是自愿性的,但其基础的第 50 条义务具有法律约束力。欧盟委员会和 AI 委员会已认可该准则,将其作为签署方可以借此证明合规的框架。
提供者一方的标记要求不同于关于可见披露的规则。Anthropic 等提供者必须在适用系统中内置机器可读信号。部署者还面临额外义务:对深度伪造内容,以及为就公共利益事项告知公众而发布的某些 AI 生成或篡改文本进行标注,但人类审查和编辑责任等情形可适用例外。
对于将 Claude 嵌入其他产品的开发者,Anthropic 的模型层面水印可能提供所需溯源基础设施的一部分,但并不能解决开发者自身的合规义务。Anthropic 明确建议下游构建者评估第 50 条如何适用于其产品和服务。
常见问题
每一条 Claude 回复现在都已包含水印吗?
不是。该承诺涵盖于 2026 年 8 月 2 日或之后推出的受支持模型,而针对旧模型的标记功能仍在开发中。
复制 Claude 文本可以移除水印吗?
普通复制和粘贴应会保留水印,因为该模式编码在用词选择中。大量改写、翻译或与其他文本混合,可能削弱或移除可检测信号。
水印能证明 Claude 撰写了整份文档吗?
不能。它可以表明 Claude 很可能参与其中,但无法区分完整生成与大幅编辑、翻译或摘要。
水印会增加 Claude 的词元用量或价格吗?
Anthropic 表示不会产生额外词元,且该机制对生成速度的影响微乎其微,因此定价不会因水印而改变。
Claude 的水印检测器已向公众开放吗?
尚未开放。Anthropic 表示检测 API 和更多技术文档即将推出,但尚未公布上线日期或 Claude 专用错误率。
参考来源
Share