AI News字數 3149閱讀時長8 分鐘

未來 Claude 模型將按歐盟《AI 法案》規則在全球為文字加上浮水印

Anthropic 將在未來的 Claude 模型中加入以 SynthID 為基礎的文字浮水印,並為檔案加入 C2PA 憑證。

Anthropic 將在未來的 Claude 模型中建立可由機器讀取的來源訊號,為生成文字加入統計式浮水印,並為支援的檔案加入經簽署的 C2PA 中繼資料。雖然這項改動旨在遵守歐盟《AI 法案》,Anthropic 計劃在全球套用文字浮水印,而非只限於歐洲用戶。

該政策涵蓋於 2026 年 8 月 2 日或之後在歐盟推出的 Claude 模型。這些模型將從推出時起支援標記;Anthropic 表示,正致力在未來數月將系統擴展至該日期前發布的模型。公司尚未指明哪個新的 Claude 模型會首先實施。

浮水印不會以標籤、隱藏 Unicode 字元或回應中的額外一行呈現。相反,它會改變 Claude 在生成時選擇 token 的統計過程。Anthropic 表示,這應不會改變含義、可讀性、延遲或定價,但公司尚未發布其 Claude 專用偵測器、閾值、誤報率或完整技術評估。

一、標記將涵蓋 Claude 產品及雲端存取

Anthropic 表示,支援的模型將會在 Claude 消費者服務、Claude Platform API、Claude Code、Claude Cowork 及 Claude Tag 中套用文字浮水印。當這些模型經 AWS、Google Cloud 或 Microsoft Foundry 存取時,浮水印亦會套用。

這種模型層級的實施方式相當重要,因為標記並不依賴特定使用者介面。使用支援模型時,透過 API 呼叫模型的開發者,以及直接使用 Claude 的人士,都應會收到經同一浮水印程序生成的文字。

推出範圍遍及全球。Anthropic 表示,目前尚未有持久的方法按地區限制該機制,因此支援的模型會在 Claude 提供服務的任何地方標記文字。這令歐盟的合規要求同時成為歐盟以外 Claude 用戶及開發者的產品改動。

這個廣泛範圍亦有一些限制。經簽署的檔案中繼資料未必可於每個雲端平台、產品功能或檔案類型使用。現有 Claude 模型亦可能在 Anthropic 更新前仍未有標記。因此,偵測不到標記,並不能證明某段文字並非由 Claude 生成。

Anthropic 表示,浮水印不會載有關於生成文字的用戶、機構、帳戶或對話的任何資訊。它識別的是與 Claude 生成程序相關的統計模式,而非個別來源。該機制亦不會產生額外輸出 token,因此 Anthropic 表示不會增加使用費用。

二、Claude 將採用 SynthID-Text 的一個版本

Claude 的文字浮水印以 SynthID-Text 為基礎;這是 Google DeepMind 在 2024 年一篇 Nature 論文中描述,並其後向其他模型開發者提供的方法。

語言模型通常會根據前文的條件機率分佈,選擇每一個下一個 token。許多段落中存在多個同樣合適的選擇。浮水印系統可利用這些選擇建立重複出現的統計模式,而無須插入可見符號或獨立的中繼資料欄位。

Anthropic 描述其實施方式為:使用私鑰及前面的詞語,決定供合資格選擇使用的隨機來源。可存取相關金鑰的偵測器可檢查一段文字,並為其序列與 Claude 加上浮水印的生成程序的吻合程度評分。

Google 的參考實作將 SynthID-Text 描述為在 top-k 及 top-p 篩選後套用的 logits 處理器。偽隨機函數會為模型詞彙表分配分數,而浮水印設定會影響 token 選擇。毋須額外訓練模型,但金鑰及設定必須保持私密;否則第三方可重現該訊號。

因此,浮水印是生成措辭的一部分,通常能在複製及貼上後保留下來。輕微編輯或摘錄可能仍保留足夠模式而可被偵測。徹底改寫、翻譯,或與其他文字混合,則可能降低偵測器的信心或移除可用訊號。

浮水印密度亦取決於任務。開放式文章提供許多無關緊要的措辭選擇,而事實性答案則包含更多 token,其中一個補全結果明顯比其他選擇更準確。Anthropic 表示,若浮水印推動可能損害正確性,便會避免套用。

同一限制亦影響原始碼。精確語法、識別碼及程式行為限制可互換的 token 選擇數量,因此程式碼的可偵測浮水印可能少於文章。註解或其他任意措辭仍可攜帶該模式。校對同樣可能留下很少訊號,因為 Claude 保留了大部分人類原有措辭;相反,翻譯較可能帶有浮水印,因為 Claude 會選擇譯文中的每一個詞語。

三、檔案將使用 C2PA 中繼資料,而非文字技術

對於 SVG、PNG 及 JPEG 輸出等支援檔案,Anthropic 將按照 Content Provenance and Authenticity Coalition 標準,附加一份小型、以密碼學簽署的來源記錄。

C2PA 憑證會記錄檔案的來源及處理歷史。相容的驗證工具可檢查已簽署的記錄,並判斷檔案是否曾以破壞其與該記錄之間密碼學關係的方式被更改。

此機制與 Claude 的文字浮水印不同。C2PA 資訊位於檔案的中繼資料中,而非以統計方式編碼至像素或措辭內。它的存在可表明 Claude 生成或處理過檔案,但不能證明 Claude 創作了其中每一項元素。

中繼資料亦比文字層面的統計模式更容易遺失。Anthropic 警告,格式轉換、重新儲存、截圖或其他處理都可能移除檔案憑證。有些平台可能本來便不會保留或支援該中繼資料。

因此,缺少憑證並不能證明 Claude 在檔案中沒有任何角色。反過來,有效憑證亦只證實已記錄的處理事件;它並非判斷內容是否準確、在更廣泛的編輯意義上是否真實,或主要由人類創作。

四、偵測仍具機率性,而 Claude API 尚未提供

Anthropic 表示將提供浮水印偵測 API,但截至 8 月 27 日,尚未發布該 API、其推出日期、判定閾值或詳細的 Claude 專用效能結果。其說明文件表示,更多技術指引即將公布。

這些缺漏資訊令外界無法精確評估 Claude 的誤報機率。SynthID-Text 偵測本質上具機率性,Google 的公開實作可傳回「watermarked」、「not watermarked」或「uncertain」。操作人員可設定閾值,以權衡誤報與漏報。

Anthropic 的偵測器將回答一個有限問題:Claude 參與生成所提交文字至少一部分的可能性有多高。它不會證明 Claude 撰寫了整份文件、區分生成與大幅編輯、識別用戶,或偵測由採用不同浮水印金鑰的無關模型所生成的文字。

陽性結果可能涵蓋其底層概念或原有措辭來自人類的材料。Claude 可能翻譯、摘要、重新格式化或大幅編輯過該材料。陰性結果同樣並非定論,因為該段落可能太短、被大幅改寫、與其他寫作混合、由較舊的 Claude 模型生成,或經不受支援的介面產生。

Anthropic 報告其內部測試發現,對內容、創意或可讀性沒有影響,但尚未公布底層的 Claude 評估。最接近的公開大規模證據來自 Google DeepMind 的 SynthID-Text 研究;該研究比較了近 2,000 萬個加上及未加上浮水印的 Gemini 回應之回饋,並報告用戶評分沒有統計顯著差異。這個結果支持一般方法,但並非對 Anthropic 未公開實作的獨立測量。

這些限制令偵測器不適合作為招聘、教育、抄襲或紀律處分決定的獨立證據。即使 API 推出後,負責任地使用仍須考慮已公布的閾值、評估數據、段落長度、語言、編輯歷史及其他來源證據。

五、這項改動落實法定標記要求

歐盟《AI 法案》第 50 條已於 2026 年 8 月 2 日開始適用。該條要求生成式 AI 系統供應商,以在技術可行範圍內有效、可互通、穩健及可靠的技術,使合成音訊、圖像、影片及文字輸出可由機器讀取的格式偵測。

Anthropic 是簽署《歐盟 AI 生成內容透明度實務守則》的機構之一。該守則屬自願性質,但第 50 條的相關義務具法律約束力。歐盟委員會及 AI Board 已認可該守則為一個框架,讓簽署方可藉此展示合規。

供應商一方的標記要求,與規管可見披露的規則分開。Anthropic 等供應商必須在適用系統中建立可由機器讀取的訊號。部署者則須履行額外義務,為深偽內容及為向公眾提供公共利益事項資訊而發布的某些 AI 生成或操控文字加上標籤,但受包括人類審閱及編輯責任在內的例外情況規限。

對於把 Claude 嵌入其他產品的開發者,Anthropic 的模型層級浮水印可能提供部分所需的來源基礎設施,但並不決定開發者自身的合規義務。Anthropic 明確建議下游建構者評估第 50 條如何適用於其產品及服務。

常見問題

每個 Claude 回應現在都已包含浮水印嗎?

不是。這項承諾涵蓋在 2026 年 8 月 2 日或之後推出的支援模型,而較舊模型的標記功能仍在開發中。

複製 Claude 文字可移除浮水印嗎?

一般複製及貼上應會保留浮水印,因為模式已編碼於用詞選擇中。大幅改寫、翻譯或與其他文字混合,可能削弱或移除可偵測訊號。

浮水印可證明 Claude 撰寫了整份文件嗎?

不可以。它可顯示 Claude 很可能曾參與其中,但不能區分完整生成與大幅編輯、翻譯或摘要。

浮水印會增加 Claude 的 token 使用量或價格嗎?

Anthropic 表示不會產生額外 token,而且該機制對生成速度的影響微乎其微,因此定價不會因浮水印而改變。

Claude 的浮水印偵測器已公開提供嗎?

尚未。Anthropic 表示偵測 API 及額外技術文件即將推出,但尚未發布推出日期或 Claude 專用錯誤率。

參考來源

Share

分享這篇文章