當 Claude 在生成一句話時,常常會面對數個看似都合理的下一個詞彙候選——例如在“The weather today was cold and...”之後,它可以選擇“overcast”或“grey”。正常情況下,這個選擇是由亂數產生器隨機決定的。在加上浮水印後,這個隨機性會被一個由密鑰結合前幾個字詞所產生的模式取代,進而在 Claude 選擇的近似詞之間,創造出一個可重現但肉眼無法察覺的統計模式
。
浮水印的關鍵特性:
這項主張有 Google DeepMind 的 SynthID-Text 研究做為後盾。該研究在 Google Gemini 的即時流量上進行了 A/B 測試,結果顯示用戶的「讚」與「倒讚」比例與未添加浮水印的模型相比,沒有任何統計上的顯著差異;此外,一項受控的人工評比研究也同樣發現用戶並未察覺到品質有異 。添加浮水印不需要額外成本,也不會在文字生成過程中消耗額外的 Token
。
答案是可以,但移除的難易度取決於編輯的程度:
這項浮水印技術在處理程式碼時,運作方式會有所不同,因為程式碼中較少出現需要取捨的同義詞情境 。Anthropic 解釋,當模型需要輸出精確的結果時——例如“Isaac Newton's most famous work was called Principia Mathematica”——在這種情況下只有一個正確答案,浮水印機制便無從著力
。
同樣的邏輯也適用於程式碼:特定的函式呼叫、語法上必要的關鍵字,以及精確的套件名稱,都不會帶有浮水印訊號。浮水印只會出現在那些存在多種有效 Token 可選擇的位置,例如變數命名、註解措辭或程式結構的細微之處 。
Anthropic 已於 2026 年 8 月 12 日證實,正在開發一個可公開呼叫的文字偵測 API,讓第三方開發者能據此檢查一段文字是否由 Claude 產生 。該 API 將使用密鑰來比對文字中的詞彙選擇模式,是否符合 Claude 的生成習慣。截至 2026 年 8 月 15 日,官方尚未公布具體的推出時間
。
Anthropic 強調,他們的浮水印技術與基於風格分析的 AI 偵測器(例如 Pangram)不同——後者是透過尋找特定的措辭模式來判斷——因為檢查浮水印,從根本上與尋找文字風格「破綻」是兩回事 。
對於新增浮水印的反應出現了兩極化的討論:
答案是肯定的。Anthropic 明確表示:「其他主要的模型開發商也已簽署了同樣的實務準則,並將逐步推行各自的浮水印技術」。Anthropic Claude Code 團隊的一名工程師公開發文表示:「這是為了配合歐盟《人工智慧法案》的一部分,其他實驗室也在加入類似的浮水印機制。要識別 AI 生成的文字很困難,而這是一個被提出的解決方案」
。
歐盟《人工智慧法案》第 50(2) 條的實務準則已於 2026 年 8 月 2 日生效,並適用於所有服務歐盟市場的生成式 AI 供應商 。多家主要 AI 公司都已經簽署了相同的準則,不過各家的具體上線時程會有所不同
。