📰 重點摘要
Anthropic 於週五發布部落格文章,詳細說明其Claude聊天機器人生成文字的浮水印機制,以回應近期Reddit及X平台上用戶的爭議討論。這項浮水印措施是為了符合歐盟AI Act《透明度準則》要求,即AI公司須採用可識別AI生成內容的系統。Anthropic表示,Claude在做「低風險選擇」時(例如描述天氣用「overcast」還是「grey」),會在回應中建立特定模式,這種模式「對讀者不可見,但對持有解碼金鑰的人可被偵測」,且浮水印不會影響輸出品質,讀者無法分辨有無浮水印的差異。
技術上,Anthropic將採用Google DeepMind團隊2024年提出的SynthID-Text方法,並計畫釋出浮水印偵測API。公司強調此機制與Pangram等公司的AI偵測方式(尋找「this isn’t X, it’s Y」之類的寫作痕跡)本質不同,浮水印偵測是核對加密模式,而非分析文字風格特徵。
關於是否能靠編輯移除浮水印,Anthropic坦承輕度編輯很可能無法完全移除,但若逐字全部改寫則會清除浮水印——不過屆時該文字是否仍算「AI生成」也值得商榷。若Claude僅做校對或輕度潤飾,由於大部分文字仍出自人類作者,浮水印能附著的內容很少。至於程式碼,因為模型須產出可運作的程式碼、選字彈性較低,浮水印痕跡會比一般文字少,但在程式碼中的註解等有任意用詞選擇空間之處仍可能帶有浮水印,只是強度極低。詳細內容請見原文連結。
💬 JudyAI Lab 觀點
Anthropic本週說明瞭Claude聊天機器人生成文字時採用的浮水印機制,回應Reddit與X平臺上使用者近期的討論。此舉是為符合歐盟AI Act透明度準則,要求AI公司建立可辨識AI生成內容的系統,也讓浮水印從抽象概念變成具體上線的功能。
這反映出AI產業正從「事後偵測」轉向「內建可追溯性」的設計思維。Anthropic採用DeepMind提出的SynthID-Text方法,在生成低風險用字選擇時嵌入不影響閱讀品質的模式,並計畫釋出偵測API,讓浮水印驗證走向加密核對而非文字風格分析。但技術也坦承侷限:輕度編輯難以移除浮水印,逐字改寫則會清除,而程式碼因用詞彈性低,浮水印痕跡本來就更少。這說明「可驗證AI生成」與「內容可被自由編修」之間存在根本張力,任何浮水印方案都只能是機率性防線,而非絕對答案。
對AI builder來說,若產品涉及內容真實性驗證,值得先了解浮水印能覆蓋與不能覆蓋的邊界,再決定要不要依賴它。
📅 原文資訊
- 發布時間:2026-08-15T18:58
- 來源原文:https://techcrunch.com/2026/08/15/anthropic-shares-more-details-about-how-claudes-new-watermarks-will-work/