Anthropic 在週五發布了一篇部落格文章,試圖回答一些關於其聊天機器人 Claude 生成文本的浮水印技術的基本問題。例如:浮水印實際如何運作?是否能透過編輯來隱藏?以及這對程式碼有何影響?

自本週稍早公司透露將實施浮水印以遵守歐盟 AI 法案的透明度準則(要求 AI 公司使用能識別 AI 生成內容的系統)以來,Claude 的用戶一直在爭論此舉。

Anthropic 的新文章首先概述了浮水印的概念,解釋說當做出「低風險的選擇」時——例如在描述天氣時,在「陰天」和「灰色」這兩個詞之間做選擇——Claude 可以在其回應中創建一個「讀者無法察覺,但擁有解碼金鑰的任何人都可以偵測到」的模式。

該公司表示:「浮水印不會影響 Claude 輸出的品質。」「對讀者而言,帶有浮水印的回應與未帶浮水印的回應沒有區別。」

更具體地說,Anthropic 表示將採用 Google DeepMind 團隊在 2024 年概述的 SynthID-Text 方法,並計畫發布一個浮水印偵測 API。他們也指出,浮水印與 Pangram 等公司提供的 AI 偵測方法不同,後者會尋找寫作中的「線索」(例如「他的不是 [X],而是 [Y]」的結構)來揭示 AI 使用情況:「捕捉這些模式與檢查浮水印在根本上是不同的。」

是否有人可以透過重寫文本來隱藏浮水印?Anthropic 表示這是可能的,但「輕度編輯可能無法完全移除浮水印」,而「完全重寫,將每個字都替換掉,則可以。」

該公司說:「在後者情況下,當然,可以爭辯文本是否還能被描述為 AI 生成的。」

至於浮水印是否會出現在僅由 Claude 校對或編輯過的文本中,Anthropic 表示這將取決於「文本的長度以及 Claude 的編輯程度」。如果只是輕度編輯,「幾乎所有的字」都是由人類作者寫的,而「浮水印能附著的很少(如果有的話)。」

同時,程式碼的浮水印應該比其他文本少,因為模型需要創建可運行的程式碼,而沒有自由在多個同樣有效的選項之間進行選擇。

Anthropic 表示:「話雖如此,在程式碼中有特定詞語或術語的任意選擇的區域,可以使用浮水印,例如程式碼中的註解。」「但根據定義,它對實際產生的程式碼的影響微乎其微。」

Anthropic 還表示,Claude 不會是唯一生成帶有浮水印文本的 AI 聊天機器人,因為「其他主要的模型開發者也簽署了相同的行為準則,並將實施自己的浮水印。」