開發人工智慧模型 Claude 的公司 Anthropic 已宣布,從 8 月 2 日起發布的任何模型所產生的文字,都將嵌入隱形浮水印,表明該輸出是由 AI 編寫。同時,Claude 產生的圖像在大多數情況下將附帶元數據,其中包含數位簽章,以顯示該檔案是由模型處理的。
基於文字的浮水印使用演算法來調整 AI 模型選擇措辭的方式。當應用於一段文字時,此過程會在輸出中留下統計上可觀察的痕跡。總部位於加州舊金山的 Anthropic 表示,其浮水印不會改變「Claude 回應的意義、品質或可讀性」,並且「可能會在某些編輯後仍然存在」。
此舉是為了回應於 2024 年正式通過的歐盟 AI 法案。從今年 8 月 2 日起,前沿 AI 模型的提供者必須確保 AI 生成的輸出是可偵測的,否則將面臨高達 1500 萬歐元(約合 1700 萬美元)或全球年營業額 3% 的罰款。8 月 2 日之後發布的模型必須立即符合要求,而市場上已有的版本則有時間到 12 月 2 日為止。Anthropic 表示,浮水印將應用於 Claude 的全球輸出。
浮水印的存在對模型的用途了解甚少。Anthropic 表示,偵測到浮水印「提供了一個信號」,表明內容是由 Claude 製作的,但並非決定性的:例如,該模型可能僅用於總結或翻譯原始人類想法。同樣,缺乏浮水印並不意味著該文字不是由 AI 生成的。由於浮水印基於模型詞彙選擇的細微變化的模式,因此非常短的段落,或經過改寫或重寫的段落,可能不再帶有信號。
『人性化』工具可以消除 AI 編寫文字的痕跡 — 引起科學家們的擔憂
此類浮水印對學術誠信的影響仍不明朗。西北大學(伊利諾斯州埃文斯頓)的計量科學家 Reese Richardson 表示,鑑於浮水印很容易從文字中刪除 — 例如,使用另一個模型 — 它們不太可能阻止有心人士使用 AI 產生論文,即所謂的「AI 廢文」。
但卡內基梅隆大學(賓夕法尼亞州匹茲堡)研究科學評估的電腦科學家 Nihar Shah 表示,如果 AI 公司創建允許他人檢查浮水印的工具 — 正如 Anthropic 所說的 — 並且這些工具的誤報率可接受地低,那麼一些不當的 AI 使用可能會被偵測到。
例如,浮水印可以幫助期刊編輯或會議組織者在同行評審中執行嚴格的「禁止 AI」政策,就像國際機器學習會議 (ICML) 2026 在其兩個可能的審查流程之一中所做的那樣。該七月活動的組織者在分發給同行評審的論文中添加了浮水印,當在審查報告中使用 AI 時會產生可疑的文字。他們抓獲了 506 名違反「禁止 AI」政策的審稿人。ICML 浮水印流程的發起人 Shah 表示:「這次經歷表明,雖然一些不當的 AI 使用可能會被小心地規避偵測,但許多其他情況可能只是簡單地複製貼上 AI 的輸出。」