為因應歐洲聯盟的新法規,AI 平台正實施新的內容浮水印技術。Anthropic 近期透露,其未來的 Claude 模型將採用 Google 開源的 SynthID-Text 技術。此技術利用一個秘密金鑰,微妙地改變模型選擇句子下一個詞的過程。例如,原本可能選擇的詞是「陰天」,金鑰可能會將其改為「多雲」。任何知道金鑰的人都可以判斷該內容是否由使用該技術的平台生成。

新的研究顯示,SynthID-Text 不僅能改變詞語選擇,還能影響模型調用的工具,以及模型遵守或忽略其訓練時遵循的安全防護措施的機率。當模型面臨惡意提示時,威脅可能變得更大。惡意提示是指攻擊者試圖誘使模型執行有害操作,例如洩漏密碼或其他敏感資訊。在部署浮水印後,原本不會被遵循的指令,在某些情況下卻會被執行。這項發現強調了開發者必須徹底測試其大型語言模型(LLM)和代理程式在部署浮水印後的行為。

Lasso Security 的 AI 安全研究員 Andrea Siposova 表示:「與沒有浮水印的相同模型相比,浮水印肯定會改變其行為,尤其是在我們將其置於惡意條件下,或讓這些模型在為代理程式提供支援時調用工具。」「浮水印的設計初衷是讓讀者無法察覺,但我們知道,當我們改變模型生成內容的任何部分時,都會產生一些取捨,它會在某處顯現出來。」

浮水印的工作原理是嵌入一個信號,允許輸出被識別為 AI 生成內容,這被稱為來源驗證。SynthID 在正常的取樣過程中,加入了一個隨機種子產生器、取樣演算法和評分函數。取樣過程不再使用任意的隨機數產生器來選擇下一個詞,而是使用一個秘密金鑰。雖然詞語選擇仍然是隨機的,但了解金鑰的人可以檢查詞語序列,以判斷該金鑰被使用的可能性。

SynthID 的一個關鍵特性是所謂的「競賽式取樣」(tournament sampling)。類似於體育比賽,SynthID 會評估大量的下一個詞語代幣候選。它使用一個秘密金鑰為這些候選分配機率分數。一對代幣在一個回合中競爭,得分較高的代幣獲勝並進入下一輪。這個過程持續進行,直到確定最終獲勝的代幣。有關競賽式取樣的更多資訊,請參閱此處和此處。

Siposova 透過 Hugging Face 未經修改的 SynthIDTextWatermarkLogitsProcessor 測試了 SynthID-Text 的「非失真」配置。她將有害提示輸入六個開放權重模型,並比較了使用浮水印和未使用浮水印時的回應。實驗結果顯示,浮水印改變了對有害請求的回應,尤其是在使用提示注入技術時。

Siposova 寫道:「浮水印改變了對純粹有害請求的回絕行為,但當相同請求與提示注入技術配對時,效果更為明顯。」「在多個模型上,浮水印會使模型更有可能回應那些它原本會回絕的有害請求。」

這些改變具有重要的安全影響,因為它們不僅影響 LLM 的回應,還影響依賴該模型的 AI 代理程式的後續行動。

研究員寫道:「在模型層面,這可能會改變安全行為,包括模型是否回絕有害請求,以及在提示注入下該回絕是否有效。」「在代理程式層面,相同的取樣代幣可以決定調用哪個工具以及傳遞給它的參數。提示注入將這兩種設定聯繫起來,因為當模型還能透過工具行動時,削弱的回絕變得更具影響力。因此,這種浮水印程序可以影響模型所說的話以及代理程式所做的事。我們稱這種行為效應為取樣漂移。」

同樣有趣的是:模型回應的行為取決於使用了哪個秘密金鑰。

這項研究存在局限性。它沒有測試 Claude 模型在浮水印下的回應變化。相反,它測試了半打開放權重模型,因此研究人員可以存取在競賽式取樣期間啟用和禁用代幣取樣,同時保持其他設定不變。實驗還測試了 Hugging Face 的 SynthID-Text 競賽式取樣實作,而不是 Claude 模型將使用的特定實作。

儘管如此,結果表明,至少某些形式的浮水印方法可能會影響模型和代理程式的安全性。紅隊滲透測試工作對於壓力測試其平台,以確保在部署 SynthID 時它們能如預期般運作,將會非常重要。