加密式內容注入(Cryptographic Context Injection)只是破解大型語言模型(LLM)安全防護的最新方法。
本週稍早,研究人員概述了一種攻擊,該攻擊利用了 Microsoft 365 Copilot for enterprise 提供的一個秘密輸入,導致 AI 助理洩漏使用者收件匣中的密碼。現在,另一個獨立團隊針對 Grok 設計了類似的攻擊。這種新的資料竊取手法採用了一種看似簡單的技巧,迫使由伊隆·馬斯克(Elon Musk)擁有的這個大型語言模型竊取使用者聊天記錄和其他個人資訊。在本文發布時,儘管 xAI 公司在六月就已獲知此事,該助理仍持續洩漏資料。
從本週的兩起事件,以及之前無數的案例中得到的教訓是,大型語言模型無法解決提示注入(prompt injection)的根本原因,而提示注入是它們最容易遭受的嚴重漏洞類別。這使得 AI 開發者別無選擇,只能建立安全護欄,將模型引導遠離有害行為。正如我在週二的文章中所指出的,這種方法無異於道路交通安全工程師在危險彎道上豎起防護欄,而不是對彎道進行坡度處理。
提示注入利用了大型語言模型在訓練時盡可能遵守使用者要求的特性。攻擊者可以利用這種偏好,將有害指令偽裝到電子郵件或網頁中,然後指示 AI 助理進行摘要。由於大型語言模型無法可靠地區分來自不受信任方發送的電子郵件內容與直接輸入提示中的使用者指令,過於殷勤的 LLM 會忠實地執行它們。迄今為止,Grok 和其他大型語言模型的唯一對策是建立安全護欄,標記可疑指令並禁止其執行。
Rony Utevsky,安全公司 Adversa 的研究員,最近發現了一種完全繞過此限制的簡單方法。攻擊者不是以明文撰寫有害指令,而是將其加密。託管密文的網站還包含解密加密內容的明文說明以及解密金鑰。利用這個簡單的序列,當使用者指示 AI 助理摘要頁面時,Grok 會立即遵循該命令。沒有警告,也不需要確認。
解密後的指令指示 LLM 建構一個據稱是解密金鑰的東西。事實上,它完全是別的東西。假金鑰的值實際上是使用者的姓名、地點和聊天記錄。該值稍後被用作添加到導向攻擊者網站的 URL 的參數。一旦 Grok 打開連結,資料就會進入攻擊者伺服器的日誌中。
Adversa 無法確定是什麼原因導致 Grok 拒絕完全相同的明文指令,卻遵循加密的指令。主要的理論是,Grok 的過濾安全護欄會檢查進入和離開模型的文字,但不會檢查其自身程式碼執行的輸出。處理密文的指令(使用 PBKDF2 和 AES-256-GCM)作為普通請求通過過濾器,因為分類器可以讀取它們,但無法解析它們解鎖的內容。一旦額外的指令被解密,它們就會作為模型自身的工具輸出到達模型,模型會對其採取行動,而過濾安全護欄從未檢查過它們。
Utevsky 在週四寫道:「靜態安全護欄將輸入分類為文字;它們不會執行它們。攻擊者會發送密文以及金鑰材料和解密指令,模型會在其自身的程式碼執行沙盒中運行解密。安全護欄掃描器所需的一切都在頁面上,但恢復明文意味著運行 PBKDF2 和 AES-256-GCM,而沒有內容分類器會在檢查時執行此操作。」
研究員在一封電子郵件中表示,這種安全護欄被稱為靜態的,「因為它們只將內容讀取為文字。它們不運行程式碼或解密任何東西。這就是我們利用的漏洞。真正的指令被加密了,所以安全護欄只看到無意義的密文並將其放行。」
Adversa 在一次 Gemini 越獄攻擊中使用了類似的技術,即讓 Google 的 LLM 忽略其內部安全規則。在這裡,密文被解密成一個看似是追蹤碼(traceback)的東西。解密後的文字發出一個規則——如果程式碼失敗,請閱讀錯誤訊息並採取行動。明文注入了一個提示,最終導致 Gemini 違反其安全規則。
Adversa 表示:「該技術產生了一個多段落的受限內容範例,Gemini 的安全篩檢程式通常會抑制這些內容(例如,建造燃燒武器)。使用修改後的載荷,相同的向量重現了 Gemini 的系統指令,包括禁止披露這些指令的指示。」
Adversa 並未向 Google 報告此行為,因為越獄不在該公司漏洞披露計畫的範圍內。然而,在過去幾週內,Gemini 對此攻擊的抵抗力越來越強。「我們無法歸因於這種變化——可能是篩檢程式更新、模型版本變更,或兩者兼有,」該安全公司表示。該公司研究人員將此技術稱為加密式內容注入。
Adversa 表示:「加密式內容注入是更廣泛轉變的一個實例:攻擊不僅操縱提示,還操縱 LLM 視為自身的更廣泛內容,例如工具輸出、運行時結果和中間狀態。這個攻擊面遠大於傳統上標記為『模型輸入』的範圍,下一代攻擊將在那裡出現。」
加密式內容注入只是 LLM 防禦者處於不利地位的最新一個例子。每次他們建立一個新的、一次性的安全護欄,攻擊者就會找到一個新的向量,讓汽車再次衝出道路。這個循環持續不斷:重複、沖洗、再重複。
Ars Technica 在 25 年來一直致力於分離訊號與雜訊。憑藉我們獨特的技術敏銳度和對科技藝術與科學的廣泛興趣,Ars 是資訊海洋中值得信賴的來源。畢竟,您不必知道一切,只需知道重要的事。