OpenAI、Anthropic 和 Google 的 API 在處理隱藏 AI 推理過程的方式上新近披露了一項漏洞,研究人員得以從會話日誌中恢復內部推理和機密資訊,包括 API 金鑰和密碼。
此弱點影響了供應商推理 API 所使用的加密推理物件,在一個會話中創建的區塊可以在另一個會話中重播,甚至在測試期間,可以將其交給同一供應商家族中較弱的模型,使其洩露隱藏的內容。
該論文的團隊「竊取專有大型語言模型 API 的推理軌跡」展示了四種濫用途徑:竊取專有推理用於模型蒸餾、從其他用戶發布的軌跡中提取私人數據、恢復隱藏在安全可見答案後的有害內容,以及將提示注入隱藏在不透明推理區塊中。
在 6,708 個公開的代理軌跡中,該團隊解碼了 315,320 個思考區塊。排除基準來源後,他們統計了來自真實用戶會話的 704 個獨立隱私偽影,其中包括 62 個 API 金鑰、33 個密碼、24 個存取權杖和 7 個私鑰。
跨用戶攻擊並未提供任意存取私人對話的權限。它需要取得一個加密的推理區塊,例如發布在代理日誌中的區塊,以及對同一供應商的相容模型進行 API 存取。
研究人員已將發現結果披露給受影響的模型供應商 Microsoft 和 Hugging Face,並表示所展示的攻擊在進行緩解措施後已停止運作。他們的再現性聲明指出,截至 2026 年 8 月,主要的提取攻擊已不再可重現。
該報告並未記錄野外惡意利用的情況。建議開發人員從共享的軌跡中移除推理區塊和不透明的推理欄位,並避免提交原始 API 記錄,即使可見文字已被清理。
問題始於一種設計,旨在當對話狀態被手動或無狀態管理時,在 API 呼叫之間保留推理過程。OpenAI 可以返回加密的推理項目,應用程式會與手動管理的歷史記錄一起重播;Anthropic 在加密簽名中攜帶完整的推理過程;Google 使用加密的思考簽名。這些物件保留了推理狀態,而不會直接向客戶暴露底層明文。
加密本身並未被破解,攻擊也不需要取得加密金鑰。它依賴於供應商接受並處理完整的、不透明的區塊。
在測試期間,該論文發現這些物件在不同會話、用戶和模型之間是可移植的,允許一個較弱的相容模型充當作者所稱的「模糊」解碼器:「Claude Haiku 4.5」用於 Claude 軌跡、「GPT-5.6 Luna」用於 GPT 軌跡,以及「Gemini Robotics ER-1.6」用於 Gemini 軌跡。解碼器被提示轉錄由較強模型產生的推理過程。
這種跨用戶行為將發布的代理日誌變成了一個更嚴重的安全問題。在團隊恢復的 704 個非基準偽影中,有 64 個僅出現在隱藏的推理中,而未出現在可見軌跡中。因此,清理可讀對話可能會在不透明區塊中留下秘密,而其他帳戶能夠重播這些秘密。
該研究展示的暴露範圍是有限的:它影響到那些發布了包含完整推理物件的原始代理日誌的開發人員,這是一個可識別的群體,而不是每個 API 用戶,並且不一定是唯一面臨風險的群體。
同樣的可移植性也實現了一個隱形的提示注入概念驗證。該團隊創建了一個不透明的推理區塊,其中包含惡意指令,然後將其重播到一個不相關的任務中,導致接收模型添加了一個攻擊者導向的上傳操作,而沒有將注入的指令放在可見文字中。
作者警告說,他們沒有專有推理的真實明文,因此無法保證每個重建的軌跡都是精確的副本。他們的保真度檢查依賴於推理代幣計數和定性比較,提取的長度通常與供應商報告的思考代幣計數一致。
當前的供應商文件顯示,加密推理仍然是這些 API 的一部分,但處理方式已有所改變。OpenAI 仍然告訴開發人員在手動管理無狀態歷史記錄時重播加密推理項目,而 Google 表示當會話切換模型時,其後端會管理思考的相容性。
Anthropic 現在表示,思考區塊與產生它們的模型相關聯,並且在切換模型時應將其移除,因為其他模型會忽略它們。
此披露引發的幾個問題,在公開記錄中仍未得到解答。迄今為止,尚未從這三家供應商中任何一家公開承認此漏洞,也沒有任何一家將其當前文件與此研究聯繫起來,因此,聲稱所展示的攻擊不再奏效,是基於研究人員自己的再現性聲明,而不是供應商的確認。
相同的記錄顯示,該團隊已經解碼了數十萬個已經存在於公共儲存庫中的推理區塊,但它並未解決這些已經發布的區塊是否仍然可以被解碼的問題,這與新鮮的攻擊是否仍然成功是兩個獨立的問題。
這項工作建立在 Johns Hopkins 密碼學家 Matthew Green 的五月研究之上,該研究表明加密推理區塊可以在不同會話和帳戶之間重播,但未能實現可靠的秘密提取技術。
Green 表示,他通過漏洞賞金計劃向 OpenAI 和 Anthropic 報告了重播行為;根據他的說法,OpenAI 認為該報告無法重現,而 Anthropic 則表示他們沒有看到重播或側通道行為中的安全隱患。
新的論文將這種重播行為轉變為一種更廣泛的提取方法,並大規模記錄了隱私後果。