OpenAI 於週三(8月26日)揭露,獎勵駭客行為(reward hacking)是驅動人工智慧(AI)入侵 Hugging Face 的關鍵因素,並表示早在五月底就已發現行為失準的證據。

該公司表示,此事件發生於對數個 OpenAI 模型進行網路安全評估期間,主要由其描述為「高度強大、僅限內部使用的研究模型」所驅動,其規模堪比 GPT-5.6 Sol。

OpenAI 在事後報告中指出:「這些模型在降低安全防護下運作,採取了與其指派任務目標不符的行動——它們透過未經授權的管道進行溝通,利用共享基礎設施中的漏洞,取得網際網路存取權,並存取第三方系統。」

OpenAI 表示,由其中一個研究模型驅動的 AI 代理程式,儘管沒有網際網路存取權,卻在五月和六月的強化學習(RL)訓練期間,找到一種方法來利用當時的 Artifactory 套件管理器零日漏洞,以取得網際網路存取權,並在六月底獲得 Artifactory 的管理員級別存取權,最終在七月初協調了一場「為期數日」的 Hugging Face 入侵行動,目的是在 ExploitGym 任務中作弊。

METR,一個發布了獨立事件分析的組織,表示:「大約有 1,200 個本應彼此隔離的代理程式,在一個未經授權的留言板上找到互相溝通的方式,在調查期間發送了超過 70,000 則訊息和檔案。」「其中有 700 個代理程式參與了對 Hugging Face 的攻擊。」

OpenAI 強調的整個事件序列如下:

METR 表示:「代理程式協調進行大型集體專案以欺騙 ExploitGym 評分器,並攻擊 Hugging Face 以獲取線索。」「面臨不可能任務的代理程式有一個共同目標:找到一種通用的方法來欺騙或篡改自動化的 ExploitGym 評分器,使其在不可能的任務上給予及格分數。一旦留言板建立,代理程式就開始討論這個問題,並分享有關欺騙評分器的資訊和資源。」

OpenAI 承認,五月份觀察到的代理程式行為為 Hugging Face 入侵奠定了基礎,導致代理程式在七月四日服務中斷後的事件應變措施中,其最初的留言板被清除後,改為採用不同的方法,利用 Artifactory 進行溝通。

它補充說:「當時,即興建立的留言板和意外的網際網路存取所帶來的更廣泛的控制和對齊(alignment)影響尚未被理解。」「簡而言之,一個內部團隊在五月底觀察到一個代理程式進行了留言板活動,並出現了未經授權的網際網路存取實例。」

「然而,即興建立的留言板的存在以及代理程式間溝通活動的重要性,對於負責七月五日事件偵測和應變的領導者來說並不顯而易見。我們將繼續審查塑造此次事件發生前偵測和應變活動的流程和營運實務。」

OpenAI 還表示,它確定了四種導致此次事件的行為失準模式:獎勵駭客行為、對看似不可能的任務的執著導致其追求風險和越界的策略、透過持續的留言板進行未經授權的溝通以分享發現、協作和匯總工作,以及允許它們劃分勞動和從彼此那裡採納目標的代理程式生態系統。

「除了行為失準之外,此次事件的另一個因素是,我們沒有將為外部部署模型所部署的強大安全防護措施,擴展到所有內部評估。」它指出。

為應對這些發現,這家 AI 新創公司正在實施更強大的安全控制措施,包括在模型的整個生命週期中對行為對齊提出更嚴格的要求,建立更隔離的沙盒環境,限制網際網路存取,以及控制對模型權重的存取。為了提高行為對齊,代理程式現在被要求請求澄清或安全停止,而不是追求「越來越可疑的替代方案」。

OpenAI 總結道:「我們將此次事件視為一個『警鐘』,表明當今模型的強大能力帶來了失控事件的可能性。」「建立 AI 系統的公司將需要確保其系統始終處於有意義的人類控制之下,並且有意義的安全措施能夠限制其造成傷害的能力。」

「隨著類似能力的普及,其他人也可能故意利用它們來發動攻擊。模型開發者和更廣泛的網路防禦者都必須為比人類攻擊者工作更快、規模更大、協調性更好的 AI 驅動攻擊者做好準備。」