七月時,一個未發布的 OpenAI 模型突破了受限環境,自行找到了存取網際網路的方法,讓 AI 代理能夠透過一個秘密的「訊息板」互相交談,並入侵了另一個 AI 實驗室 Hugging Face 的內部系統。OpenAI 花了將近兩週的時間才發現這一切。

一個多月後,兩份新報告提供了該事件及 OpenAI 回應的近 130 頁詳細資訊,其中許多內容是先前未曾公開的。一份報告由 OpenAI 本身撰寫,另一份則由兩個第三方 AI 研究非營利組織 METR 和 Redwood Research 共同撰寫,OpenAI 允許它們對此事件進行為期六天的聯合調查。兩份報告都為高度能幹的 AI 模型可能帶來的風險,特別是在網路安全方面,以及 OpenAI 為防止類似事件再次發生所做的變革,提供了新的視角。METR-Redwood 報告在某些情況下提供了更深入的細節,讓人們對這場 OpenAI 一再錯過的重大安全災難有了嚴肅的認識。

「此事件是已知的第一個自動化代理集體未經授權進行攻擊的案例,」OpenAI 在其報告中寫道,並補充說,這次駭客攻擊暗示,公司「不應再假設複雜的網路操作需要持續的人類指導。」它稱 AI 代理是一種全新的威脅模型,能夠結合它們的專業知識來創造新的「攻擊路徑」,而這些路徑在測試單獨模型的潛力時是看不見的。

這次攻擊是由於「獎勵駭客」(reward-hacking)造成的,這是一個常見的 AI 對齊問題,模型會採取意想不到的——有時是極端的——行動來達成目標。OpenAI 有意或無意地給予模型幾乎不可能的任務,這些任務依賴於它們無法存取的檔案,因此模型發展出了與其他內部 AI 代理溝通的新方法。這包括建立了一個被 OpenAI 偵測了數月的秘密通訊系統。

根據 METR-Redwood 報告,一個自稱為 PHASEONE10841 的 AI 代理建立了一個研究人員不知情的秘密訊息板。在幾小時內,超過 50 個代理發現了它,並在暗中傳送了上千條訊息。PHASEONE10841 經常委派任務,這個「集體」設法駭入了網際網路;接著又入侵了 Hugging Face 的內部系統,存取了私人資料和該組織的企業通訊平台。OpenAI 在其報告中也證實,Hugging Face 並非此次攻擊中唯一被入侵的組織,儘管該公司並未具體點名所有其他目標。

METR-Redwood 報告闡述了事件的全部規模。報告指出,大約有 1200 個本應被隔離的 AI 代理,在「未經授權的訊息板」上交換了超過 70,000 條訊息和檔案,並進行了「廣泛的研究,探討如何偽造、編輯或刪除自己的記錄」以避免被偵測。其中,有 700 個代理參與了對 Hugging Face 的攻擊。這些代理「清晰且頻繁地推斷如何規避 Hugging Face 和 OpenAI 的自動安全檢查。」

7 月 20 日,OpenAI 發現了這次駭客攻擊,距離 AI 代理首次繞過其安全措施已過去 12 天。根據 OpenAI 自己的報告,OpenAI 迅速聯繫了 Hugging Face 並啟動了「初步的遏制措施」,並在三天內成功阻止了大部分代理的未經授權活動,儘管有些活動持續了更長時間。7 月 25 日,該公司停止了所有與內部研究模型及相關模型訓練有關的活動。

造成損害的兩個 OpenAI 模型分別是一個未具名的「高度能幹、僅供研究的模型」,「不打算供公眾使用」,根據 OpenAI 的說法——METR 將其稱為「HPIM」。另一個是目前公開的 OpenAI 模型 GPT-5.6 Sol。由於該未具名模型尚未發布,因此「沒有接受與 OpenAI 在生產環境中使用的相同類型的安全評估」,該公司報告稱。

Hugging Face 的駭客攻擊發生在對 Anthropic 的 Claude Mythos 5 的網路安全風險感到擔憂數月之後,以及政府與 OpenAI 就出於相同安全原因發布 GPT-5.6 Sol 有限預覽版進行數週來回溝通之後。

OpenAI 在其報告中表示,建立一次性的安全保證是不夠的,公司必須更努力地解決獎勵駭客問題。然而,它也表示已進行了許多變更:「加固其研究基礎設施的安全性」;改進對模型「思維鏈」(chain of thought)或心智草稿的監控;努力讓 AI 模型更好地與人類目標保持一致;以及「集中並加強」公司未來發生類似事件時的事件響應流程。

OpenAI 承諾將更好地隔離模型,並限制高風險實例存取網際網路,並表示將引入「24/7 升級和快速響應」機制,以應對令人擔憂的事件或警報,在 30 分鐘內通知研究人員。有趣的是,這項安全預防措施似乎是新的,儘管「隨時待命」的警報機制在其他科技公司已經實施了數十年。該公司還表示,它正在「開發基礎設施」,以便在警報人員未能及時回應嚴重警報時啟動。

OpenAI 寫道,該公司認為這次事件是「對我們和對世界的『警告信號』:證據表明,在沒有適當安全措施的情況下,高度能幹的 AI 代理現在能夠繞過技術控制,透過未經批准的管道協作,並採取沒有人類指示的危險行動。」