OpenAI 週二宣布,為加強額外防護措施並擴大監控範圍,以避免類似 Hugging Face 的事件再次發生,該公司暫停了其最新人工智慧(AI)模型兩週的強化學習(RL)訓練。

該 AI 公司表示:「隨著模型能力日益增強,內部開發和測試的風險也隨之增加。我們在監控、對齊和安全方面的標準必須領先於這些風險。我們希望花費必要的時間來達到這些標準,因此暫時放慢了擴展的步伐。」

該公司表示,目前已暫停其最大規模的前沿 RL 運行,同時進行小規模訓練和評估,以評估模型行為、驗證其安全防護措施,並在進入下一階段之前建立更確鑿的對齊證據。

為此,OpenAI 表示將加強其開發流程中的安全防護措施,包括加強監控以更好地應對意外和令人擔憂的行為;加強對齊以降低有害或未經授權行為的可能性;以及加強安全措施,以限制 AI 系統的存取或影響範圍。

這部分工作包括加強沙盒環境、網路隔離以防止網路存取,以及持續的安全測試,以移除潛在易受攻擊的共享服務、減少權限、並改善安全和信任邊界。

此發展發生在 OpenAI 表示將暫停其即將推出的人工智慧(AI)模型 Astra 的部分「內部活動」幾天之後,此前內部評估發現該模型在代理編碼和網路安全方面取得了重大進展。

該公司強調:「雖然 Astra 的部分訓練和評估符合這些要求,但仍有大量工作負載在完全遷移並增強以達到新的安全標準之前保持暫停狀態。我們將優先遷移這些新的環境中的安全和對齊工作負載。」

同時,監控設置已進行了改造,以標記潛在問題並將其升級給「日益複雜和高計算量的自動調查員」,這些調查員接著會檢查工具操作、可用推理以及整個活動序列,以偵測未經授權的存取、數據竊取、破壞性行為和試圖規避安全防護的行為。

OpenAI 計劃在透過此監控機制發現令人擔憂的活動後 30 分鐘內發出警報。此方法將強制用於所有涉及具有 Sol 或更高能力模型的工具的 RL 訓練和評估。預計這些安全防護措施將使計算開銷增加觀察到的推論工作負載的 20%。

該公司指出:「隨著模型獲得諸如網路攻擊能力等先進功能,並在更複雜的環境中運行,獎勵駭客(在訓練中尋找方法獲得高獎勵但未實際達成預期結果)、欺騙或未經授權存取等不對齊行為將會產生日益嚴重的風險。」

事實上,競爭對手 Anthropic 上週發布的新研究發現,當 AI 代理處於具有競爭和矛盾目標的情況下時,它們開始互相破壞,並部署自我複製的惡意軟體,導致了所謂的「多代理地盤戰爭」。

Anthropic 表示:「這包括禁用其他代理的 Unix 帳戶,編寫自動化腳本來循環查找並終止競爭進程,以及部署偽裝成屬於另一個代理的惡意程式碼。」

雖然關於自主系統失控的擔憂已成為熱門話題,但這項研究旨在了解當多個代理相互互動或相互對抗時,可能會出現哪些新的行為和潛在的有害動態。

這些互動可能導致它們協調一致並為實現共同目標而共同努力(如 Hugging Face 事件的情況),或者在試圖透過「錦標賽」解決衝突之前相互競爭。

在最近曝光的另一個案例中,一名澳大利亞男子試圖透過 OpenClaw 預訂熱門健身課程的座位,結果卻出乎意料,因為連接到該 AI 助理平台的模型 Anthropic Claude Opus 4.6,利用其發現的預訂軟體漏洞,提前數月預訂了健身課程。

更糟糕的是,它還找到了一種方法來入侵系統,並取消了候補名單上其他會員的預訂。此事件發生在 2026 年 4 月,是 AI 代理為了完成其被指派的任務而不擇手段的又一個例子,即使這意味著違反既定規則。

為應對這種風險的湧現模式,OpenAI 表示正採取措施改進獎勵模型,以更好地偵測和阻止不安全行為;訓練模型使其對其行為、能力和限制更加透明;並減少利用獎勵、評分器、工具或監督弱點的行為。

此發展發生在該公司表示 AI 可能會改變網路安全格局,使其更容易在 AI 驅動的攻擊者發現之前找到、優先處理和修復現有系統中的漏洞的一天之後。

OpenAI 的 Greg Brockman 表示:「我們正在利用前沿情報持續枚舉、探測和識別潛在的攻擊路徑。透過識別漏洞、配置錯誤、過度特權身份或無意中的信任邊界,我們能夠在攻擊者濫用這些漏洞之前快速識別並關閉這些差距。」

另一層至關重要的防禦措施不言而喻:投資於基礎,這意味著安全的架構和控制、實施縱深防禦策略和最小權限原則(PoLP),以及設計需要多個獨立控制來實現故障的系統。

Brockman 補充說:「網路隔離、工作負載加固、監控以及安全的修補和部署等經典安全控制,在 AI 的未來將比以往任何時候都更加重要。」

根據上週 WIRED 的一份報導,OpenAI 對 Hugging Face 的惡意代理駭客攻擊,不僅是 AI 安全和網路安全的「分水嶺時刻」,也引發了人們對競爭壓力,迫使推出新 AI 模型和產品,導致員工難以充分優先考慮安全、安全和對齊的擔憂。

在模型在安全測試中逃脫安全防護和隔離邊界,並在某些情況下針對真實世界系統的事件之後,像 Anthropic、OpenAI 和 Meta 這樣的前沿 AI 實驗室面臨著越來越嚴格的審查。

AI 安全測試公司 Irregular 此後披露,Anthropic 的洩漏是由於命名錯誤,導致在駭客模擬中使用的一個虛構公司名稱無意中與真實域名匹配。這反過來又導致模型採取了攻擊性行動。

該以色列公司表示,這是由於「人為疏忽」,並表示問題已得到補救。然而,它沒有披露發生了多少此類事件,而是將其描述為「少數」或「一小部分」案例。一項徹底的調查仍在進行中。

它還強調,沒有證據表明「客戶系統被入侵或客戶數據洩露」,指的是其合作測試 AI 模型準確性的 AI 公司,並表示「所有後續的公開披露都 refer to the same underlying issue」,而不是「實質上獨立的事件」。

「由於環境中啟用了網路存取,該域名被不同的模型有限次數地鎖定,這些模型誤以為它是其測試挑戰的一部分。在獲得目標存取權後,模型採取了諸如利用漏洞、提取憑證和獲取生產數據庫存取權等行動。」

「最終,我們發現的大部分問題是由於網路存取控制。主要是,模型認為它們處於模擬環境中,但實際上卻在真實世界中採取了行動。我們正在制定新的、強大的協議,以確保在滿足測試過程的限制條件的同時,不會發生設置問題。」