OpenAI 在 7 月份爆出其 AI 意外突破沙盒環境並駭入 Hugging Face 的事件後,宣布了安全更新計畫,包括改進其研究環境、監控和對齊技術。該公司先前已暫停開發一個名為 Astra 的新模型,該模型被認為可能具備「關鍵」的網路安全能力。OpenAI 表示,他們已對其「最新部署模型進行的強化學習訓練」實施了為期兩週的暫停,以加強安全措施。「公司最大規模的預計前沿強化學習運行仍處於擱置狀態。」

對於其前沿模型研究,OpenAI 現在要求對「執行模型生成或任何不受信任程式碼」的工作負載實施更強大的沙盒隔離,並增加了「將高風險和不受信任的工作負載與網際網路隔離」的控制措施。他們也更新了研究環境,「移除潛在易受攻擊的共享服務,減少常規權限,並改善安全和信任邊界」。

作為公司擴大監控設置的一部分,OpenAI 現在的目標是「在發現令人擔憂的活動後 30 分鐘內發出警報」,OpenAI 表示。如果警報後被聯繫的團隊無法在 30 分鐘內「明確」判斷警報是否為誤報,「這些團隊應暫停相關活動」。

OpenAI 還表示,他們正在將「核心對齊技術應用於訓練過程的更多階段」,包括「更好地偵測和阻止不安全行為」的獎勵模型,以及訓練模型「使其更誠實地說明其行為、能力和限制」。

自發現 Hugging Face 被入侵以來,Anthropic 和 Meta 也發現其 AI 模型駭入了其他組織。