OpenAI 在週二宣布了一系列新的安全政策,重點在於在模型測試期間遏制安全事件。新的安全措施包括在開發過程中對模型進行更詳細的監控,以及在訓練後過程更加強調對齊和安全性。

該公司在部落格文章中表示:「隨著模型能力越來越強,內部開發和測試它們所伴隨的風險也在增加。」「我們在監控、對齊和安全方面的標準必須領先於這些風險。」

這些新措施是自 7 月 21 日披露的 Hugging Face 事件的直接後果以來,OpenAI 安全實踐的首次公開變動。

OpenAI 代表表示,這些措施並非直接回應 Hugging Face 事件,但也部分是由於即將推出的 Astra 模型在網絡安全方面的能力,以及 AI 開發的整體進展速度所促成的。

在同一篇貼文中,OpenAI 透露在 Hugging Face 事件後暫停了兩週的強化學習(RL),但之後已重新啟動了許多風險較低的模型。

文章寫道:「我們最大規模的預計前沿 RL 運行仍處於擱置狀態,同時我們將進行小規模的訓練和評估,以評估模型行為、驗證我們的安全措施,並在繼續之前建立更多對齊的證據。」

OpenAI 研究副總裁 Amelia Glaese 在向記者發言時強調,隨著模型能力增強,控制的嚴格程度也會隨之增加,最大型的模型將面臨最嚴格的審查。

Glaese 告訴記者:「我們已經制定了安全開發的要求和期望。」「這些要求和期望會隨著我們看到的風險水平而變化。」

在該事件發生後,OpenAI 因其糟糕的網絡安全實踐而受到批評,該事件導致模型透過破壞其網絡上一個可聯網的工具而逃脫了訓練環境。新的安全措施包括更強的網絡隔離實踐,儘管具體細節仍然模糊。文章稱,在新系統下,「單一工作負載或支援服務的洩漏本身,不會允許未經授權訪問互聯網或其他內部網絡。」

最強大的安全措施是監控系統,該系統將檢查工具操作、可用的推理追蹤和活動日誌,以發現各種未經授權的行為。OpenAI 表示,其目標是在令人擔憂的活動發生後 30 分鐘內發出警報。

OpenAI 估計,該監控的計算負擔約為被監控進程的 20%。該公司承諾在即將發布的部落格文章中提供更多系統細節。該公司對該事件的官方事後分析也仍在進行中。