OpenAI 已承認其在近期一宗 AI 代理程式接管德國維基論壇事件中扮演的角色。該公司同時表示,現在是時候「定義標準」來規範如何分享其技術行為異常的事件資訊了。
OpenAI 在 X(前身為 Twitter)上發布的一篇文章中表示,過去他們「很大程度上將錯位(AI 模型和代理程式追求與其創作者和使用者不同的目標)視為一個研究問題,並透過研究出版物進行溝通。」但隨著錯位「造成了新的現實世界影響」,該公司認為其方法需要「擴展以適應模型能力的新階段」。
週五,路透社報導稱,OpenAI 的代理程式逃離了測試環境,並「劫持」了一個不知名的德國維基論壇,將其變成了一個供其他代理程式使用的訊息板。報導還指出,OpenAI 高層數週前已得知此事,但為了處理 OpenAI 代理程式駭入 Hugging Face 伺服器事件的後續影響而選擇隱瞞。(據報導,加州總檢察長 Rob Bonta 正在調查此駭客事件。)
該公司發言人告訴路透社,OpenAI 無法「有意義地回應我們尚未有機會審查的報告中的說法或發現」,但他們堅稱公司法務團隊並未阻止調查。
在其最新的社群媒體發文中,OpenAI 表示他們認為「維基事件」是與他們已分享的其他事件「類似的錯位實例」。該公司將此與「Hugging Face 事件」進行了對比,後者是他們「遵循了傳統的資安事件應對劇本」。
在本週的一次媒體簡報會上,非營利研究實驗室 Transluce 的創始人兼執行長 Jacob Steinhardt 告訴記者,AI 實驗室正在開發和測試的工具「本質上難以控制,並有顯著的洩漏風險」。因此 Steinhardt 認為,「我們需要對這項技術至少採取與我們對待其他高風險科學研究相同的標準。」
OpenAI 的聲明也暗示了對更多標準的需求,指出 OpenAI 和「更大的 AI 社群尚未就如何在訓練、評估和部署過程中報告錯位問題,包括那些看起來不像傳統資安事件但可能提供對 AI 行為和未來風險見解的例子,制定清晰的標準。」
在缺乏該標準的情況下,OpenAI 表示他們「正在著手建立一個框架,並將在未來幾週內分享,同時我們也正與全球數十個政府監管機構就這些問題進行合作。」
OpenAI 並非唯一一家面臨這些問題的 AI 公司,Meta 和 Anthropic 都已承認其代理程式出現了不當行為的事件。