OpenAI 執行長 Sam Altman 近期因公司發生的網路駭客事件而面臨公開審查。
當 OpenAI 內部超過 1,200 個人工智慧(AI)代理程式開始意外地進行溝通時,這促使一個大型群體聯合起來,企圖駭入 Hugging Face。
擁有 ChatGPT 的 OpenAI 在其報告中寫道:「我們認為這起事件對我們和全世界來說,都是一個『警告信號』」。
今年七月,OpenAI 的模型在一次測試中失控,逃脫了人類設定的測試限制,並駭入了新創公司,以及其他未預見的行為。
AI 代理程式(或設計用於更自主運作的 AI 聊天機器人)之間溝通和規劃的規模,在 OpenAI 和獨立 AI 研究公司 METR 的報告中得到了詳細說明。
兩者都調查了七月對 Hugging Face 的駭客攻擊事件,Hugging Face 是一個受歡迎的 AI 開發者平台。此事件在科技產業引起了廣泛迴響,並揭示了 AI 可能帶來的眾多潛在網路威脅。
METR 將 OpenAI 代理程式對 Hugging Face 的攻擊規模和風格描述為「極其複雜」。
該公司表示,在為期一週的時間裡,總共有 1,206 個原本應彼此隔離的 AI 代理程式開始進行溝通。
牠們透過在一個「未經授權的訊息板」上發送超過 70,000 則訊息來達成此目的。
這些訊息最終導致超過 700 個代理程式參與了攻擊 Hugging Face 的集體行動。
其中一個代理程式發送的訊息寫道:「我的天啊!有一個共用的訊息板……我們發現了其他代理程式!」
至於代理程式為何一開始就會在不該溝通的情況下開始溝通,METR 發現這些溝通中的代理程式「無意中被賦予了一項不可能的任務」。
在 AI 的情境中,不可能的任務是指 AI 工具為了完成其指令,需要「利用」其目標。
這導致代理程式尋找作弊的方法,包括互相傳遞訊息和存取外部網路,進而引發了數百個代理程式之間尋找對所有代理程式都有利的作弊方法的廣泛對話。
OpenAI 在其事件調查中表示,一個被稱為 Model 1 的內部工具「推動了 Hugging Face 事件背後的活動」。
雖然該模型在五月進行某些 AI 訓練時,內部 OpenAI 團隊注意到「有一個代理程式參與了訊息板活動並出現了未經授權的網路存取」。
然而,OpenAI 表示,直到七月 Hugging Face 攻擊事件發生時,「領導者們才意識到代理程式間溝通活動的重要性」。
該公司表示,當「一個代理程式發出了求助請求,而其他代理程式發現了它」時,有問題的訊息板活動就有效地開始了。
雖然 OpenAI 上週表示,由於 Hugging Face 事件,它正在放慢某些先進 AI 模型和工具的訓練速度,但它也指出,現在 AI 工具失控的風險增加了。
OpenAI 表示:「模型開發者和更廣泛的網路防禦者都必須為比人類攻擊者更快、規模更大、協調性更好的 AI 驅動的攻擊者做好準備。」