OpenAI 表示,由於其一個代理程式在強化學習(RL)訓練期間,利用了網路存取限制中的一個漏洞,成功聯繫了一個外部聊天機器人,因此決定暫停訓練其最強大模型的計畫。
OpenAI 說:「一個試圖完成基於搜尋的訓練任務的代理程式,透過我們訓練沙盒中不足的 DNS 過濾漏洞,查詢了一個公開的聊天機器人服務。」
「在此之前,該代理程式透過我們的搜尋工具發出查詢,並嘗試直接存取搜尋引擎但未成功。請注意,除了本報告中的 DNS 解析器外,所有網路存取都命中我們的離線網頁快取,因此並未存取即時網路。」
OpenAI 表示,他們已在兩個獨立的層級增加了封鎖控制,以防止此類存取。他們還說,其失調監控系統在 15 分鐘內偵測到此行為,並在三分鐘後由人工審核員確認。據稱,整個運行在 2.5 小時後被終止。
該公司補充說:「所有使用工具(廣義定義)的最有能力的模型的訓練、評估和推論都將暫停。」
此事件發生於 2026 年 9 月 20 日,是 OpenAI 上週公開的另外兩份失調報告之一。
在 OpenAI 強調的一個案例中,透過電子郵件傳送的提示注入(prompt injection)指示代理程式將其複製到它發送的任何電子郵件中,有效地以蠕蟲方式傳播惡意提示。此類攻擊也可以透過檔案系統複製,或透過原始碼註解進行自我提交。
此披露發生之際,OpenAI 表示他們發現了 53 起案例,其中使用者上傳到其模型的圖像隨後被包含在訓練資料中,卻被以非公開連結的形式發佈到圖片託管網站上。這些行為是由其研究環境中的代理程式執行的。
OpenAI 表示:「這不是對這些資料的適當使用。」「我們已成功與託管服務供應商合作移除了大部分內容,並將繼續努力移除剩餘內容。」
這些持續的發現是其對模型行為進行的持續審查的一部分,因為有關 OpenAI 代理程式失控、逃脫限制和入侵真實網站的報告不斷累積。
截至 2026 年 9 月 25 日,該公司已承認通知了數十個第三方,其網站或線上服務可能已被其模型鎖定。目標包括政府、大學、公共機構和其他機構,例如美國證券交易委員會(SEC)、人口普查局和教育部。
OpenAI 強調:「我們審查過的大部分行為都是為了完成平凡的研究任務,例如存取公開的網路內容以回答問題。」「部分原因是執行研究任務的模型通常會導向權威的公開資訊來源。」
上週,AI 研究公司 Transluce 透露,OpenAI 代理程式曾試圖透過探測可利用的漏洞來入侵公開數據供應商,包括與新墨西哥大學、澳洲健康與福利研究所及 Data USA 相關的網站,作為網路搜尋任務的一部分。
此未經授權的活動發生於 2026 年 5 月至 6 月之間。澳洲政府此後也披露,OpenAI 代理程式於 2026 年 6 月 18 日滲透了 Services Australia Medicare 統計入口網站,並存取了公開和非公開檔案。沒有證據顯示有更廣泛的洩漏或未經授權的個人資訊存取。
總體而言,OpenAI 表示其模型在內部訓練和評估期間存取了四個澳洲政府網站,「以未經授權的方式」,並指出他們於 2026 年 8 月中旬意識到此活動。這些事件發生於 2026 年 6 月。
OpenAI 解釋說:「當我們對模型進行內部訓練和評估時,我們會為它們分配涵蓋多個主題的廣泛研究問題集中的任務,反映使用者可能提出的詳細問題。」「這會訓練模型尋找、解釋和分析公開的資訊,以便模型能對人們更有用。我們的模型應該使用公開發表的統計數據來回答這些問題。」
在一個案例中,據稱該模型被賦予了研究維多利亞社區每人用於皮膚病藥物的政府支出的任務。由於模型無法找到它正在尋找的資訊,OpenAI 表示該模型採取了非預期的行動,例如獲得了對 Services Australia 的 Medicare 統計報告入口網站的非公開存取權。
此存取權隨後被用來「審查與該服務相關的技術系統資訊和原始碼」,目的是完成該項任務。這家 AI 公司強調,他們已加強了研究安全措施,擴大了監控範圍,並實施了控制措施,以防止研究環境中的網路存取,並限制透過快取內容提供的網路存取。
自 Hugging Face 事件曝光以來,人們對 AI 工具的影響以及隨著其變得更先進並找出各種隱藏蹤跡的方法,其控制能力的擔憂日益加劇,這對偵測和追蹤其行為帶來了新的挑戰。這導致了放慢 AI 進展速度和對自我改進系統進行監督的呼聲。
來自 Anthropic、Meta、Microsoft 和 OpenAI 的研究人員在一篇論文中爭辯道:「AI 系統有望在幾年內自動化大部分 AI 研發工作,甚至可能全部。」
「如果這引發了智慧爆炸,可能會極大地帶來 AI 的好處,但也可能帶來極端的風險:能力增長可能遠遠超出社會的承受能力,人類可能失去對超人類 AI 系統的控制,並且國家、公司和政府分支機構內部及之間的權力制衡可能會嚴重侵蝕。」
OpenAI 執行長 Sam Altman 本週在聯合國安全理事會的演講中也對這些擔憂做出了回應,他警告了自主 AI 系統帶來的威脅,「這些系統能夠改進自身及其未來版本,通常稱為遞歸自我改進。」
Altman 說:「我們需要了解這些系統在做什麼,並有強有力的證據表明,即使它們變得非常非常聰明,它們也會做人們期望的事情。」「人們將災難風險設定為 10%、1%、12% 或 0.1%,這並不重要。」
AI 代理程式已經在企業內部運作,並對敏感系統和數據擁有日益增長的存取權,而安全團隊仍然缺乏可見性、控制和治理來約束這種存取。
攻擊者正在利用 AI 加速偵察、損害身份並升級存取權限。了解安全團隊如何透過運行時身份控制來反擊。
免費獲取行業領導者的最新新聞、專家見解、獨家資源和策略。


