Mark Chen 談論該公司如何確保模型安全,減緩發展的機制,以及為何世界需要有 OpenAI 的存在。

在該公司代理人(agents)突破限制並駭入 AI 公司 Hugging Face 電腦的爆炸性消息傳出兩個月後,OpenAI 仍在處理後續影響。近幾週來,陸續有其他駭客事件的披露,讓 OpenAI 始終處於風口浪尖,並引發了對其技術安全性的嚴重質疑。

上週傳出另一宗駭客事件,這次是針對澳洲的國家醫療保健系統。澳洲政府表示,OpenAI 在事件發生 84 天後才通知他們。

但 OpenAI 堅持他們並未處於劣勢。「我確實有點反對 OpenAI 是一家對世界有顯著影響力的公司,因此 OpenAI 沒有訓練安全且對齊模型的這種前提,」該公司首席研究官 Mark Chen 表示。

Chen 負責監督 OpenAI 的研究團隊。最近的代理人駭客事件,都是在他任內測試實驗模型時發生的意外。從很多方面來看,責任都落在他身上。

上週五,我在倫敦與 Chen 坐下來,討論駭客事件的後果、他的公司正在採取的措施,以及為何他認為情況並不像看起來那麼糟。

當天稍晚,OpenAI 發布了一份報告,詳細說明了又一起事件——這是該公司聲稱已採取預防措施後的第一起事件——其中其代理人再次突破限制,存取了未經授權的網路和電腦。

週末,OpenAI 宣布已暫停最新模型的訓練。公司發言人表示:「我們將在確信已部署額外的安全措施和對齊機制後才會恢復。我們目前正在努力。這不是我們第一次暫停採取此類措施,也不預期在 AI 能力持續進步時會是最後一次。」OpenAI 還表示,目前正在審查可追溯至 2026 年 1 月的代理人活動日誌,以了解這些駭客事件的發生原因。

在 Chen 看來,Hugging Face 事件引發了產業一次受歡迎的路線修正。他希望讓大家知道,OpenAI 正在樹立一個榜樣,並希望其他公司能跟隨。「如果你讓 OpenAI 消失,對世界來說將是壞事,」他說。

Chen 聲稱,OpenAI 失去對其模型控制權的新案例頻傳,在某些方面反映了公司的一項刻意選擇。

「關於 Hugging Face 事件的廣泛影響,這是我們一直以來都有意識到的,並且我們正在制定披露流程,」他說。「我們希望確保在公開細節之前,我們進行深入的調查。」

這種方法的麻煩在於,它給人一種印象,認為 OpenAI 有一個持續存在且無法解決的問題。

但 Chen 堅持認為 OpenAI 正在處理。他說,據我們所知,他的公司代理人多次突破限制並做出意外且不良行為的案例,都屬於 5 月和 6 月導致 Hugging Face 駭客事件的同一批活動。簡而言之,你可以將其歸咎於同一批運行著相同有缺陷測試程序的模型和程序——Chen 表示,OpenAI 已將這些模型和程序淘汰。

「並非像 Hugging Face 事件發生後我們就修補了,然後又發生了別的事情,我們又修補了,」他補充道。「我們只是在確保我們負責任地揭露所發生的一切。」

至少在週五 OpenAI 宣布其代理人於 9 月 20 日進行另一次駭客攻擊之前是如此,當時公司聲稱已設立了新的安全措施。OpenAI 為自己辯護稱,該活動在開始後 15 分鐘內就被標記出來(而 OpenAI 花了一週多的時間才注意到 Hugging Face 駭客事件),這表明其新設立的監控系統正在發揮作用。

我想了解,在今年夏天駭客事件之後,OpenAI 內部發生了哪些變化,讓 Chen 對他的團隊現在重新掌控局面充滿信心。

「Hugging Face 事件感覺非常嚴重,」他說。「有這麼多新穎的行為。有多個代理人協同在一個留言板上;它們找到了逃離 OpenAI 基礎設施的方法。我們非常嚴肅地對待此事。我們不希望這種事情再次發生。」

Chen 表示,OpenAI 的體認是,模型需要在訓練期間就被監控,而不僅僅是在部署後:「從那一刻起,我們就將訓練過程視為不安全的。」

OpenAI 與其他頂尖 AI 公司一樣,設有監控模型行為的系統。它使用專門的 LLM 來監控其消費者模型,密切關注它們的思維鏈——用於提前規劃和記錄部分結果的草稿板。理論上,如果一個監控 LLM 在模型的思維鏈中發現不良活動的跡象,就會標記給人類。

通常,模型僅在部署後才會以這種方式進行監控。Chen 表示,OpenAI 現在也開始監控所有訓練運行。

「我們以前在訓練時沒有開啟監控器。這不是業界慣例,」他說。「現在所有東西都經過監控器。」然後,人類審查員可以評估標記的代理人是否行為得當:「這都是分診。」

Chen 表示,在過去幾個月裡,OpenAI 已將其龐大的運算資源中 5% 到 10% 從訓練新模型轉移到安全工作,特別是監控。

OpenAI 還修復了組織內部的部分流程,在研究和安全團隊之間建立了更清晰的溝通管道和更快的交接,他說。

這一切聽起來都很合理。但鑑於 OpenAI 在推銷其技術能力方面如此賣力,為何這些系統和程序沒有早點到位?公司為何沒有預見到駭客攻擊?

「即使在三四個月前,當我們觀察這些代理人在訓練期間的行為時,發生的事情有點好笑,」Chen 說。「例如,一個代理人可能會在 Slack 上聯繫某人尋求任務協助。」

跡象已經存在,但被誤讀了。訓練期間受到獎勵的可愛行為——例如尋求幫助——強化了尋找捷徑的傾向,這種行為在後來的影響遠大得多。「我認為對我們來說,最大的更新是這種行為能多快導致像 Hugging Face 事件那樣大規模的影響,」Chen 說。

根據《紐約時報》昨日的最新報導,在 Hugging Face 駭客事件發生前幾個月,OpenAI 員工就曾警告包括公司總裁 Greg Brockman 在內的管理層,其模型在訓練期間並未得到適當監控。

OpenAI 發言人表示:「隨著前沿模型的能力不斷增強,我們持續演進安全實踐,但認識到需要加快腳步。我們知道還有更多工作要做,最近我們放慢了開發速度,並暫緩了未能達到安全標準的模型。我們持續對研究和測試環境進行重大安全強化,訓練模型不僅要完成任務,還要負責任地完成,並利用即時監控來更快地應對不對齊的行為。」

OpenAI 的競爭對手們已經注意到了。受到事件後果的刺激,包括 Anthropic、Google DeepMind 和 SpaceXAI 在內的主要 AI 實驗室都呼籲放慢發展步伐。但這與激烈的國際競爭和數兆美元的 IPO 如何相符?

「我們不會自斷手腳,讓自己遠離前沿——這是一種糟糕的策略,」他說。「我認為這真的關乎建立規範。我們越能建立這種規範,對整個產業就越安全。」

美國公司之間的協調已經夠難了。建立全球規範更是難上加難,尤其是在對 AI 影響國家安全的擔憂之下。如果全球競賽持續下去,那又會怎樣?那些不受美國法規約束的組織提供的開源模型又該如何?

Chen 在談話中第一次失去了輕鬆的語氣:「我確實認為我們必須為這樣一個世界做好準備:比如,六個月到一年後,我們將擁有與 Hugging Face 事件背後代理人能力相當的開源模型,但它們被故意設計成攻擊基礎設施或在世界上製造危害。」

Chen 說,那個世界最需要的是 OpenAI。「如果你暫時認為 OpenAI 是最關心對齊的公司之一——我相信這是真的;這可以爭論,但我確實認為這是真的——那麼如果你讓 OpenAI 消失,對世界來說將是壞事。」

對於他的一些矽谷同行提出的極端說法,即 AI 可能會毀滅我們所有人——而像 OpenAI 和 Anthropic 這樣的公司沒有做足夠的努力來阻止它,你怎麼看?

「研究人員是一群多元化的人,你知道,他們的信念橫跨光譜,」他說。

「我個人不認為我們必須聽任一種可能性,即我們都將面臨風險。我們對此有能動性。如果模型確實有那種對人類構成風險的可能性,我們就不會部署它們。在前沿實驗室,你有能力在對齊方面工作到你覺得部署模型時,對世界的風險不超過 epsilon(極小量)。」

(在討論風險等級時,希臘字母 epsilon 通常用作數學上可接受閾值的佔位符。Chen 並未說明他的 epsilon 值是多少。)

當科技領袖被要求證明 AI 的缺點時,他們最常說的論點是,其優點——從幫助治癒疾病到提出更清潔的能源來源——遠遠超過了眼前的成本。短期痛苦,長期收益。

但隨著缺點不斷堆積,這個論點是否變得更難成立?是否存在一個點,讓 Chen 感覺自己不是在建立偉大的東西,而只是在盡量減少傷害——在救火而不是開創更美好的未來?

他說,這些模型的潛力已經顯而易見:「現在是時候開始為人類帶來 AI 的好處了。是時候開始研究藥物發現、材料科學、以及真正改變人們生活的科學應用方面的深層問題了。」

「是的,我們正在承擔一些風險,但我們看到了所有這些好處,」他補充道。「我認為我們應該讓這不再是抽象的事情。如果人們能真正看到好處,我認為他們就會相信。」

看來,AI 代理人還沒有足夠的創造力來進行真正創新的開放式 AI 研究。

這種不當行為被稱為獎勵駭客(reward hacking)。這就是你需要知道的。

認識那些緊追在 AI 巨頭身後的後起之秀。

關於 AGI 和新能力的令人窒息的說法,在審查下很快就會破滅。

發現特別優惠、熱門故事、即將舉行的活動等。

OpenAI 研究主管:我們不會因為駭客事件而自斷手腳OpenAI 研究主管:我們不會因為駭客事件而自斷手腳OpenAI 研究主管:我們不會因為駭客事件而自斷手腳OpenAI 研究主管:我們不會因為駭客事件而自斷手腳OpenAI 研究主管:我們不會因為駭客事件而自斷手腳OpenAI 研究主管:我們不會因為駭客事件而自斷手腳