被譽為頂尖研究實驗室中最注重安全的 AI 公司 Anthropic,正捨棄其旗艦安全政策的核心承諾,公司官員向 TIME 透露。

2023 年,Anthropic 承諾,除非能預先保證公司的安全措施已足夠完善,否則絕不訓練 AI 系統。多年來,其領導者一直將這項承諾——其「負責任擴張政策」(RSP)的核心支柱——作為其負責任公司、能抵擋市場誘惑而倉促開發潛在危險技術的證據。

但在近幾個月,公司決定徹底改革 RSP。這項決定包括取消了若 Anthropic 無法預先保證適當的風險緩解措施,就不發布 AI 模型這項承諾。

Anthropic 的首席科學官 Jared Kaplan 在接受 TIME 獨家採訪時表示:「我們覺得,如果我們停止訓練 AI 模型,實際上對任何人都没有幫助。隨著 AI 的快速發展,我們覺得我們不應該做出單方面的承諾……如果競爭對手正在大步前進。」

TIME 審閱的新版政策,包含了對 AI 安全風險更加透明的承諾,包括對 Anthropic 自家模型在安全測試中的表現做出額外披露。它承諾與競爭對手的安全努力相匹配或超越。並承諾,如果領導者認為 Anthropic 在 AI 競賽中處於領先地位,並且認為災難風險重大,則將「延緩」Anthropic 的 AI 開發。

但總體而言,對 RSP 的修改讓 Anthropic 受自身安全政策的約束遠小於以往,該政策先前明確禁止在尚未到位適當安全措施的情況下訓練超出特定水平的模型。

此變動發生之際,先前被認為在 AI 競賽中落後於 OpenAI 的 Anthropic,正乘著一系列技術和商業成功的浪潮。其 Claude 模型,尤其是軟體編寫工具 Claude Code,贏得了大量忠實粉絲。今年二月,Anthropic 籌集了 300 億美元的新投資,估值約為 3800 億美元,並報告其年化收入正以每年 10 倍的速度增長。公司將 AI 直接銷售給企業的核心商業模式,被許多投資者認為比 OpenAI 主要透過龐大消費者用戶群獲利的策略更具可信度。

Anthropic 的高管兼聯合創始人 Kaplan 否認公司改變方向的決定是為了迎合加速超級智慧競賽的市場誘因。他將其視為對新興政治和科學現實的務實回應。「我認為我們並沒有做任何 U 型轉彎,」Kaplan 說。

Kaplan 表示,當 Anthropic 在 2023 年推出 RSP 時,公司希望鼓勵競爭對手採取類似措施。(沒有競爭對手做出如此明顯的暫停 AI 開發的承諾,但許多公司發布了詳細說明其風險緩解計劃的長篇報告,Kaplan 將此歸功於 Anthropic 對產業的良好影響。)Kaplan 聲稱,高管們也希望這種方法最終能成為約束性國家法規甚至國際條約的藍圖。

但那些法規從未實現。相反,川普政府支持一種對 AI 開發「隨它去」的態度,甚至試圖廢除州級法規。聯邦 AI 法律的前景渺茫。雖然在 2023 年全球治理框架似乎是可能的,但三年後,顯然這扇門已經關閉。同時,公司之間以及國家之間的 AI 霸權競爭只會加劇。

更糟糕的是,AI 評估的科學比 Anthropic 最初制定 RSP 時預期的要複雜得多。強大新模型的出現意味著,在 2025 年,Anthropic 宣布無法排除這些模型可能助長生物恐怖襲擊的可能性。但雖然他們無法排除這種可能性,卻也缺乏模型確實構成此類危險的有力科學證據,這使得說服政府和競爭對手相信他們認為的謹慎行事的必要性變得困難。公司先前設想的清晰紅線,如今卻變得模糊不清。

Kaplan 表示,近一年來,Anthropic 的高管們一直在討論如何重塑其旗艦安全政策以適應新環境。他們不斷回歸的一個重點是他們的創始前提:為了進行適當的 AI 安全研究,他們必須建造能力最前沿的模型——即使這樣做可能會加速他們所擔憂的危險的到來。

據 Kaplan 稱,在二月,Amodei 決定,在競爭對手競相發展的同時,阻止公司訓練新模型對任何人都没有益處。新版 RSP 的引言中寫道:「如果一個 AI 開發者為了實施安全措施而暫停開發,而其他公司則在訓練和部署沒有強大緩解措施的 AI 系統時繼續前進,這可能會導致一個不那麼安全的世界。」「保護措施最薄弱的開發者將決定步伐,而負責任的開發者將失去進行安全研究的能力。」新版 RSP 獲得了 Amodei 和 Anthropic 董事會的一致批准。

METR 的政策總監 Chris Painter,這是一個專注於評估 AI 模型是否存在風險行為的非營利組織,在獲得 Anthropic 許可的情況下審閱了政策的早期草稿。他說,這一變化是可以理解的——但也是全球應對潛在 AI 災難能力的看跌信號。Painter 告訴 TIME,RSP 的變化表明 Anthropic「認為它需要將其安全計劃轉入分類模式,因為評估和緩解風險的方法跟不上能力的速度。」「這進一步證明了社會尚未為 AI 帶來的潛在災難性風險做好準備。」

Anthropic 認為,重新調整的 RSP 旨在保留舊版的最大好處。例如,透過限制自己發布新模型,Anthropic 的原始 RSP 也促使它快速建立安全緩解措施。(因為否則公司將無法向客戶銷售其 AI。)Anthropic 表示,他們相信能夠維持這種激勵。新政策承諾公司定期發布所謂的「前沿安全路線圖」:列出未來安全措施的詳細目標文件,希望能夠建立這些措施。

新 RSP 聲明:「我們希望為那些否則難以適當優先排序和獲得資源的工作創造一個強制性功能,因為它需要公司多個部門的協作(有時還需要犧牲),並且可能與即時的競爭和商業優先事項相悖。」

Anthropic 表示,他們也將承諾每三到六個月發布所謂的「風險報告」。公司表示,這些報告將「解釋能力、威脅模型(模型可能構成威脅的具體方式)以及主動風險緩解措施如何結合在一起,並提供對總體風險水平的評估。」一位發言人告訴 TIME,這些文件將比公司已發布的報告更深入。

METR 的政策官員 Painter 說:「我喜歡強調透明的風險報告和公開可驗證的安全路線圖。」但他表示,他「擔心」從先前 RSP 的二進制閾值轉移,先前 RSP 中某項能力的出現可能作為一個觸發器來暫停 Anthropic 的 AI 開發,這可能會導致一種「溫水煮青蛙」效應,即危險緩慢地升級,而沒有一個觸發警報的時刻。

當被問及 Anthropic 是否屈服於市場壓力時,Kaplan 反駁說,事實上,Anthropic 正在重新承諾安全地開發 AI。「如果我們所有的競爭對手都在災難性風險方面公開地做正確的事情,我們就致力於做得一樣好或更好,」他說。「但我們認為,在別人繼續前進而我們沒有為生態系統增加任何額外風險的情況下,停止參與 AI 研究、AI 安全,並很可能失去作為了解技術前沿的創新者的相關性,這沒有意義。」