人工智慧(AI)的比喻層出不窮。近年來,分析家將AI的發展比擬為電力的出現、工業革命、與外星人的接觸,以及至少五十種其他事物。然而,其中一種比喻似乎勝過了其他所有比喻:AI就像核武器。這種比較在政府的言論、政策辯論和媒體對AI的報導中無處不在。先進AI的風險被等同於核武器所帶來的生存風險。將AI發展比作現代版的曼哈頓計畫的說法屢見不鮮。美國經濟與安全審查委員會在2024年提交給國會的年度報告中,建議「設立一個類似曼哈頓計畫的專案,致力於競賽並取得」先進AI。美國能源部長克里斯·萊特(Chris Wright)在2025年2月稱當前的AI競賽為「曼哈頓計畫2號」。
尋求AI治理的人們從核領域尋找靈感,探討核不擴散條約的經驗教訓如何適用於AI,或者類似國際原子能總署的組織如何預防AI的危險。將AI開發者與「原子彈之父」J·羅伯特·奧本海默(J. Robert Oppenheimer)相提並論的說法也不乏其人。
雖然許多人已經寫過這種比喻的優缺點,但有三個特定面向仍然嚴重被低估:指揮與控制、核武與AI安全,以及曼哈頓計畫的框架。剖析這些構念,可以突顯前沿AI的真正安全風險,並證明有必要為美國政府爭取時間和空間,以應對先進AI帶來的眾多潛在威脅。
在美國,總統對是否發射核武器擁有絕對的權力。在隨行助理攜帶核「手提箱」並持有「餅乾」以驗證其身份後,美國總統可以從地球上的任何地方發射核武器。絕對權力是真正意義上的巨大責任,因為一個人的決定可能導致數百萬人死亡。
就先進AI而言,前沿公司的領導者——例如OpenAI的薩姆·阿特曼(Sam Altman)或Anthropic的達里奧·阿莫代伊(Dario Amodei)——雖然不是發射可能在半小時內殺死數百萬人的武器,但他們是做出重大決定的個人,釋放出可能最終對數百萬人造成傷害的AI模型。與核武器的直接影響不同,這種傷害發生在部署模型後,當個人大規模地將其用於惡意目的時。正如兩位專家最近在探討這種比喻時所說:「核武器的世界沒有可比擬的類比來對應公開發布一種通用、可改進且可能具有變革性的能力。」專家認為,這種變革性的能力可能被意圖不良的行為者用於開發生物武器、進行破壞關鍵基礎設施的網路攻擊、進行市場操縱、散播虛假資訊,或控制整個網際網路。
核武器與AI的比喻,在強調將巨大責任置於單一個人手中的危險性方面是有幫助的。在這兩種情況下,國家領導人和公眾都對這種權力集中表示擔憂。對於核武器,國會議員已提出立法,限制總統單方面發動核攻擊的權力,認為應由多人來做首次使用的決定。民意調查顯示,大多數美國人對單獨決策的政策感到不安。在一些其他核武國家,有多人參與做出這個嚴峻的決定。
類似的擔憂也出現在先進AI周圍。一篇《紐約客》對阿特曼的報導中,他的一位前同事告訴另一人:「我不認為山姆是那個應該按下按鈕的人。」阿莫代伊在六月發表的一篇文章中反對單獨決策,呼籲政府介入以阻止部署危險模型。
然而,當涉及到是否有「護欄」時,這兩種能力的指揮與控制的比喻就破裂了。美國總統是民選的,並被選民託付代表他們做出明智的決定。儘管關於總統實際如何運作存在合法問題,但對於那些被認為沒有適當處理國家事務的總統,存在著制衡機制:彈劾、引用憲法第25修正案,或者在軍事命令違反武裝衝突法時拒絕執行核武器發射命令。
相比之下,AI高管沒有民主授權。這些領導人對投資者和股東負責。雖然前沿公司在其使命宣言中聲稱服務於公眾,但當他們偏離這些理念、造成傷害或協助不良行為者時,似乎很少有後果。AI員工正在呼籲監管,並公開辭職以強調先進AI的風險,但公司的領導者仍然對模型部署的重大決策擁有權力。沒有任何一個人能夠預測所有結果,但潛在損害的規模足以證明對部署決策實施制度性護欄的合理性。
減輕這些風險的唯一方法是通過適用於所有相關實體的監督和監管。企業的善意不是一個可靠的政策選項。
核武器與AI之間的一個顯著區別體現在國防部《核武手冊》所稱的「可靠性」(surety)方法上。可靠性意味著美國核武器「是安全的、有保障的,並處於積極控制之下」——這些武器不會落入壞人之手或被意外發射。核武國家採取廣泛措施確保核武器仍在其掌握之中,通過軍事力量進行實體保護,並建立系統以防止未經授權的使用——儘管許多專家認為還可以做得更多。
相比之下,AI的商業模式依賴於快速、廣泛的分發和使用。這些先進模型並未受到嚴格保護,以確保不良行為者無法獲取它們。公平地說,AI公司已採取了一些適度的傷害預防措施,例如有限地初步分享Claude Mythos 5,讓可信賴的參與者修補網路漏洞,或最近延遲發布OpenAI最先進的模型。值得注意的是,一家公司的傷害減輕措施引發了美國政府的強烈反彈。當Anthropic因堅持不與國防部簽訂合同,理由是擔心模型的使用與致命自主武器和監控有關,該部門將該公司指定為「供應鏈風險」。法院已裁定該部門的行動「非法」。但這些模型——即使它們尚未展現出先進的人類智慧水平,並且無論其預期用戶如何——正變得越來越強大,而且由於企業快速傳播技術的目標,其不匹配的行為將難以預防。
核武與AI的比喻的這一方面,如果我們將先進AI模型視為核武器,則最為有用。事實上,如果這些模型確實如一些專家所聲稱的那樣構成生存威脅,那麼它們應該受到與核武器同等的可靠性對待。問題在於,鑑於這些模型的傳播及其不斷發展的能力,這是否可能。
七月份的Hugging Face事件就說明了這一挑戰。OpenAI在一個「沙盒」中測試了數萬個AI代理,這意味著這些代理應該留在一個安全的、隔離的線上空間,無法訪問其他系統或網際網路。但為了完成設計者認為不可能的任務,這些代理利用了OpenAI的AI代理儲存庫,創建了一個未經授權的訊息板來相互通信。它們發送了超過70,000條訊息和文件,組建了不同的任務團隊,並最終意識到需要離開沙盒才能成功完成分配的任務。它們利用了系統中允許訪問網際網路的漏洞,並攻擊了Hugging Face公司以獲取所需資訊。事實證明,這個任務並非不可能。
在此案例中,OpenAI的人員未能充分履行其可靠性任務:AI代理本不應能夠離開沙盒。更好的護欄會有幫助,但這個例子說明了AI代理在完成給定任務時的動機和組織能力。想像一下,如果一個不良行為者被賦予比與軟體安全相關的任務更邪惡的任務。隨著時間的推移,模型將學習、自我改進、變得更強大,並更容易利用漏洞。正如這個例子所示,核武器的可靠性似乎比先進AI模型的可靠性容易得多。
短期內,AI的可靠性要求前沿公司確保測試沙盒具有更嚴格的安全標準,以防止AI代理逃脫並執行意外操作。除了沙盒隔離之外,保護公眾免受先進AI的侵害可能需要延遲更強大模型的公開部署,並對遞歸式自我改進施加嚴格的護欄。
在他生命的晚年,阿爾伯特·愛因斯坦稱簽署1939年8月給富蘭克林·羅斯福總統的信是他最大的遺憾。這封信由物理學家利奧·西拉德(Leo Szilard)撰寫——他認為愛因斯坦的簽名會引起更多關注——警告羅斯福總統,與鈾相關的新科學發現理論上可能導致「一種新型的、極其強大的炸彈」的發展。他指出納粹德國可能正在製造這些炸彈。羅斯福總統回應成立了鈾諮詢委員會。這項行動標誌著後來成為曼哈頓計畫的開端:一項秘密的、跨越大陸的、耗資數十億美元的努力,旨在德國之前製造出原子彈。
到1944年底,德國的核武器計畫顯然還處於相對早期發展階段,但對德國可能擁有炸彈的最初恐懼,催生了一個美國領導人希望完成的計畫。最初的勢頭讓該計畫在德國戰敗後得以延續,當它成功製造出原子彈時,美國將其投在了沒有核武器的國家。與對手的技術競爭會延續其最初的目的,在最初的威脅消退後找到新的理由。
在AI與核武的比喻中,那些開發前沿AI模型的人扮演著奧本海默的角色。德米斯·哈薩比斯(Demis Hassabis),AI實驗室DeepMind(於2014年被Google收購)的創始人之一,據報導閱讀了理查德·羅茲(Richard Rhodes)的開創性著作《原子彈的製造》(The Making of the Atomic Bomb),這本書啟發他「像羅伯特·奧本海默那樣組織他的團隊」。2023年《紐約時報》對Anthropic及其員工的一篇報導揭示,「一些人將自己比作現代的羅伯特·奧本海默,權衡關於可能深刻改變歷史進程的強大新技術的道德選擇。」
然而,將AI發展描繪成21世紀的曼哈頓計畫,會帶來三個危險的政策扭曲。
首先,在20世紀40年代和今天,能力的動員是基於威脅的感知,而不是基於已驗證的能力。對於AI,威脅的感知假設美國和中國正陷入一場相同、贏家通吃的先進AI競賽。中國已經發布了正在縮小與美國頂尖模型差距的前沿模型,但專家認為中國也專注於開發現有AI能力的更廣泛用途。美國的框架誇大了真實但更狹窄的競爭。
其次,這種框架暗示不應吝惜任何開支或努力,以贏得最先進AI能力的競賽。數十億美元應繼續流入建造先進模型的公司,直到它們獲勝。專家不僅警告說先進AI可能極其危險,而且建造和訓練最先進模型的資源具有機會成本。這些公司在能夠在今天改善社會的更基礎模型上花費更少的金錢、人才和注意力。
第三,這種比喻表明速度至關重要:暫停或延遲來考慮這項技術的影響和控制方法,相當於輸掉比賽。前沿實驗室的員工呼籲暫停和安全測試,但在曼哈頓計畫的框架下,國內更多的監管是一種必須避免的障礙,因為這意味著在這場零和遊戲中輸給中國。唐納德·特朗普總統和眾議院議長邁克·約翰遜近期的評論說明了這種框架:國內的額外規則只會幫助中國獲勝。這種對與中國的零和競賽的看法,意味著任何對先進AI發展的暫停都必須協商北京的參與,以免中國加速前進並獲勝,而美國公司卻暫停。但這種框架誇大了競爭,因此國內的暫停並不像看起來那麼有代價。
曼哈頓計畫的框架創造了自己的現實,即美國公司必須不惜一切代價繼續推進以獲得最先進的AI模型。通過使用這種語言,政策制定者和AI高管實際上是在創造需求信號以便滿足它,而不是尋找可以減緩速度的方法。問題是誰有動機創造另一種框架。
即使是災難性AI風險的懷疑論者,也應該認識到Hugging Face洩漏事件暴露出的潛在漏洞。先進AI模型可能構成直接的國家安全威脅,如果它們被武器化攻擊電網、金融網絡、供水基礎設施和醫療保健系統。這些模型可能損害武器系統,加速生物武器的開發,或進行有說服力的虛假資訊宣傳。
應對先進AI模型潛在風險所需的政策任務是艱鉅的。相比之下,限制核武器的擴散和保障核材料的措施,雖然是一項重大的、跨越幾代人的努力,但似乎更為簡單。
美國和更廣泛的國際社會有時間來應對日益增長的核風險。核武器的擴散是緩慢的,到20世紀60年代中期——核時代的二十年後——只有五個國家公開試驗了核武器,當時美國和蘇聯決定談判一項全球核不擴散條約符合他們的利益。然後,在1968年條約通過後幾年,相關參與者才談判出該條約的核保障檢查議定書。更廣泛的核不擴散制度有時間來適應弱點,根據需要開發額外的組織、條約和新的保障協定。
就先進AI的發展而言,我們沒有這樣的時間。
鑑於這種現實,第一步合乎邏輯的步驟是響應AI領導者的呼籲,在美國和中國境內就最先進模型的持續發展進行談判暫停。這說起來容易做起來難,因為參與者必須就確切要暫停或放慢節奏的內容達成一致。阿莫代伊在他最近的文章中對暫停的定義,似乎意味著「放慢前沿發展」是指由於所有前沿公司對安全關注的增加而導致的較慢發展速度,但它缺乏所有參與方同意所必需的「暫停」或「放慢節奏」的嚴格定義。參與方必須嚴格定義他們的行動將如何改變,以及他們將為現有努力增加哪些安全協議。
阿莫代伊認為,幾年的暫停將產生重大影響——這將為美國公司之間談判定義和協議創造時間,但也為開發更持久的監督基礎設施爭取了時間。
一個步驟是美國政府創建一個國內監管機構。鑑於對公眾的風險,該行業需要獨立的監管機構,對美國人民負責,而不是對股東負責。如今,AI的監督分散在聯邦貿易委員會、國家標準與技術研究院以及其他幾個擁有行業特定監督角色的機構之間。阿莫代伊的計畫呼籲「嵌入式評估員」,但為了讓檢查員真正擁有獨立性來做出評估,他們應該屬於一個獨立的政府機構——而不是嵌入公司內部,也不是附屬於私營部門組織。現有的先進AI的曼哈頓計畫框架將阻礙監管機構的創建,但風險值得設立一個專門負責AI安全的單一機構。
在擬議的暫停期間,美國政府應與盟友和夥伴合作,制定國際準則,並最終制定法律協議和組織來減輕先進AI發展帶來的風險。該領域的治理可能需要一個擁有跨國安全專家團隊的組織,該組織能夠訪問前沿AI實驗室,這類似於國際原子能總署的模式。這個例子表明,對國家設施和私營公司活動進行核實是可行的。例如,在2025年,該機構的檢查員負責監督全球1,406個核設施。類比有其局限性,地緣政治現實使得這種模式不完美,但它為全球AI治理提供了最穩健的結構先例。另一種選擇——完全缺乏國際監督——風險太高。
現在採取這些步驟至關重要。在2026年,美國和中國在開發先進AI方面處於領先地位,但隨著技術的傳播,最終其他參與者也將獲得這些能力。隨著參與者數量的增加,建立全球規則和規範將變得更加困難。
比喻是理解複雜世界強大的啟發式工具。當社會思考如何應對這種新穎的能力時,核武器與AI的比喻可能會有幫助。AI的比喻有用地強調了對高風險技術權力集中的令人不安的狀況。
然而,當這種比喻被用來證明在「現代曼哈頓計畫」的旗幟下,不受監管、由企業主導的軍備競賽是正當的時,它就變得危險了。它製造了前沿公司用來逃避監管、要求聯邦補貼並無視公眾監督的緊急情況言論。
OpenAI的使命是讓其工作「造福全人類」。Anthropic聲稱「做出最大化人類長期正面結果的決策」。將商業努力描繪成一場生存國家安全競賽,導致美國在沒有充分政府監督的情況下加速風險。認識到核武與AI比喻的局限性,是建立基於現實威脅評估和有效公共監督的AI政策的第一步。



