根據史丹佛大學的 2026 AI 指數,AI 正飛速發展,而我們卻難以跟上。

如果你有關注 AI 新聞,你大概已經感到暈頭轉向。AI 是一場淘金熱。AI 是一個泡沫。AI 正在取代你的工作。AI 甚至連看懂時鐘都做不到。史丹佛大學人本人工智慧研究院的 2026 AI 指數,這份 AI 的年度成績單,今天發布,並試圖釐清這些紛擾。

儘管有預測認為 AI 的發展可能遇到瓶頸,但報告指出,頂尖模型持續進步。人們採用 AI 的速度比採用個人電腦或網際網路還要快。AI 公司的營收增長速度超過以往任何科技熱潮中的公司,但它們也花費數千億美元用於資料中心和晶片。用於衡量 AI 的基準測試、旨在規範 AI 的政策以及就業市場,都難以跟上 AI 的腳步。AI 正在飛奔,而我們其他人正試圖找到自己的鞋子。

所有這些速度都伴隨著巨大的代價。全球的 AI 資料中心現在可以消耗 29.6 吉瓦的電力,足以在尖峰時段供應整個紐約州。僅運行 OpenAI 的 GPT-4o 的年度用水量,可能就超過 120 萬人的飲用水需求。同時,晶片的供應鏈令人擔憂地脆弱。美國擁有全球大部分的 AI 資料中心,而台灣的一家公司台積電,則製造了幾乎所有領先的 AI 晶片。

數據顯示,這項技術的演進速度遠超我們的管理能力。以下是今年報告中的一些重點。

在一場充滿地緣政治風險的漫長激烈競賽中,根據 Arena 這個讓使用者能夠比較大型語言模型在相同提示下的輸出的社群驅動排名平台,美國和中國在 AI 模型效能上幾乎不相上下。在 2023 年初,OpenAI 的 ChatGPT 處於領先地位,但隨著 Google 和 Anthropic 發布自己的模型,這個差距在 2024 年縮小了。2025 年 2 月,中國實驗室 DeepSeek 開發的 AI 模型 R1,曾一度與美國頂尖模型 ChatGPT 相當。截至 2026 年 3 月,Anthropic 處於領先地位,緊隨其後的是 xAI、Google 和 OpenAI。DeepSeek 和阿里巴巴等中國模型僅略微落後。隨著頂尖 AI 模型在排名上僅以微弱差距分隔,它們現在正在成本、可靠性和實際可用性上展開競爭。

該指數指出,美國和中國在 AI 方面擁有不同的優勢。美國擁有更強大的 AI 模型、更多的資本,以及估計 5,427 個資料中心(比其他任何國家多十倍以上),而中國在 AI 研究論文、專利和機器人技術方面處於領先地位。

隨著競爭加劇,OpenAI、Anthropic 和 Google 等公司不再公開其訓練程式碼、參數數量或資料集大小。「我們對預測模型行為的許多事情並不了解,」該報告的合著者之一、南加州大學的電腦科學家 Yolanda Gil 表示。她說,這種缺乏透明度使得獨立研究人員難以研究如何讓 AI 模型更安全。

儘管預測發展將趨於平緩,但 AI 模型卻不斷變得更好。從某些指標來看,它們在旨在衡量博士級科學、數學和語言理解能力的測試中,已經達到或超過了人類專家的表現。SWE-bench Verified,一個用於 AI 模型的軟體工程基準測試,頂尖分數從 2024 年的約 60% 上升到 2025 年的近 100%。2025 年,一個 AI 系統獨立生成了天氣預報。

「我對這項技術持續進步感到震驚,它根本沒有任何停滯的跡象,」Gil 說。

然而,AI 在許多其他領域仍然面臨困難。由於模型是透過處理大量的文本和圖像來學習,而不是透過體驗物理世界,AI 表現出「鋸齒狀的智慧」。機器人仍處於早期階段,僅在 12% 的家庭任務中取得成功。自駕車則更為成熟:Waymo 的車輛現在已經在美國五個城市行駛,而百度 Apollo Go 的車輛則在中國載客。AI 也正在擴展到法律和金融等專業領域,但目前還沒有哪個模型能主導這些領域。

這些進展的報導應謹慎看待。史丹佛報告指出,用於追蹤 AI 進展的基準測試難以跟上腳步,因為模型很快就突破了它們的上限。有些基準測試建構不良——一個測試模型數學能力的流行基準測試有 42% 的錯誤率。有些則可以被操縱:例如,當模型在基準測試數據上進行訓練時,它們可以在不變得更聰明的情況下獲得高分。

AI 公司也越來越少分享其模型的訓練方式,而獨立測試有時與它們的報告結果不同。「許多公司沒有公布它們的模型在某些基準測試上的表現,特別是負責任 AI 的基準測試,」Gil 說。「它們在基準測試上的表現缺失,或許說明了一些問題。」

在進入主流的三年內,AI 現在已被全球一半以上的人口使用,其採用率比個人電腦或網際網路還要快。估計有 88% 的組織現在使用 AI,而五分之四的大學生也在使用。

部署仍處於早期階段,AI 對就業的影響難以衡量。儘管如此,一些研究表明 AI 已開始影響某些行業的年輕工作者。根據史丹佛經濟學家 2025 年的一項研究,22 至 25 歲軟體開發者的就業人數自 2022 年以來下降了近 20%。這種下降可能不完全歸咎於 AI,因為更廣泛的宏觀經濟狀況也可能是原因,但 AI 似乎扮演了其中一個角色。

雇主表示,招聘可能會持續收緊。根據 McKinsey & Company 於 2025 年進行的一項調查,三分之一的組織預計 AI 將在來年縮減其勞動力,尤其是在服務和供應鏈營運以及軟體工程領域。根據該指數引用的研究,AI 在客戶服務方面的生產力提高了 14%,在軟體開發方面提高了 26%,但這種增益在需要更多判斷力的任務中並未出現。總體而言,要理解 AI 的更大經濟影響,現在還為時過早。

世界各地的人們對 AI 感到樂觀和焦慮:根據 Ipsos 的一項調查,59% 的人認為 AI 將帶來更多好處而非壞處,而 52% 的人表示 AI 讓他們感到不安。

值得注意的是,根據 Pew 的一項調查,專家和公眾對 AI 的未來看法截然不同。最大的差距在於工作的未來:雖然 73% 的專家認為 AI 將對人們的工作方式產生積極影響,但只有 23% 的美國公眾這樣認為。專家們對 AI 在教育和醫療保健方面的影響也比公眾更樂觀,但他們都同意 AI 將對選舉和人際關係產生負面影響。

在所有受訪國家中,美國人對政府適當監管 AI 的信任度最低,根據另一項 Ipsos 調查。更多美國人擔心聯邦 AI 監管不夠嚴格,而不是擔心它會過度。

世界各國政府都在努力監管 AI,但去年取得了一些小小的成功。歐盟 AI 法案的首批禁令,禁止在預測性警務和情緒識別中使用 AI,已生效。日本、韓國和義大利也通過了國家 AI 法案。與此同時,美國聯邦政府則朝著放鬆管制的方向邁進,川普總統發布了一項行政命令,試圖限制各州監管 AI 的權力。

儘管有聯邦行動,美國州立法機構通過了創紀錄的 150 項與 AI 相關的法案。加州頒布了里程碑式的立法,包括 SB 53,該法案要求 AI 模型開發者進行安全披露和提供舉報人保護。紐約通過了 RAISE 法案,要求 AI 公司發布安全協議並報告關鍵安全事件。

但儘管有大量的立法活動,Gil 說,監管仍然落後於技術,因為我們並不真正了解它是如何工作的。「政府在監管 AI 時很謹慎,因為……我們對許多事情並不十分了解,」她說。「我們對這些系統沒有很好的掌握。」

修正(4 月 16 日):史丹佛 AI 指數錯誤地指出,運行 OpenAI 的 GPT-4o 的估計年用水量可能超過 1200 萬人的飲用水需求。正確數字是 120 萬人,本文已更新以反映此情況。