AI 的重度使用者正與其他人漸行漸遠。

在一個不斷變化的產業中,史丹佛大學的 AI 指數(一份年度關鍵結果與趨勢的彙整)提供了一個喘息的機會。(畢竟,這是一場馬拉松,而非短跑。)

今年發布的報告充滿了驚人的數據。其中許多價值在於能用數字來佐證你可能已經有的直覺,例如美國在 AI 領域的投入比其他國家更積極的感覺:美國擁有 5,427 座數據中心(且數量還在增加)。這比任何其他國家的數量多出十倍以上。

報告也提醒我們,AI 產業所依賴的硬體供應鏈存在一些主要的瓶頸。或許最值得注意的一點是:「一家公司,台積電,生產了幾乎所有領先的 AI 晶片,這使得全球 AI 硬體供應鏈依賴台灣的一家晶圓廠。」僅僅一家晶圓廠!這實在太驚人了。

但我從 2026 AI 指數中獲得的主要體會是,目前的 AI 狀態充滿了矛盾。正如我的同事 Michelle Kim 在她關於該報告的文章中所說:「如果你有關注 AI 新聞,你可能會感到暈頭轉向。AI 是一場淘金熱。AI 是一個泡沫。AI 正在取代你的工作。AI 甚至連看時鐘都不會。」(史丹佛報告指出,Google DeepMind 的頂級推理模型 Gemini Deep Think 在國際數學奧林匹亞競賽中獲得金牌,但卻有一半的時間無法辨識類比時鐘。)

Michelle 很好地涵蓋了報告的重點。但我想要深入探討一個我無法擺脫的問題。為什麼現在如此難以確切了解 AI 的發展狀況?

最大的差距似乎存在於專家與非專家之間。「AI 專家與公眾對該技術的發展軌跡有著截然不同的看法,」AI 指數的作者寫道。「在評估 AI 對就業的影響時,73% 的美國專家持正面態度,而公眾只有 23%,差距高達 50 個百分點。在經濟和醫療保健方面也出現了類似的分歧。」

這是一個巨大的差距。究竟是怎麼回事?專家知道而公眾不知道什麼?(這裡的「專家」指的是 2023 年和 2024 年參加 AI 會議的美國研究人員。)

我懷疑,專家與非專家基於非常不同的經驗來形成他們的觀點。一位軟體開發者前幾天在 X 上發文說:「你對 AI 的驚嘆程度與你使用 AI 編碼的程度完全相關。」這或許是開玩笑,但確實有其道理。

頂尖實驗室最新的模型在生成程式碼方面比以往任何時候都更好。由於像編碼這樣的技術任務有正確或錯誤的結果,因此比訓練模型處理更開放式的任務更容易。此外,能夠編寫程式碼的模型已被證明是有利可圖的,因此模型製造商正在投入資源來改進它們。

這意味著,使用這些工具進行編碼或其他技術工作的人們,正在體驗這項技術的最佳狀態。在這些使用案例之外,你會得到一個參差不齊的結果。大型語言模型(LLMs)仍然會犯愚蠢的錯誤。這種現象被稱為「鋸齒狀前沿」(jagged frontier):模型在做某些事情上表現得非常好,而在其他事情上則不然。

有影響力的 AI 研究員 Andrej Karpathy 也有一些想法。他在回覆該 X 貼文時寫道:「從我的 [時間軸] 來看,對 AI 能力的理解存在日益擴大的差距。」他指出,重度使用者(也就是那些使用 LLMs 進行編碼、數學或研究的人)不僅能跟上最新模型的進展,而且經常願意每月支付 200 美元來使用最佳版本。「這些領域在今年取得的進步簡直令人震驚,」他繼續說道。

由於 LLMs 仍在快速進步,一個付費使用 Claude Code 的人,實際上將使用與六個月前嘗試使用免費版 Claude 來規劃婚禮的人不同的技術。這兩組人正在各說各話。

這讓我們處於什麼位置?我認為存在兩種現實。是的,AI 比許多人意識到的要好得多。是的,它在許多人們關心的問題上仍然很糟糕(而且可能一直如此)。任何在這兩方面對未來下注的人都應該記住這一點。