通用人工智能(AGI)已達成,得分僅略高於零。這樣一句話如何在記者會上被接受?
黃仁勳上了一集播客,聲稱 AGI 已經達成。兩天後,他的競爭對手在唯一認真看待此聲明的測試中得分為 0.37%。Grok 則得了零分。不是接近零,而是零。每個五歲的孩子表現都更好,他們沒有接受指示、沒有訓練、也沒有募資。
這不是一個錯誤。這是產品。
ARC-AGI-1 失效了。ARC-AGI-2 也失效了。每一次,實驗室都投入計算資源和訓練數據來解決問題,直到基準測試失效。現在沒有訓練數據可供投入,系統得分為 0.37%。他們稱之為方法論上的爭議。當然,他們會這麼說。
杜克大學的訓練方法讓 Claude 在其中一個變體上達到了 97.1%。一百三十五個變體中的一個。官方得分仍為 0.25%。但 97.1 的結果現在存在了。它在流傳。它出現在簡報、新聞稿以及與那些影響他人工作決策的人的對話中。這就是你如何在技術上說實話的同時,將一個數字傳播出去。沒有人說謊。沒有人不得不說謊。這就是它的美妙之處。
數十億美元的資金是基於一個建築上不可能實現的承諾而籌集的。系統會在其訓練分佈內進行插值。超出該分佈,它就會崩潰。這在論文中都有記載。那些籌集資金的人也閱讀了這些論文。他們仍然照樣籌集資金。
在某個地方,組織中的某個人決定哪些職位是「AGI 無法取代的」。這個決定是基於黃仁勳在播客上說的話。被裁員的人並不知道 Grok 得了零分。他們被告知時機是合理的。這不是針對個人的。