人工智慧(AI)迎來了迄今為止最嚴謹的數學測試。測試結果顯示,參與的 AI 模型在解決問題的能力上,並未達到頂尖數學家的水準。
這項測試是「First Proof」計畫的一部分,該計畫旨在評估 AI 解決複雜數學問題的能力。測試向四個 AI 系統提出了十個研究級別的數學難題。隨後,由相關數學領域的匿名人類專家組成的評審團對模型的答案進行了評估。這項測試是首個能同時滿足三個關鍵條件的測試:首先,它包含研究級別的數學問題;其次,它涉及的問題並未出現在訓練資料中;第三,它由數學家進行了正式評分。測試結果於 6 月 10 日在 First Proof 網站上公布。
這些發現緊隨近期 AI 在解決數學問題方面取得的突破之後。例如,上個月,舊金山科技公司 OpenAI 開發的一款聊天機器人,解決了已故數學家保羅·艾狄胥(Paul Erdős)提出的、懸而未決 80 年的數學難題。First Proof 團隊表示,未來迭代的測試將有助於研究人員評估 AI 模型對數學家的實用性,例如在自主解決問題、驗證證明或充當研究助手等方面。
First Proof 測試的一項重要創新是,這些問題此前從未在已發表的文獻或網路上出現過,這降低了模型可能只是重複其訓練過程中學到的資訊的風險。取而代之的是,來自廣泛數學領域的十位研究人員,各自提供了一個他們在其自身研究過程中已解決但尚未發表的數學問題。
First Proof 在 2 月份進行了一次試驗性測試,使用了一批不同的新穎問題。在那輪測試中,任何人都可以嘗試使用自己偏好的 AI 系統來解決這些問題,許多團隊也確實這樣做了——但結果並未得到 First Proof 團隊的正式驗證。此外,也無法獨立驗證 AI 是否得到了人類的任何幫助。
此次,First Proof 團隊親自進行了測試:團隊要求模型以完全自主的方式解決問題,並由 30 位數學家組成的團隊審查答案。卡內基梅隆大學(Carnegie Mellon University)計算輔助數學推理研究所所長、數學家傑瑞米·阿維加德(Jeremy Avigad)表示:「組織者顯然對第二批測試進行了更仔細的考量,使其更具控制性和系統性。」
另一項規則是,參與測試的模型必須是公開可用的。這意味著,專門為解決數學問題而設計的 Google 系統 Aletheia,以及舊金山公司 Anthropic 開發的 Claude Mythos 的完整未發布版本,都無法參與測試。OpenAI 是唯一參與的大公司,其模型為 ChatGPT 5.5 Pro。
其他系統則由三個學術團隊提供,分別來自加州大學洛杉磯分校(UCLA)、普林斯頓大學(Princeton University)和瑞士聯邦理工學院(ETH Zurich)。這三個團隊都在現有的聊天機器人(如 ChatGPT、Google 的 Gemini 和公開版本的 Anthropic Claude)之上構建了「線束」(harness)。(線束是一種自動化系統,它向聊天機器人提問,並由另一個聊天機器人驗證答案,通常會進行反覆的來回溝通。)
瑞士聯邦理工學院團隊的模型表現最佳,在十個問題中解決了六個,其系統採用了 ChatGPT 的答案,並由一個由所有三個主要聊天機器人組成的「諮詢委員會」進行審查或改進。加州大學洛杉磯分校團隊(在 ChatGPT 上構建了線束)位居第二,其次是 OpenAI 團隊(僅使用 ChatGPT,無線束),以及普林斯頓團隊(使用 Gemini 3.1 Pro 作為後端的主要線束)。
參與 ETH 團隊的數學家約翰內斯·施密特(Johannes Schmitt)表示,為了在比賽前微調他們的系統,他和他的合作者聯繫了更廣泛的數學界,並徵求問題。「回應非常熱烈:幾天內我們就收到了 30 個提交的問題,涵蓋了各種數學領域,人們非常好奇且思想開放。」
ETH 團隊還對四個參賽模型均未能解決的三個 First Proof 問題進行了初步調查。施密特說,在某些情況下,似乎是系統「缺少了人類解決方案所使用的、能夠彌補最後差距的一個關鍵且出乎意料的想法」。他說:「對於其他問題,方法的基礎架構是正確的,但系統未能完全處理好所有細節。」
哈佛大學數學家、First Proof 團隊成員勞倫·威廉姆斯(Lauren Williams)表示:「目前尚不清楚未解決的問題是否必然比其他問題更難。」她補充說:「我認為未被解決的問題往往只是距離更遠——無論是在主題內容還是證明思路上——與先前文獻中出現過的事物相比。」
AI 模型還容易出現「幻覺」(產生事實上不正確的輸出),即使被明確告知要檢查其參考文獻——這是大型語言模型的一個已知問題。威廉姆斯表示,她對所有 AI 模型答案中「明顯」的引用不足感到驚訝,尤其是在問題 2 的情況下,該問題有幾個模型通過模仿過去人類解決類似問題的方式來解決。「有幾個解決方案在某些地方逐字複製了前一篇論文的措辭,並重複使用了精確的符號和術語——但從未引用過該論文。」
既然 First Proof 的問題已經公布,那些未正式參與的公司可能會利用這些問題來非正式地測試他們自己的系統。英國劍橋大學數學家凱文·巴雷托(Kevin Barreto)表示,他「個人很樂意看到這三個實驗室的內部模型受到測試,只是想看看目前的實際前沿在哪裡」。