數十年來,化學家一直依賴分子沸點的參考手冊數值來識別物質和規劃蒸餾等製程。但一個人工智慧模型揭示,一個值得信賴的參考資料庫中的某些數值一直以來都是錯誤的。
中國浙江實驗室的理論化學家 Sebastian Pios 在使用 AI 系統預測數個分子沸點時,該系統開始產生與一個已有 75 年歷史的參考資料庫中長期接受的條目相衝突的值。起初,他認為是模型出錯。但當他手動檢查原始文獻後,他發現是參考資料有誤,而非 AI 模型。
Pios 的 AI 模型在另外兩個案例中,也發現了舊論文和參考書籍中的錯誤——這些錯誤已進入科學的體系。其中一個是論文中的印刷錯誤;另一個是百年來沸點測量值的錯誤。Pios 表示,這兩項錯誤很可能給使用該資料庫的研究人員「帶來了很大的麻煩」。
Pios 是越來越多利用 AI 作為審核科學知識工具的科學家之一。除了檢查資料庫,研究人員還在使用專門的 AI 工具來搜尋期刊和會議上發表的論文中的錯誤。
AI、同行評審與科學的人類活動
在 7 月 22 日發布的一項分析中,位於德拉瓦州的營利性研究審查公司 SAI Labs 的研究人員,使用 AI 代理評估了 2026 年國際機器學習會議(ICML)上選為口頭報告的 168 篇論文。AI 代理提取了作者的核心主張,下載了相關資源,在可能的情況下重新運行了實驗,並將結果與作者報告的結果進行了比較。
在至少有五項可供評估主張的 92 篇論文中,AI 代理僅從 8 篇論文中成功重現了超過 80% 的主張。在 34 篇論文中,AI 代理能夠重現超過五項主張中的兩項。
挪威科技大學的電腦科學家 Odd Erik Gundersen 表示,但這類 AI 事實核查工具仍然是科學文獻不可靠的仲裁者。他表示,這些工具「也會犯像人類一樣的錯誤」,這就是為什麼 AI 事實核查工具的品質必須經過人工處理並由人類監督。
許多研究人員已經投入時間來發現論文中的錯誤,並使用工具來檢查論文的某些方面。加州史丹佛大學的電腦科學家 James Zou 表示,使用 AI 的一個優勢是它能比人類更快地掃描科學資料庫和文獻。「最大的區別在於能夠以前所未有的規模進行。」
在預印本伺服器 arXiv 上發布的一項研究中,Zou 和他的同事使用了一個「AI 檢查器」來掃描 NeurIPS——一個著名的年度 AI 研究會議上發表的論文,尋找錯誤。他們的工具發現,論文中的錯誤從 2021 年的 3.8 個增加到 2025 年的 5.9 個,增長了 55%。
Zou 說:「這些是已經發表的論文,所以它們被視為下一代研究的基礎知識。」他補充說:「如果這些基礎有錯誤,這可能會傳播並使後續研究更加不穩定。」
該分析側重於「客觀」錯誤,例如公式、計算和圖表中的錯誤,並排除了關於數據解釋和新穎性的主觀錯誤。共同作者、舊金山 Together AI 的機器學習科學家 Federico Bianchi 表示,這是一個設計選擇。「AI 不應該做所有事情,而應將新穎性和重要性的選擇留給人類。」