謎題和遊戲自 AI 發展初期以來一直是核心。正如我們人類喜歡透過填字遊戲或邏輯謎題來測試自己的智慧,開發人員也可以透過一系列遊戲來測試模型進展的程度。「機器學習」一詞在 IBM 計算機科學家 Arthur Samuel 於 1959 年發表的關於學習下棋演算法的文章中廣為流傳。西洋棋和中國的圍棋也是著名的 AI 測試平台。

僅從解謎技巧來看,AI 的進步非常顯著且迅速。在 2024 年底,哥倫比亞大學的一個科學家團隊展示,即使是最好的模型也只能解出臭名昭著的《紐約時報》連線謎題(Connections)的 18%;到了 2025 年初,有些模型幾乎每次都能完美解決。

但謎題的作用不僅僅是突顯 AI 能力的不可阻擋的進步。了解模型在哪裡成功、在哪裡失敗——以及我們人類在哪裡仍然勝過它們——可以提供一個有用的視窗,讓我們了解這項技術的優勢和劣勢。儘管取得了進展,今天的模型仍然會出錯:經典謎語中的細微變化常常讓它們陷入困境,而視覺謎題更是它們的特別弱點。

在這裡,您將有機會測試您在曾經讓模型難倒的謎題上的智慧。有些可能對您來說和對 AI 一樣棘手;有些則如此簡單,會讓您懷疑 AI 究竟是否真的聰明。每一個謎題都至少突顯了一種機器與人類認知差異的方式。如果您能完美通過測試,您就證明了您能夠在解謎方面勝過 AI——至少目前是這樣。

讓我們從人類具有巨大優勢的領域開始:空間推理。如果您曾經做過智力測驗,您可能做過心像旋轉問題。這些謎題要求您判斷不同的圖像是否代表同一個物體,只是從不同的角度來看。儘管今天的語言模型通常能夠分析視覺輸入,但它們在這些謎題上仍然表現得非常糟糕。儘管人們常談論世界模型如何幫助 AI 理解物理環境,但大型語言模型似乎仍然無法像建築師和機械工程師等空間思維者那樣操作 3D 物體。

說明:選擇能顯示提示中物體,但從不同角度呈現的答案。每種情況下只有一個正確答案!

前沿的大型語言模型擁有非凡的記憶力;它們在訓練過程中接觸了海量的資訊,並且能夠忠實地背誦其中許多。這對於在知識問答方面勝過人類來說是一項優勢,但它也可能成為一種劣勢。當一個謎題與模型在訓練期間見過的謎題非常相似時,模型可能會忽略關鍵差異,並以其記憶的內容來回應。

這在 2024 年的一項研究中得到了證實,該研究由 Google 和伊利諾伊大學厄巴納-香檳分校的研究人員進行,他們訓練並測試了模型對一種經典謎題類型「騎士與騙子」(Knights and Knaves)的細微變體。在這些問題中,有些角色總是說真話,有些總是說謊,您必須找出誰是誰。同樣的原理也可能適用於一項名為 SimpleBench 的測試。這些問題類似於模型在訓練中可能遇到的更複雜的問題。人類能發現其中的詭計,但即使是頂級模型也會出錯。

說明:您需要知道的唯一解決這些謎題的知識是,騎士總是說真話,騙子總是說謊。根據每個角色的陳述來判斷他們是誰。

華萊士說:愛德華說真話。

愛德華說:華萊士和我屬於同一種類型。

法蘭辛說:愛麗絲說真話。

羅伯特說:文森不是我這種類型。

說明:仔細閱讀這些 SimpleBench 問題,您應該能很快找出答案。

AI 不僅會搞砸 3D 視覺問題——2D 問題也會讓它陷入困境。這是模型在最著名的基於謎題的基準測試 ARC-AGI 上表現好壞的一個主要因素。這些問題要求您從一組範例中推斷出抽象的、通用的規則。當模型接收到的每個網格不是圖像而是編碼了每個單元格顏色的數字字串時,它們在 ARC 謎題上的表現會更好。

研究表明,即使模型正確回答了 ARC-AGI 問題,它們也常常使用複雜且不可推廣的規則來做到這一點,而人類則依賴簡單的視覺概念。儘管存在這些劣勢,模型在過去一年中在 ARC-AGI 上已經做得相當不錯,但有些謎題——例如這裡印製的謎題——仍然讓它們感到困惑。

說明:研究下面三對網格,找出決定左側網格如何轉換為右側網格的規則。然後拿出您的馬克筆或彩色鉛筆,使用該規則填寫第四個網格。(無論網格如何定向,解決方案都是相同的。)

不僅 AI 模型會陷入陷阱。我們人類也有自己的認知弱點,其中許多是 AI 所不具備的。心理學家設計了一系列問題,顛倒了 SimpleBench 現象:對於這些問題,人類常常會給出條件反射式的答案,而模型則會深思熟慮地回應。其中一些問題利用了我們直覺上進行數學運算時的錯誤;另一些問題的措辭則暗示了明顯的答案,但如果仔細閱讀問題,這些答案就會失效。

說明:盡快回答以下問題。

在某些情況下,大型語言模型能否完成謎題取決於規模。蘋果公司研究人員的一項研究發現,大型語言模型可以輕鬆解決簡單版的「河內塔」問題(Tower of Hanoi),該問題涉及一次移動一疊圓盤,且從未將較大的圓盤放在較小的圓盤之上,以及「過河問題」(river-crossing puzzles),其中一群人必須根據某些規則過河。但這只是一個極限:當圓盤或人數達到六個或更高時,模型就開始 falter。

在另一項研究中,華盛頓大學、史丹佛大學和艾倫人工智能研究所的研究人員觀察到,大型語言模型在邏輯網格謎題(logic grid puzzles)上也面臨類似的困難,這些謎題需要從一系列線索中推斷出一組個人的屬性。蘋果公司的論文廣為流傳,但評論員質疑這些結果是否揭示了大型語言模型推理的獨特限制——或者只是隨著複雜性的堆積而犯錯是正常的。

說明:使用提供的場景,規劃將所有人送過河所需的行程。

說明:使用線索列表,確定每個人住在哪個房子以及他們喜歡哪種音樂風格。只有一個可能的解決方案。您可能會發現填寫下面的網格來記錄您的推論很有幫助。

點擊一個單元格以標記 X,再次點擊以標記勾號。