我正在進行一場持續性的 AI 編程競賽,將各大語言模型置於實時編程任務中進行對決,並以客觀分數進行評比。第 12 天的項目是「單詞寶石拼圖」。共有十個模型參賽。結果並非大多數人所預料。

來自中國新創公司 Moonshot AI 的開源模型 Kimi K2.6,以 22 分、7勝1負0平的成績,直接贏得了這場挑戰賽。小米的 MiMo V2-Pro 獲得第二名。GPT-5.5 位列第三。Claude Opus 4.7 排名第五。來自西方前沿實驗室的每一個模型都落後於前兩名。

「單詞寶石拼圖」是一個滑動式字母方塊拼圖。棋盤是一個矩形網格(10×10、15×15、20×20、25×25 或 30×30),填滿了字母方塊和一個空格。機器人可以將任何相鄰的方塊滑入空格,並隨時聲稱由水平或垂直直線組成的有效英文單詞。對角線不計分。反向拼寫不計分。

計分規則獎勵較長的單詞並懲罰較短的單詞。七個字母以下的單詞會扣分:五字母單詞扣一分,三字母單詞扣三分。七個或更多字母的單詞,得分為其長度減去六,因此八字母單詞值兩分。相同的單詞只能聲稱一次;如果其他機器人先聲稱,你將一無所獲。每對模型進行五輪比賽,每輪對應一個棋盤尺寸,每輪有十秒的時鐘限制。

棋盤以真實字典單詞以填字遊戲風格佈局填充,然後剩餘單元格用根據 Scrabble 字母頻率加權的字母填充,最後打亂空格,在較大的棋盤上打亂得更劇烈。在 10×10 的棋盤上,許多初始單詞得以保留。在 30×30 的棋盤上,幾乎沒有單詞得以保留。這被證明非常重要。

Nvidia 的 Nemotron Super 3 生成的代碼包含語法錯誤,因此未能連接到遊戲伺服器。實際上只有九個模型參與了競賽。

Kimi K2.6 是開源的,可從 2023 年成立的中國新創公司 Moonshot AI 公開取得。MiMo V2-Pro 目前僅提供 API;此處連結的推文是小米確認其較新的 V2.5 Pro 模型權重即將發布。[1] https://x.com/XiaomiMiMo/status/2047840164777726076 來自 Anthropic、OpenAI、Google 和 xAI 的模型分列第三至第七名。來自中國實驗室智譜 AI 的 GLM 5.1 排名第四。DeepSeek 排名第八。這並非一個簡單的中國擊敗西方的故事;而是兩個特定的模型獲勝。

移動日誌講述了故事。Kimi 透過積極滑動獲勝。它的方法是貪婪的:根據每個可能移動解鎖的新正分單詞來評估,執行最佳移動,然後重複。當沒有移動解鎖正分單詞時,它會回退到字母順序上的第一個合法方向。這導致了一些效率低下的邊緣振盪,一種 2-循環模式,機器人在空格之間來回彈跳而沒有進展。在初始單詞仍然基本完整的較小棋盤上,這造成了損害。在 30×30 的棋盤上,由於打亂幾乎破壞了一切,重建是獲得分數的唯一途徑,大量的滑動最終得到了回報。Kimi 的累計得分 77 分是比賽中的最高分。

MiMo 的滑動代碼存在於儲存庫中,但其「最佳價值大於零」的閾值從未觸發,因此實際上它一次都沒有滑動。它直接掃描初始棋盤尋找七個字母或以上的單詞,並在單個 TCP 數據包中發送了所有聲稱。這是一種脆弱的策略:完全依賴於打亂保留了初始單詞。在單詞得以保留的棋盤上,MiMo 迅速清理。在單詞未能保留的棋盤上,它一分未得。最終得分:累計 43 分,第二名。

Claude 也沒有滑動。移動日誌顯示它在 25×25 的棋盤上表現良好,因為打亂密度仍然可控,但在 30×30 的棋盤上則崩潰了,因為在這種情況下需要實際的方塊移動。在一個圍繞滑動建立的拼圖中,不滑動是一個真正的限制。

GPT-5.5 則更為保守,每輪大約滑動 120 次,並設有上限以避免過度操作,在 15×15 和 30×30 的棋盤上表現出最強的數字。Grok 也從未滑動,但在較大的棋盤上得分尚可。GLM 是整個比賽中最積極的滑動者,總計超過 80 萬次滑動,但一旦耗盡正分移動就嚴重停滯。

DeepSeek 每輪都發送了格式錯誤的數據。零有用輸出。至少它沒有透過比賽讓情況變得更糟。

計分系統懲罰短單詞:三字母單詞扣三分,四字母單詞扣兩分,五字母單詞扣一分。目的是阻止機器人用地毯式轟炸的方式用「the」、「and」和「it」等詞填滿棋盤。每一個嚴肅的競爭者都將其字典過濾為七個字母或以上的單詞。Muse 聲稱了一切。它能找到的每一個單詞,無論長度如何,都被發送為聲稱。

其累計得分為 -15,309 分。它輸掉了所有八場比賽,贏得了零輪。有一個版本的 Muse 僅連接到伺服器並且什麼也沒做,該版本將得分為零,這是一個 15,309 分的提升。Muse 與第八名之間的差距比第八名與第一名之間的差距還要大。

DeepSeek 的格式錯誤輸出告訴你一些關於它在時間壓力下如何處理新協議規範的資訊。Muse 的螺旋式下降則告訴你不同的東西:它看到了有效的單詞並聲稱了它們,但似乎沒有考慮到在計分規則下「有效」的含義。它部分地讀取了任務,並完全執行了該部分讀取。對於任何在有懲罰的結構化任務上部署這些模型的人來說,這都值得注意。

我設計了這些挑戰,因此對它們測試的內容有合理的了解。我沒有完全預料到的是,30×30 的棋盤會如此鮮明地區分開參賽者。在較小的棋盤上,靜態掃描器和活動滑動器之間的差異很小。在全尺寸棋盤上,只能找到現有內容的模型已經無路可走。Kimi 的貪婪循環,儘管有缺陷,但在靜態掃描器無可聲稱時,它仍然在產生輸出。

另一件值得注意的事情是:MiMo 和 Kimi 的得分僅相差兩分,儘管它們做了幾乎相反的事情。同一個拼圖的兩種不同理論,結果幾乎相同。這意味著第一名和第二名之間的差距部分是初始種子變異,而不僅僅是能力差異。

一個公平的反駁是:這個計分系統獎勵積極的單詞聲稱,而高度安全調整的模型可能對這種地毯式轟炸更為保守。如果是這樣,結果反映了任務設計與對齊模型行為之間的錯配,而不是原始能力。這是一個合理的反對意見。它並不改變結果。

一場挑戰並不能推翻一般的基準測試。這個拼圖測試實時決策能力,以及模型是否能編寫乾淨的功能代碼,該代碼可以連接到 TCP 伺服器並正確地玩一個新穎的遊戲。它不測試長上下文推理或根據規範生成代碼。

但我運行這些挑戰的時間足夠長,足以注意到正在發生的變化。一年前,人們認為西方前沿實驗室在能力上領先,開源模型無法追趕。Kimi K2.6 現在在 Artificial Analysis Intelligence Index 上得分為 54。GPT-5.5 得分為 60,Claude 得分為 57。這不是平價,但已經很接近了,而且這來自一個任何人都可以下載的模型。

當與前沿模型僅有幾分之差的模型也可以免費在本地運行時,這就形成了一種與一年前不同的競爭格局。這場挑戰是這一轉變中的一個數據點。差距現在足夠小,以至於在這次的結果中顯現出來。

Rohana Rezel 負責 AI Coding Contest,是一位居住在加拿大卑詩省溫哥華的技術專家、研究員和社群領袖。