我個人以及我訪談過的同事都認為,與 Opus 4.7、Opus 4.8 和 Fable 相比,使用 Opus 5 的體驗就像是退步了。

我並非聲稱其能力有所倒退——它確實比 Opus 4.7 和 Opus 4.8 更強大,甚至在基準測試中能與 Fable 匹敵,但其他模型的使用體驗卻更好。我認為這是因為它們:

因此,它們不需要像 Opus 5 那樣小心翼翼地照看。

我懷疑這是 Anthropic 和目前前沿實驗室普遍存在的兩種複合因素的結果。

首先,是創造一個能夠透過遞歸自我提升達到 AGI/ASI 的 AI 的願望。

其次,是在基準測試中取得高分的壓力。儘管眾所周知許多基準測試任務定義不清、不公平、容易被破解或有其他缺陷,但一個好的基準測試任務是獨立的。它可以被解決。它不需要提示、讀取任務創建者的想法或外部資訊就能通過。

這並不意味著一個好的任務只能有一個正確答案,只是它應該對所有明確無誤的正確答案給予相同的評分。

選擇在基準測試中表現良好的模型(實際上,訓練它們或一般訓練 RLHF 任務)本質上是選擇那些在模糊不清的情況下做出大膽、通常正確假設的模型。它懲罰了那些傾向於停下來尋求澄清或指示的模型。

不幸的是,這恰恰是我們大多數人對程式碼代理(coding agent)的期望。

無論你多麼努力,幾乎不可能將所有上下文、意圖、商業影響、預算限制以及其他等等都寫下來並提供給程式碼代理。總會有模糊不清的地方和需要做出的選擇,而當代理能夠在需要時停下來詢問,這將是很有幫助的。

現實生活根本不是基準測試。並非每個問題都有保證的正確答案,甚至沒有一套正確答案,而且在現實後果的壓力下,我不希望代理做出牠的最佳猜測!