追蹤旗艦 AI 模型隨時間變化的公開 Elo 生命週期,以揭示潛在的「削弱」現象。
AI 實驗室經常在模型發布後進行更新,使用者也定期回報感知到的「削弱」:過度的量化(以節省運算成本)、嚴格的審查或行為退化。此圖表將每個旗艦模型的公開 Elo 生命週期繪製在同一時間線上,以便一目了然地顯示任何此類趨勢。
數據每日從 Hugging Face 上的官方 Arena AI 排行榜資料集獲取,該資料集由數千次匿名的眾包頭對頭人類投票建立。這是一個不完美的視角(參見下方的注意事項),但目前是可獲得的最一致的長期訊號。
每個實驗室都有完全相同的曲線。圖表上方的開關可以切換該曲線在每個時間點如何選擇實驗室的活躍模型。
Arena 透過 API 端點測試模型,即「原始」模型。消費者聊天介面(gemini.com、chatgpt.com 等)添加了系統提示、安全過濾器和 UI 包裝器,這些在原始 API 中並不存在,且供應商在負載下可能會悄悄切換到量化(低精度)版本。這些產品中感知到的「削弱」可能不會在此處顯示。
評分是相對於排行榜上其他模型的變化。當更強的模型進入(或同儕改進)時,未更改的模型 Elo 可能會下降;反之,如果所有模型同時退步,Elo 將無法顯示。一個固定的基準縱向數據集會更清晰,但似乎沒有這樣的公開檔案存在。