若對儲存庫有疑問,請在「討論」分頁開啟討論串或提出 issue。
系列測試正在進行中。第一天是 2026 年 9 月 24 日 22:10 UTC,大約在發布後 2.5 天。它每天運行一次,持續 30 天:第 1-10 天是基準線,然後是兩個 10 天的視窗,因此第一次可能的呼叫大約在 2026 年 10 月 24 日。第一個結果列會在第 20 天後出現。測試面板已根據預先註冊的協議 (v2) 選定、確認、鎖定並驗證。以下所有數字均由 docs/CALIBRATION.md 中的日誌生成。
進度 (2026-09-29):已收集 30 天中的 6 天 (基準線 10 天中的 6 天),無遺漏。所有 6 天都在相同的硬體雜湊值 (461391b6fce64167) 和固定的指令列 (2.1.280) 上運行了完整的 90 個樣本。第 5 天的預算保護程式被覆蓋一次 (請參閱偏差日誌)。
此儲存庫將主要維護一個持續的 10 天表格,顯示 Opus 5.5 在校準測試面板上的表現相對於其發布週基準線。負值表示比發布週差。該表格同樣會大聲報告改進和退化。
主要指標是校準面板上與基準線的配對項目分數差異,並包含叢集標準誤,因此項目難度會被排除。請參閱 PREREGISTRATION.md。我最關心的次要信號是每個樣本的輸出 token 數量。如果模型悄悄地開始思考得更少,這通常是第一個顯示出來的地方,甚至在準確性移動之前。
固定指令列。這不是可選的:Claude Code 更新會改變硬體,而改變的硬體看起來就像改變的模型。關閉自動更新並記下你固定的版本:
運行器如果 claude --version 停止匹配該文件,將拒絕運行。Claude Code 仍可能自行更新,因此請將固定二進位檔的副本保存在更新程式無法觸及的地方。livenerf 會自動使用它 (或設定 LIVENERF_CLAUDE_CLI 為任何路徑):
Max 方案不會發布其 token 限制。livenerf 讀取與 /usage 顯示相同的百分比計量器,使用你的本機 Claude Code 登入 (僅限讀取請求):
以下所有預算均以每週計量器的點數表示,因此基準測試佔用你方案的固定比例,且從不與正常使用競爭。
在第一次系列運行之前,提交設計和預先註冊,然後推送。公開的 git 時間戳記賦予預先註冊意義。然後確認一切就緒:指令列固定、計量器、鎖定的面板、通過驗證、乾淨的推送樹和即時的獨立性探測:
然後開始計時。整個面板每天運行一次,持續 30 天,加上控制組。如果你的每週計量器達到或超過 75% 或你的 5 小時計量器達到或超過 60%,則會跳過一次嘗試,並每小時重試,直到當天的運行完成:
你無法從 Opus 5.5 獲得兩次相同的答案,因此整個設計都是關於獲得一個你可以信任的分布,注意到它何時移動,並盡可能少地花費計算資源來做到這一點。
每個基準測試圖表顯示每個組別和家族相對於其自身基準線的變化,以及輸出 token 的變化。如果模型悄悄地開始思考得更少,token 數量通常是第一個顯示出來的地方:
在任何系列數據之前,都會提交 PREREGISTRATION.md。它涵蓋了項目選擇程序、驗證檢查、主要指標、決策規則和次要指標列表,因此 git 時間戳記是公開的。只有當 99% 的區間在連續兩個 10 天視窗中排除了零,並且影響至少為 3 個點,並且控制組沒有顯示相同的移動時,才會將其稱為變化。無效結果也會被發布。改進也是如此。
livenerf 的目標是狹窄的:一個模型、一個硬體、一個乾淨的時間序列,當有人惡意閱讀時也能站得住腳。它不是排行榜,也不是評估框架。只有當一個任務可以精確評分、落在 30-70% 的範圍內,並且足夠便宜可以每天運行時,它才屬於這裡。對任務、提示或評分器的任何更改都會創建一個新版本,絕不會靜默替換舊版本。
凍結的面板項目保持私密 (僅發布其雜湊值),因此請勿提交添加項目的 PR。歡迎提交添加程序生成器、評分器或分析的 PR。
當前 AI 政策:披露。提交 PR 時,請聲明任何有大量 LLM 貢獻的部分。值得一提的是:這個儲存庫的許多部分都是在 Claude 的幫助下編寫的,而 Claude 正是正在被測量的模型。這正是評分器是純函數、閾值預先註冊、原始數據公開的原因。你不必信任作者,無論是人類還是其他。
如果你發現 livenerf 在你的研究中有幫助,請引用如下:
Benchmark for tracking model capability after release.