Jev風格模型能提供校準過的決策概率,但準確度較低。因此,許多流程會依賴推理模型作為備援。Jeeves訓練了一個類似Jev的Qwen3.5-9B模型(使用LoRA與指標頭),利用CISPO在做決策前進行推理。

這使得模型在跨領域任務上的表現更佳,並且在公開的JevBench難題中優於Jev模型。

在思考模式下,使用貪婪策略並限制2,560字元的輸入長度,Kev-9B與Jev欄位的數據為Kev發布的結果。

* Kev-9B尚未發布JevBench結果,現有為Kev-8B(Qwen3)。

所有JevBench數據均基於公開的簡易、標準與困難三個層級(共231項目),不包含封閉評測層級,且Jev與Kev數據均限於相同公開項目。

同一檢查點在無思考模式下於測試集(2,962項目)得分為0.804,啟用思考後提升至0.840。

系統需求為Python 3.12與CUDA GPU。

可下載已發布權重並進行部署,或將自行訓練的檢查點融合成獨立模型並搭配drafter服務。

請以Jev格式發送請求:

在一張H100(FP8)上,三個問題可並行思考並回應。

sdk/為Jev Python SDK(typesafe-sdk)的替代方案:

客戶端預設連接http://127.0.0.1:8009(或透過JEEVES_BASE_URL設定),無需API金鑰,等待時間最長120秒。

options為選填,若Jev客戶端未傳送則忽略。伺服器預設值可透過相應serve參數設定。

問題、狀態與答案會載入Qwen聊天模板中。

模型接著展開推理鏈,並在</think>標記後附加結果。

指標頭會根據<decide>位置隱藏狀態的查詢投影與各選項</opt>位置隱藏狀態的鍵投影,計算縮放點積分數。

這些標記在Qwen分詞器中較少使用。消融實驗發現,若在提示中改用純文字如“State”反而降低表現,且推理區塊後不重複問題也會影響準確度。最終概率為選項分數的softmax,並以在開發集上擬合的溫度參數調整。

在第402步停止可維持最佳校準與開發集分數,超過此步驟指標頭會因強化學習池飽和而過度銳化。

drafter/資料夾中為凍結模型的擴散視圖,靈感來自Orthrus。

與僅支援注意力模型的Orthrus不同,Jeeves支援Qwen3.5的Gated DeltaNet層,允許遮罩標記跨層關注這些層的卷積後鍵值。

預設使用第4區塊,因為多問題批次時成本較低。

可使用prep腳本在本地建立資料集,會從Hugging Face下載公開資料集,版本固定於prep/public.py中。

每個公開資料集均遵守其原始授權。

在8張GPU且資料置於data/資料夾時,執行bash run.sh即可完成整個流程。

若使用Jeeves、其訓練配方或drafter,請務必引用:

Jeeves – Reasoning improves Jev-like decision models

Jeeves:結合推理提升Jev風格決策模型的準確度Jeeves:結合推理提升Jev風格決策模型的準確度Jeeves:結合推理提升Jev風格決策模型的準確度