過去幾週,圍繞決策模型如 Typesafe AI 的 Jev System One 模型引起了廣泛討論。雖然分類器模型已存在一段時間,Jev 則在 AI 領域引入了一種新型決策模型概念——一種能夠廉價、快速且穩定產生有界結構化輸出的模型,可在需要決策時加入工作流程中。這些模型能夠處理任意輸入集合,無需不斷重新訓練以納入新的分類類別。這與大型語言模型(LLM)形成對比,後者多為非確定性,但足夠開放以推理並生成文本及工具調用以執行代理任務。

今天,我們發布了兩款由 Cloudflare 訓練的決策模型 Clef 與 Clef-flash,並托管於 Workers AI 平台。Clef 在 Jev 決策指數評測中目前排名第一,完整結果可於線上基準測試演示網站查看。這些模型更智能、更快速,且完全兼容 Jev API,方便用戶輕鬆試用。我們也在 Hugging Face 以 Apache 2.0 授權開源這些模型,供用戶本地運行與實驗。

此外,我們很高興推出新的強化學習(RL)產品,允許客戶微調 Clef 以符合其特定使用需求。

決策模型根據特定概率進行分類,幫助代理決定如何行動。例如,輸入一則客戶支持訊息,判斷其是否緊急及應由哪個團隊處理。決策模型會返回帶有概率的類型化答案,供程式碼用於路由工單、觸發升級或交由人工處理。這意味著代理決策不必總是有人介入,代理可程式化地收集上下文、做出決策並執行任務,必要時再交由人工。

在 Cloudflare,我們已在威脅情報團隊測試 Clef 模型協助分類網站域名。輸入一個域名(搭配 Browser Run),Clef 能快速識別該域名所屬類別,例如以 95% 機率判定為時尚網站、85% 電子商務、低於 1% 網路釣魚等。此分類過程 Clef 僅需 2.2 秒完成網站抓取、渲染與分類。相比之下,我們最快的通用 LLM gpt-oss-120b 在相同流程中耗時 4.7 秒,且僅返回兩項分類。用戶可想像,延遲減半且結果更豐富,如何助力威脅情報流程更快識別惡意或合法域名。將此應用於任何需快速程式決策的場景,即可解鎖強大代理工作流程,實現自主決策、推理與執行。

在音樂理論中,譜號是放置於五線譜起始處的符號,指定線條與空格的音高名稱。決策模型類似譜號,因為它定義了上下文領域及隨後的行動。我們選擇 Clef 作為決策模型家族名稱,既因其功能相似,也呼應 Cloudflare 的縮寫 CF。

儘管市場上決策模型日益飽和,Clef 具備幾項獨特特性令我們樂於公開發布。首先,它具備視覺編碼器,能處理影像並分類視覺內容,這是 Jev 目前僅做文本分類所不具備的。其次,我們模型擁有 64k 的上下文窗口(Jev 為 32k),允許用戶輸入更多狀態供模型分類。

第三,我們的模型準確且強大,在多項品質基準測試中與市場上其他決策模型競爭力十足。以下列出部分根據 Jev 決策指數定義的重要評估,並對市場熱門模型進行評分。詳細基準可參考下表或線上決策指數演示網站。

我們也在 Typesafe 自有評測套件中進行測試,Clef 模型表現良好,在四項中擊敗 Jev 三項。尤其是 Clef-flash 表現出色,速度極快。

在我們執行的 43 項評測中,Clef 模型在延遲方面優於其他決策模型(除極速但品質折衷的 Laya 外)。

除了模型本身的延遲優勢,Clef 模型托管於 Workers AI,利用 Cloudflare 邊緣基礎設施的 GPU,實現低網路延遲與更快決策。這意味著可將 Clef 放入代理決策的熱路徑,並結合 Workers AI 上的 LLM 進行行動執行。

Clef 產生嚴格類型化輸出,與 Jev 完全 API 兼容,方便用戶輕鬆替換。較大的 Clef 模型適合精確度要求高的場景,Clef-flash 則適合延遲敏感的決策。這些模型企業級準備完善,我們保證不會讀取、存儲或用您的請求與回應進行訓練(除非您使用我們的微調產品,詳情如下)。您可從開發者文件開始使用 Clef,或在 Hugging Face 倉庫試玩開源模型。

若需協助微調 Clef 以符合特定工作負載,我們提供微調服務,初期由前線部署工程師(FDE)團隊親自協助,未來將推出自助微調平台,讓客戶能在 Cloudflare 上訓練並重新部署模型。

Jev 發布當週,我們分享了自家決策模型的實驗,展示如何改造 DiffusionGemma 模型以透過大型語言模型生成的對數概率輸出確定性概率。我們的初步方法基於 Matt Mastracci 的獨立研究,他在機器學習社群積極分享新想法並為 vLLM 推理引擎提交拉取請求,強化 DiffusionGemma 支援。

Clef 建立在此概念之上,但採用不同的基礎模型作為骨幹。目前使用 Qwen 作為基礎模型,並進行後訓練以適應決策模型應用。推理時,Clef 先用 Qwen 進行預填充,然後並行評分有效的結構選項。決策步驟為非自回歸,無需逐字生成中間文本,使 Clef 顯著快於自回歸 LLM。Clef 與 Clef-flash 直接從內部骨幹表示推導結構化選項,而非生成中間文本。此方法依賴專門的兩階段注意力路由:每個有效選項提取與提示相關的上下文,允許各欄位參數交叉注意其他欄位及原始輸入,然後進行評分。透過詞彙先驗,模型保持選項間語義意圖。最終架構結合選項特定證據路由、跨欄位聯合注意力與結構約束評分。

我們凍結 Qwen3.8-27B 用於 Clef,Qwen3.5-9B 用於 Clef-flash,並聯合優化路由頭與 rank-256 低秩適配器。後訓練採用標籤平滑交叉熵處理有效結構輸出,搭配 Brier 損失優化概率校準。訓練使用內部合成數據集,透過欄位順序、提示與結構排列組合。我們還開發了校準決策強化學習(RLCD)作為次優化目標,對相鄰序數選項給予部分獎勵,精確記錄輸出給予全額獎勵,並施加參考懲罰防止分布偏移,提升準確度與泛化能力。

這使我們在 Clef 上實現了幾項創新:提升分類準確度,限制輸出僅為概率而非文本生成,且速度快於 Jev 與基礎 Qwen 模型。

我們聽到許多內部用例需微調 Clef 以整合至 Cloudflare 代理工作流程。例如,內部團隊希望分類器能評估信任與安全提交、協助分流支援請求,甚至內建於 Bot 產品判斷爬蟲是良性還是惡意。

這些用例極為特定,我們擁有多年標註決策數據可用於訓練專用分類器。微調模型時,可能會犧牲部分通用性能以換取特定領域更高準確度。Cloudflare 擁有超過 15 年跨域網路數據,能微調模型以符合特定需求,準確且快速勝過通用 Clef 模型。我們正與內部團隊合作,探索如何後訓練 Clef,打造強大機器學習模型,提升 Cloudflare 效能與工作流程。這些內部團隊與用例是我們新 FDE 微調團隊與強化學習產品的下一階段重點。

我們提供服務協助客戶微調 Clef,配合 FDE 團隊親自協助。從中學習經驗後,我們將打造自助平台,讓客戶能捕捉數據、微調並重新部署模型,全部在 Cloudflare 上完成。

這其實是長期規劃——我們一直在建構 AI 平台的基礎元件,以便打造自訂強化學習產品。Jev 的興起顯示市場對快速、小型、專用分類模型的需求,我們選擇此作為切入點開始實驗強化學習環境。

為此,我們利用 Cloudflare 平台已建構的元件:

這結合了我們 AI 平台正在開發的多項工作,包括 AI Gateway 捕捉 AI 流量以利用自身請求/回應數據、RL 沙盒的容器,以及自 Replicate 收購後持續推進的 Workers AI 自帶模型(Cog)功能。

我們很高興今天推出 Workers AI 團隊訓練的首款 Cloudflare ML 模型。雖然仍處於早期階段,未來還有許多改進,但這是 AI 平台團隊努力的精彩展示。我們相信 Clef 有能力顛覆代理使用方式,與 Cloudflare 作為代理雲的使命高度契合。

若您有特定用例且已是相關產品客戶,歡迎與我們交流,成為設計合作夥伴,共同探索此領域。

我們的機器學習團隊持續擴大影響力,從模型優化到訓練研究。如果您有興趣加入我們的使命,請參考我們的職缺資訊。

Cloudflare 推出 Clef 開源決策模型與強化學習微調平台Cloudflare 推出 Clef 開源決策模型與強化學習微調平台Cloudflare 推出 Clef 開源決策模型與強化學習微調平台Cloudflare 推出 Clef 開源決策模型與強化學習微調平台Cloudflare 推出 Clef 開源決策模型與強化學習微調平台Cloudflare 推出 Clef 開源決策模型與強化學習微調平台