加入我們參加首屆大會 Forge 2026

Ember-1 是 Fireworks Research 新推出的專用模型,能以少 40% 的 token 提供 Kimi K3 的品質。它以 Kimi K3 為基礎,學會了削減不必要的推理,同時保留重要的思考過程。我們在外部基準測試、客戶現場 A/B 測試以及我們自身的程式碼編寫和代理工作負載中進行了測試,結果顯示在所有情況下品質均保持不變。Ember-1 現已推出,它開啟了 Fireworks 一系列專用模型的序幕,這些模型將根據開發者接下來的需求進行塑造。Ember 僅是您能透過 Fireworks 訓練平台建構的眾多應用的開端。

我們從用戶那裡得知,他們需要 K3 的程式碼編寫能力,但成本更低,因為其冗長的推理過程使得自動化程式碼編寫的規模化成本高昂。降低 K3 的推理強度並未能解決這個問題。較低的強度設定犧牲了太多品質。為了維持品質並削減 token,模型必須學會更有效地推理,這意味著需要對其進行訓練。

實現這一目標需要嚴謹的研究。我們的團隊進行了超過 50 次訓練實驗和 200 多次評估,並在此過程中開發了新的訓練演算法,以縮短推理過程而不損失準確性。我們在 Fireworks Serverless Training 上完成了這一切。由於無需配置或管理 GPU,我們可以在有想法後立即啟動實驗,僅為實際運行的部分付費,並以比平常更短的時間和更低的成本完成從研究到發布的過程。

我們在廣泛的任務集上進行了訓練,以便 token 節省能夠適用於多種工作負載。然後,我們在 Specialized Intelligence Index、公開基準測試和現場生產流量上評估了 Ember-1,以確認其使用的 token 更少,且品質沒有下降。Ember-1 是 Fireworks 自己的模型,也是 Fireworks Research 系列模型的首款。

像 Kimi K3 這樣的推理模型,其生成的 token 大部分,有時超過 90%,用於內部推理而非答案本身。這種思考結構在單次請求中成本很高,但在多輪代理工作負載中會變得更糟。每一輪都會將所有先前的推理重新傳送回模型,因此上下文的增長大致與輪數呈二次方關係。早期輪次的長推理過程會在後續的每次調用中被重新讀取(並重新計費)。

所有這些推理真的有必要嗎?我們的實驗表明不是。Kimi K3 輸出的推理遠長於任務所需,並且可以在不影響答案的情況下移除多餘的部分。這就是我們如何創建 Ember-1,一個由專用智能構建的 Kimi K3 的經濟高效版本。

並非 K3 的所有推理都是浪費的。其中一些是自我反思:重新審視假設、回應反饋或追溯某個結果到早期決策,可以幫助模型從錯誤中恢復。機會在於保留這種能力,同時減少不必要的推理並擺脫無效的循環。我們相信,從任務和環境反饋中學習可以教會模型更有效地推理,同時保持其能力。

對於代理任務,這種學習貫穿整個互動過程。模型會探索可能的行動,整合新的觀察結果,並在進展過程中完善其推理。反饋將決策與其後果聯繫起來,鼓勵在整個任務中有用的反思。

我們將這些見解應用於涵蓋數學、程式碼編寫、指令遵循、對話、搜尋、工具使用和軟體工程的訓練集,涵蓋了獨立問題和擴展互動,以確保適應觀察結果和產出。任務反饋指導 on-policy 規劃和學習,並強調在這些設定下保持能力。

公開基準測試和現場 A/B 測試的結果支持這一方向:在七個基準測試和兩個客戶的生產流量中,Kimi K3 的推理可以在不犧牲準確性的情況下縮短 35-50%。內化行為也顯示在不成功的嘗試中 token 使用量受到限制,減少了冗長、無效的推理。

本週早些時候,我們推出了 Specialized Intelligence Index (SII),以對抗真實世界的任務來評估開放、封閉和專用模型,這些任務由行業專家創建。

我們在 Doximity 的 Bedside Bench 上評估了 Ember-1,這是一個涵蓋 500 個臨床病例、橫跨 10 個專業類別的醫生驗證基準。

結果如何?在成本/任務方面,Ember-1 在 Bedside Bench 上創下了包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5 在內的開放和封閉模型的全新 Pareto 前沿。

我們還在其他一些行業基準測試中評估了 Ember-1 在品質與成本前沿的表現。我們使用公開的 Kimi K3 API 定價(未快取輸入 $3/M tokens,快取輸入 $0.30/M,輸出 $15/M)計算了每個基準測試的成本,並將其與三個臂的通過率進行了繪圖:K3 在推理強度低、K3 在推理強度高、K3 在推理強度最大(預設),以及 Ember-1。在超過 50 個測試樣本的每個基準測試中,Ember-1 都位於 Pareto 前沿或其附近,以一小部分的成本實現了 K3-max 的品質,並嚴格優於 K3-low。我們還分析了 GPT-6 Astra、Claude Opus-5 和 GLM 5.3,發現 Ember-1 在 Pareto 前沿處處於領先地位。

我們深入分析了直接比較 Ember-1 與原始 K3 的結果,發現了以下結果:

運行 K3 最具成本效益的方式不再是讓它思考得更少,而是運行 Ember-1,這個學會了高效思考的模型。

基準測試只能告訴你一部分。就像我們在 Specialized Intelligence Index 結果中發現的那樣,我們希望在更多真實工作負載上測試該模型,並使用生產流量來測試該模型。真正的考驗通常是模型在生產流量中是否能表現良好,在用戶依賴的產品中是否能表現良好。

我們與兩位客戶在其生產程式碼編寫工作負載上進行了現場 A/B 測試。在這兩種情況下,Ember-1 都實現了令人印象深刻的 token 節省,每項任務的 token 數量約減少了 35%,同時品質相當。下游產品指標大多保持不變或有所改善,包括任務完成率、成功分數和失敗率,所有這些都在以顯著降低的 token 成本朝著正確的方向發展。在 A/B 測試之後,一位客戶現在正在生產環境中運行 Ember-1,並計劃將其全面擴展以取代基礎模型。

Fireworks 的內部程式碼編寫/協同工作流量的很大一部分由我們自己的推理服務提供支援。在任何客戶看到該模型之前,我們就將 Ember-1 投入內部使用,讓我們的開發人員用它來處理日常的程式碼編寫工作,包括大規模的 vibe 測試等真實任務。

我們最引以為豪的成果:沒有消息。沒有消息就是好消息。開發人員在不注意切換的情況下繼續他們的程式碼編寫工作負載,同時消耗的 token 量顯著減少。對於一個其全部價值主張是「相同的答案,更少的 token」的模型來說,在內部流量上進行無聲的推出是最強有力的信號。

Ember-1 作為一個服務選項,與基礎 Kimi K3 模型一起,作為 Serverless 上的研究預覽版推出。為了支持快速發展的開源生態系統,我們引入了研究發布,讓開發者可以獲得為期兩週的無伺服器訪問新研究模型,並根據社群需求將其永久化。對於代理程式碼編寫和其他推理 token 佔成本大部分的工作負載,它能以大約一半的 token 成本提供相同的品質。

Fireworks Research 將繼續推動模型效率的前沿,將專用智能引入更多 Ember 模型,使您能夠部署最經濟的模型,並減少您的 token 支出。Token 效率正成為 Fireworks 的一個主題。

希望將 Ember-1 更進一步,並為您的用例進行優化?我們還推出了 Ember-1 的訓練支援,使企業能夠使用自己的數據構建定制的、token 效率高的模型,以滿足其需求。開放模型的未來是基於您的特定工作負載訓練的專用模型。

正在您的工作負載上試用 Ember-1 嗎?我們很樂意聽取您的體驗,請在 X 上標記我們(@FireworksAI_HQ)並告訴我們您正在構建什麼!

Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質Fireworks 推出 Ember-1 模型:以更少 token 提供 Kimi K3 同等級品質