Scores represent the mean of the following eight benchmarks listed below, excluding xbench-DeepSearch. The Step 3.5 Flash score is derived under standard settings (i.e., $w/o$ Parallel Thinking).

Step 3.5 Flash 是我們功能最強大的開源基礎模型,旨在以卓越的效率提供前沿的推理和代理能力。它建立在稀疏混合專家(MoE)架構之上,每次僅啟用其 1960 億參數中的 110 億參數。這種「智慧密度」使其能夠媲美頂級專有模型的推理深度,同時保持即時互動所需的敏捷性。

Step 3.5 Flash 在推理、編碼和代理任務上的效能測量。開源模型(左側)按總參數數量排序,而頂級專有模型顯示在右側。xbench-DeepSearch 分數來源於官方出版物以確保一致性。陰影條表示使用平行思考(Parallel Thinking)增強的 Step 3.5 Flash 效能。

真正的智慧密度不僅在於傳統基準測試的峰值效能,更在於動態、真實世界場景中的穩健性。雖然我們重視標準指標的強勁結果作為基礎,但我們的首要目標是驗證該模型在面對實際執行中的不可預測性時,能否作為一個有彈性且有效的合作夥伴。

接下來,我們將匯總來自真實世界展示、嚴格內部基準測試和補充性公開排行榜的各種效能回饋。這些結果涵蓋了從數學和編碼的高級推理到日常互動能力的所有方面,證明 Step 3.5 Flash 不僅快速到能思考——它可靠到能行動。

工具使用遠不止是一個技術功能;它是將靜態模型轉變為主動代理的根本原子能力。它充當內部推理與外部影響之間的橋樑,使模型能夠超越其訓練資料的限制並與真實世界互動。

Step 3.5 Flash 在工具環境中透過獨特的「思考與行動」(Think-and-Act)協同作用而脫穎而出。該模型不僅僅是執行命令,而是展現出大規模的協調能力和跨領域的精確度。即使在導航龐大、高密度的工具集時,它也能保持完美的意圖對齊,並具備無縫切換原始程式碼執行和專用 API 協議所需的適應性推理能力。

我們展示了一個由 Step 3.5 Flash 驅動的開放世界股票投資場景,並無縫整合了 MCP。使用者要求為現有投資組合生成專業交易建議,同時管理雲端歸檔和自動警報。Step 3.5 Flash 作為中央控制器,首先協調超過 80 個 MCP 工具來匯總市場數據和技術指標。然後,它執行原始程式碼以生成客製化的財務指標和數據視覺化,以識別關鍵的投資洞察。分析完成後,模型會自動觸發雲端儲存協議並安排通知系統,以確保端到端的工作流程自動化。這展示了模型在單一整合會話中將複雜意圖映射到高密度工具使用的能力。

Step 3.5 Flash 優越的工具使用能力進一步透過以下效能指標得到證實。透過將 Python 程式碼執行整合到其思維鏈(Chain-of-Thought)推理中,該模型在頂級邏輯和數學基準測試中取得了顯著的效能提升,包括 AIME 2025 (99.8)、HMMT 2025 Nov. (98.0)、IMOAnswerBench (86.7) 和 ARC-AGI-1 (56.5)。

Step 3.5 Flash 啟用與未啟用 Python 程式碼執行能力的比較。

從傳統編碼轉向代理編碼標誌著從被動程式碼補全到自主解決端到端工程目標的轉變。Step 3.5 Flash 不僅僅是預測語法,而是透過將複雜需求分解為程式碼庫中的一系列可執行步驟來運作。它將程式碼視為驗證邏輯、繪製依賴關係圖和導航真實世界儲存庫結構深度的工具。Step 3.5 Flash 與 Claude Code 相容,可作為代理驅動開發的高效後端。透過利用其長上下文推理和工具調用的精確度,該模型可以處理儲存庫級別的任務並維護開發循環的連續性。以下是一些範例:

戰術天氣情報儀表板 — 一個飛行駕駛艙啟發的 3D 地球儀視覺化工具,專為高密度數據環境而設計。它採用客製化 WebGL 2.0 引擎,管理超過 15,000 個活躍節點和即時 WebSocket遙測。此案例展示了我們模型構建低延遲數據管道和高性能地理空間視覺化的能力,重點關注系統穩定性和專業級 UI/UX。

Three.js 程序化海洋引擎 — 一個高性能渲染系統,具有基於分形的海浪幾何和光線追蹤表面。它利用菲涅爾反射率和 PBR 材料實現照片級真實感照明。此展示突顯了我們模型在電腦圖形學(CG)、複雜渲染管線設計以及 Three.js/GLSL/Shadertoy 工作流程無縫整合方面的專業知識。

代理工作流程接收 — 一個案例展示了 Step 如何協助執行日常數據處理,實現端到端數據生產。它對齊上游數據格式,準確調用數據生成模型,驗證和轉換結果,並生成工作流程報告,體現了代理迴圈(Agent-in-the-loop)的核心概念。Step 可以有效地接管我們的日常工作流程,承擔複雜且重複的流程。

史詩級太陽系模擬 — 一個具有電影級照明和氛圍的 3D 互動太陽系模型,透過動態生成和逐一繞行的行星的史詩級開場表演,呈現從虛無到完整星系的震撼視覺敘事。這展示了 Step 在 3D 場景編排、照明和氛圍創建以及互動敘事節奏控制方面的全面創意能力。

自主商業智慧引擎 — 端到端數據處理——從 CSV 導入到三次樣條插值和多場景預測。展示了多步驟工具使用中的高級推理、程式碼執行期間的自動錯誤校正以及複雜數據視覺化。成功模擬了 60% 的 DNU 下降場景,識別出獲取渠道之間 1.6 倍的品質差距。這反映了該模型在系統性問題解決方面的代理實力及其作為獨立數據科學家的能力。

自主大規模儲存庫架構師 — 一種專門的代理工作流程,用於導航和解讀高複雜度的程式碼庫。該模型不僅僅是掃描檔案,還進行深度追蹤邏輯映射和跨模組依賴分析,以合成整個生態系統的「心智模型」。此展示證明了該模型在大型軟體架構方面卓越的認知能力,使其能夠自主生成專業 Wiki,將高級設計模式與數千行程式碼的低級實現細節聯繫起來。

超越 Vibe Coding - 在 Claude Code 中驅動專業數據代理。在 Claude Code 等高級代理框架內,大型語言模型(LLM)已從「Vibe Coding」發展成為能夠驅動複雜工作流程以完成複雜目標的主動問題解決者。為了在真實世界情境中評估這一點,我們任務 Step 3.5 Flash 在 Claude Code 環境中充當專業數據分析師。

我們策劃了一個包含 50 個端到端任務的基準測試,這些任務反映了互聯網後端數據分析的複雜性。如下表所示,Step 3.5 Flash 在管理這些多階段流程方面表現出卓越的熟練度——獨立處理數據導入、清理、特徵構建和結果解釋。憑藉 39.58% 的分數,它被證明是複雜代理系統的強大引擎,在分析準確性方面優於多個前沿模型。

我們注意到像 Gemini 3.0 Pro 這樣的前沿模型在此特定測試中表現不如預期。這可能是由於 Claude Code 內的框架兼容性問題,或者僅僅是分析能力的差異。無論如何,這裡的重點是 Step 3.5 Flash 與 Claude Code 的同步程度,使其能夠可靠地處理專業數據任務。

雖然 Step 3.5 Flash 很緊湊,但其效用不再受限於其內部參數知識。在代理時代,利用互聯網作為動態知識庫的能力比靜態記憶更關鍵——這是 Step 3.5 Flash 在 xbench-DeepSearch 和 BrowserComp 等基準測試中的表現所證明的優勢。

深度研究透過將整個研究工作流程委託給規劃、搜索、反思和寫作的代理迴圈,來擴展基本資訊檢索。為了在此複雜過程中評估 Step 3.5 Flash,我們使用 Scale AI 研究規則(Scale AI Research Rubrics),這是一個旨在評估長篇研究的事實基礎和推理深度的基準。我們的實施透過基於 ReAct 架構的單一代理迴圈來實現這一點,原生整合了批次網頁瀏覽器(batch_web_surfer)和 shell 等專用工具進行迭代調查。這種方法使 Step 3.5 Flash 能夠獲得 65.27% 的分數,其研究品質可與 OpenAI 和 Gemini 的深度研究相媲美,同時保持顯著更高的推理效率。

我們透過收集其官方網頁介面(2025 年 12 月 2 日至 15 日捕獲)在預設配置下的商業代理報告進行評估,而我們的內部模型則使用 ReAct 框架進行報告生成。所有輸出隨後由 LLM 裁判對每個標準進行三元評級。

我們透過對幼兒科學教育的研究案例,展示了 Step 3.5 Flash 卓越的深度研究能力。在此案例中,Step 3.5 Flash 綜合了一份約 10,000 字的綜合研究報告,將複雜的神經可塑性理論提煉成一份針對 0-3 歲兒童的可操作、專家級指南。該輸出將理論里程碑與實際的「家長腳本」聯繫起來,將感官遊戲重新定義為結構化探究,同時嚴格關注認知深度和安全指導。

多代理協調框架。Step 3.5 Flash 還原生支援多代理架構,其中主代理(Master Agent)透過自主規劃和動態路由來協調複雜任務。這種層次化框架調度專門的搜索和驗證代理,透過並行工具調用迴圈來處理檢索和事實基礎。為確保精確性,摘要代理(Summary Agent)將每個子代理的軌跡合併為結構化回饋,使主代理能夠綜合最終、連貫的響應。

邊緣-雲端協同(Edge-Cloud Collaboration)作為一種特殊形式的多代理架構,在上下文管理、隱私保護和成本控制方面比純雲端解決方案具有固有的優勢。

在這裡,我們檢驗了雲端部署的 Step 3.5 Flash 與邊緣部署的 Step-GUI 之間的協同作用。我們展示了它們如何協同工作,在各種邊緣設備(在此案例中為智慧手機)上執行複雜任務。

在此案例中,使用者要求搜尋最新的 GUI Agents 的 Arxiv 論文,對其進行總結,並立即透過微信分享結果。Step 3.5 Flash 作為「雲端大腦」,首先在雲端執行搜尋和總結以獲得最大速度。一旦內容準備就緒,它就會觸發「手」——我們的設備端 Step-GUI ——喚醒手機,打開微信,並將訊息傳遞給特定聯絡人。這就是雲端設備協同作用(Cloud-Device Synergy)的實際應用。

在此案例中,使用者要求比較各平台上的 Mac Mini M4 價格。Step 3.5 Flash 作為「雲端大腦」,將這個複雜的請求分解為淘寶、京東和拼多多等平台的特定子任務。這種雲端規劃大大降低了設備端 Step-GUI 的難度,確保了更高的成功率,因為它可以從每個應用程式中檢索即時數據。然後,Step 3.5 Flash 綜合結果,確定拼多多為最便宜的選項,並提供購買指南。這展示了雲端設備協同作用:雲端智慧簡化了本地執行,以獲得可靠的結果。

此外,我們在 AndroidDaily Hard 子集上進行了比較評估,這是一個針對包含電子商務、娛樂和其他日常任務的中國移動應用程式場景量身定制的基準測試。

我們比較了兩種範式:(1) 單一代理 Step-GUI 在設備上獨立執行任務,以及 (2) 透過 GUI-MCP 整合 Step 3.5 Flash 與 Step-GUI 的邊緣-雲端協同框架。結果表明,使用 Step 3.5 Flash 作為雲端主代理來協調 Step-GUI,顯著提高了系統在複雜場景下的效能。

Step 3.5 Flash 在競賽級數學中展現了卓越的邏輯嚴謹性。透過對 IMO 入圍問題的深入分析,該模型證明了其在複雜符號推理和抽象結構合成方面的核心實力。

該問題旨在表徵所有實數 \(\alpha\),使得地板函數的和 \(S_n = \sum_{k=1}^n \lfloor k\alpha floor\) 始終可被 \(n\) 整除。主要難點在於 \(\alpha\) 是實數,需要將其整數部分 \(m\) 和分數部分 \( heta\) 分開,以分析總和如何與 \(n\) 的模數相互作用。證明的核心見解是將問題簡化為分數總和 \(T_n = \sum_{k=1}^n \lfloor k heta floor\) 的行為,並利用歸納法證明可除性約束迫使地板函數取極值。

該問題詢問在任何正實數序列中,涉及指數項 \(3^{a_n}\) 和 \(2^{a_n}\) 的和的特定不等式是否至少對一個 \(n\) 成立。主要難點在於分子和分母可能發散的行為,這使得該比率是否會低於固定常數如 \(1/2024\) 變得不明顯。證明的核心見解是進行變數替換 \(x_i = 2^{a_i}\) 並確定指數 \(\alpha = \log_2 3\),將表達式轉換為冪和的比率 \( rac{\sum x_i^\alpha}{(\sum x_i)^2}\)。

我們也關心互動可靠性——模型不僅能解決問題,還能以精確度和專業判斷與使用者互動。為此,我們在兩個關鍵維度上評估了 Step 3.5 Flash:

Step 3.5 Flash 的架構由模型-系統協同設計定義,該設計將推理成本和速度作為核心架構約束。我們採用稀疏混合專家(MoE)骨幹,將全局模型容量與每 token 計算分離。雖然總知識庫跨越 1960 億參數,但系統在推理過程中每次僅啟用 110 億參數。為了進一步降低記憶體開銷,我們策略性地在網路的前幾層使用密集層以獲得高智慧密度。

為了克服長上下文處理的二次瓶頸,我們利用混合注意力佈局,以 3:1 的比例交織滑動窗口注意力(SWA)和全注意力。我們特別選擇 SWA 而非線性替代方案,以保持預測解碼(speculative decoding)所需的架構靈活性。SWA 本質上與多 token 預測(MTP)頭相容。這些頭與主要輸出並行預測額外的未來 token,從而實現並行驗證。這使得模型能夠在單一傳遞中驗證多個 token 假設,有效地打破了標準自迴歸解碼的串行約束。

為確保這種輕量級混合結構保持峰值效能,我們實施了兩項關鍵增強。我們在 SWA 層使用了增強的查詢頭數量——從 64 增加到 96——以在不擴大 KV 快取佔用的情況下增強表示能力。此修改非常高效:由於注意力窗口是固定的,這些額外頭的計算成本與總序列長度無關,保持恆定。這使我們能夠擴展模型表達能力,而不會出現「長上下文懲罰」,即注意力成本通常會隨著對話的增長而爆炸。

與此相輔相成的是我們的頭部門控注意力(Head-wise Gated Attention),它充當輸入相關的注意力匯集點。透過動態調節資訊流,該機制在產生可忽略開銷的同時,保持了數值穩定性。

這些策略性的架構改進表明,前沿級推理可以與高昂的延遲分離。透過整合稀疏活動執行和並行 token 驗證,該模型在 NVIDIA Hopper GPU 上實現了高達 350 token/秒(TPS)的解碼吞吐量,同時運行 SWE-bench Verified。

最後但同樣重要的是,Step 3.5 Flash 優化的總參數規模促進了高度可訪問的本地推理。透過將其總容量整合到與高端個人硬體相容的規模,該模型支援在 Apple M4 Max、NVIDIA DGX Spark 或 AMD AI Max+ 395 等工作站上進行高保真私有部署,提供 100% 可信的執行環境。

Step 3.5 Flash 的整體架構。

隨著大型語言模型(LLM)的本地部署日益普及,我們已成功將 Step 3.5 Flash 適配到基於邊緣推理引擎 llama.cpp 的 NVIDIA DGX Spark 128GB 設備上,並同時發布了 GGUF 格式的 INT4 量化模型權重。在 NVIDIA DGX Spark 上,Step 3.5 Flash 實現了每秒 20 個 token 的生成速度;透過整合用於 KVCache 的 INT8 量化技術,它支援長達 256K token 的擴展上下文窗口,從而提供與雲端推理相當的長文本處理能力。開發人員可以透過 build.nvidia.com 在 NVIDIA 加速基礎設施上測試新模型。

我們引入了一個可擴展的強化學習框架,旨在可靠地大規模訓練推理和代理語言模型。

現代 LLM 的 RL 管道依賴於高吞吐量推理引擎來生成滾動數據(rollouts),而優化則在單獨的訓練系統中異步進行。大規模情況下,這種設置會引入兩個複合挑戰:

對於長推理序列,即使是微小的 token 級別差異也可能導致極端的重要性權重——導致更新不穩定、過早收斂或完全訓練崩潰。

為了解決這個問題,我們提出了 Metropolis Independence Sampling Filtered Policy Optimization (MIS-PO),它用嚴格的樣本過濾取代了脆弱的重要性加權。MIS-PO 不像 PPO 那樣透過連續的重要性採樣比例來縮放梯度,而是僅將這些比例作為二元接受標準。與推理策略和訓練策略之間的似然性偏差過大的軌跡將被簡單地排除在優化之外,而接受的樣本則被視為有效在策略內。具體來說,策略更新由以下公式驅動:

其中二元指示符 \(\mathbb{I}( au)\) 過濾掉離散分佈的樣本。這種設計顯著降低了梯度方差,並在沒有激進裁剪的情況下實現了穩定、長期的優化。

我們的框架還包括截斷感知值引導(truncation-aware value bootstrapping),它防止長推理軌跡在達到上下文限制時被錯誤地懲罰,以及混合專家模型的路由置信度監控,為大規模 RL 穩定性提供了實用信號。

總之,這些組件將強化學習轉變為一個可靠的持續自我改進引擎,能夠在數學、編碼和工具使用方面取得穩定進展,同時在大規模、離策略訓練下保持穩定。

不同 RL 演算法的訓練動態。消融研究對 Qwen 模型進行。

在我們的基準測試表中,我們提供了當今頂級開源模型之間詳細的並排比較。在廣泛的指標上,Step 3.5 Flash 以始終強勁的結果脫穎而出。我們的評估重點是三個核心維度——推理、編碼和代理能力,並以水平、一目了然的格式可視化同行模型之間的得分差異。

安裝:curl -fsSL https://openclaw.ai/install.sh | bash

配置:在 WebUI(配置 → 模型)中,添加一個新提供者: