OpenAI 的新 GPT‑5.3‑Codex‑Spark 在程式碼編寫方面的速度比前代快 15 倍。

週四,OpenAI 發布了首款運行於非輝達(Nvidia)硬體上的量產 AI 模型,將新的 GPT-5.3-Codex-Spark 程式碼模型部署在 Cerebras 的晶片上。該模型每秒能生成超過 1,000 個 token(數據塊)的程式碼,據報導速度約為前代的 15 倍。作為比較,Anthropic 的 Claude Opus 4.6 在其新推出的高價快速模式下,速度約為標準速度每秒 68.2 個 token 的 2.5 倍,儘管 Claude Opus 是一個更大、功能更強大的模型。

「Cerebras 是我們很棒的工程合作夥伴,我們很高興能將快速推論作為新的平台能力,」OpenAI 計算主管 Sachin Katti 在一份聲明中表示。

此發布建立在 OpenAI 本月稍早推出的完整版 GPT-5.3-Codex 模型之上。完整版模型處理重量級的代理程式編碼任務,而 OpenAI 則針對 Spark 進行了速度優化,而非深度知識。OpenAI 將其建構為一個純文字模型,並專門針對程式碼編寫進行調校,而非處理較大版本 GPT-5.3 所能勝任的通用任務。

根據 OpenAI 的說法,在 SWE-Bench Pro 和 Terminal-Bench 2.0 這兩項評估軟體工程能力的基準測試中,Spark 的表現優於舊款 GPT-5.1-Codex-mini,且完成任務的時間更短。該公司並未分享獨立驗證的數據。

據傳,Codex 的速度一直是個痛點;去年 12 月,《Ars》測試了四個 AI 編碼代理程式構建踩雷遊戲的克隆版本時,Codex 完成一個可運作的遊戲所花費的時間大約是 Anthropic 的 Claude Code 的兩倍。

作為參考,GPT-5.3-Codex-Spark 每秒 1,000 個 token 的速度,遠遠超過 OpenAI 過去透過自家基礎設施提供的任何模型。根據 Artificial Analysis 的獨立基準測試,OpenAI 在輝達硬體上最快的模型速度遠低於此:GPT-4o 大約每秒提供 147 個 token,o3-mini 約為 167 個,而 GPT-4o mini 約為 52 個。

但以 Cerebras 的標準來看,每秒 1,000 個 token 其實算是適中的速度。該公司曾在 Llama 3.1 70B 上測得每秒 2,100 個 token 的速度,並報告稱在 OpenAI 自家的開源模型 gpt-oss-120B 上達到每秒 3,000 個 token,這表明 Codex-Spark 相對較慢的速度可能反映了模型較大或較複雜的開銷。

AI 編碼代理程式今年取得了突破性進展,像 OpenAI 的 Codex 和 Anthropic 的 Claude Code 等工具,在快速構建原型、介面和樣板程式碼方面達到了新的實用水平。OpenAI、Google 和 Anthropic 都在競相推出更強大的編碼代理程式,而延遲已成為區分勝負的關鍵;一個編碼速度更快的模型能讓開發者更快地進行迭代。

面對 Anthropic 的激烈競爭,OpenAI 一直在快速迭代其 Codex 系列產品。在執行長 Sam Altman 發布關於來自 Google 的競爭壓力的內部「紅色警報」備忘錄後,於去年 12 月推出了 GPT-5.2,並在幾天前發布了 GPT-5.3-Codex。

Spark 更深層次的硬體故事可能比其基準測試分數更具影響力。該模型運行在 Cerebras 的 Wafer Scale Engine 3 上,這是一款尺寸如盤子大小的晶片,Cerebras 自至少 2022 年以來一直以此為業務核心。OpenAI 和 Cerebras 在一月份宣布了他們的合作關係,而 Codex-Spark 是該合作的首個產物。

OpenAI 在過去一年中系統性地減少了對輝達的依賴。該公司於 2025 年 10 月與 AMD 簽署了一項大規模多年協議,於 11 月與亞馬遜達成 380 億美元的雲端運算協議,並一直在設計自己的客製化 AI 晶片,最終由台積電(TSMC)製造。

與此同時,一項與輝達計劃中的 1,000 億美元基礎設施交易迄今為止尚未實現,儘管輝達後來承諾了 200 億美元的投資。路透社報導稱,OpenAI 對輝達某些晶片在推論任務上的速度感到不滿,而這正是 OpenAI 設計 Codex-Spark 所要解決的工作負載。

無論底層晶片為何,速度都很重要,儘管速度可能以準確性為代價。對於那些每天在程式碼編輯器中等待 AI 建議的開發者來說,每秒 1,000 個 token 的速度可能感覺不像是在小心地操作拼圖,更像是操作圓鋸。只是要小心你正在切割的東西。