Anthropic 和 OpenAI 最近都宣布了「快速模式」:一種能以顯著更快的速度與他們最好的程式碼模型互動的方式。

這兩種快速模式的設計截然不同。Anthropic 的模式每秒可提供高達 2.5 倍的 token 輸出(約 170 個,而 Opus 4.6 的速度為 65 個)。OpenAI 的模式則提供每秒超過 1000 個 token 的輸出(從 GPT-5.3-Codex 的每秒 65 個 token 提升至 15 倍)。因此,OpenAI 的快速模式比 Anthropic 的快六倍。

然而,Anthropic 的主要優勢在於他們提供的是實際模型。當您使用他們的快速模式時,您使用的是真正的 Opus 4.6,而當您使用 OpenAI 的快速模式時,您使用的是 GPT-5.3-Codex-Spark,而非真正的 GPT-5.3-Codex。Spark 的確快得多,但它是一個明顯能力較弱的模型:雖然對許多任務來說足夠,但它會感到困惑並在工具呼叫上出錯,這是標準 GPT-5.3-Codex 絕不會犯的錯誤。

為何會有這些差異?AI 實驗室並未公開其快速模式的運作細節,但我非常有信心其原理如下:Anthropic 的快速模式由低批次大小推論支援,而 OpenAI 的快速模式則由特殊的 Cerebras 晶片支援。讓我來詳細解釋一下。

AI 推理經濟學的核心權衡是批次處理,因為主要瓶頸是記憶體。GPU 速度非常快,但將資料傳輸到 GPU 則不然。每次推論操作都需要在推論開始前將使用者提示的所有 token 複製到 GPU 上。因此,將多個使用者合併成一個批次可以提高整體吞吐量,但代價是使用者必須等待批次填滿。

一個很好的比喻是公車系統。如果您沒有批次處理,乘客上車後公車會立即出發,那麼搭上公車的人通勤時間會快得多。但顯然整體吞吐量會低得多,因為人們會在公車站等上數小時,才能真正搭上公車。

Anthropic 的快速模式基本上就像一張保證公車一有乘客就立即出發的車票。成本是六倍,因為您實際上是在為其他本來可以與您同車的人付費,但速度快得多,因為您無需等待公車出發。

編輯:我要感謝一位讀者來信指出,「等待公車」的成本實際上只在第一個 token 上支付,因此不會影響串流延遲(只影響每次輪詢或工具呼叫的延遲)。因此,將批次大小的效能影響主要視為較小的批次需要較少的浮點運算,因此執行速度更快。在我的比喻中,也許可以說「較輕的公車開得更快」,或者類似的說法。

顯然,我無法完全確定這是正確的。也許他們能夠使用一些新的超快速運算資源來運行,或者他們正在進行一些其他人未曾想到的演算法技巧。但我很確定就是這樣。全新的運算資源或演算法技巧很可能需要對模型進行修改(請參閱下文關於 OpenAI 的系統),而「貴六倍但快 2.5 倍」的價格正好符合您在切換到低批次大小模式時預期的改進幅度。

OpenAI 的快速模式完全不是這樣運作的。您只需看看他們為此引入了一個新的、較差的模型,就可以知道。如果他們只是在調整批次大小,那根本沒有理由這麼做。此外,他們在公告部落格文章中明確說明了其快速模式的後盾:Cerebras。

OpenAI 在一月份宣布了與 Cerebras 的合作關係。Cerebras 是什麼?他們製造「超低延遲運算」設備。這意味著他們製造巨大的晶片。H100 晶片(相當接近推論晶片的前沿)尺寸略大於一平方英寸。Cerebras 晶片則有 70 平方英寸。

從圖片中可以看出,Cerebras 晶片上佈滿了網格和孔洞圖案。這是因為這麼大的矽晶圓本應被分割成數十個晶片。相反,Cerebras 在整個晶圓上蝕刻了一個巨大的晶片。

晶片越大,其內部記憶體就越多。其理念是打造一個具有足夠大的 SRAM 來容納整個模型的晶片,這樣推論就可以完全在記憶體中進行。通常 GPU 的 SRAM 以數十兆字節為單位。這意味著大量的推論時間花費在將模型權重的一部分從 SRAM 外部串流到 GPU 計算。如果您能將所有這些從(快得多的)SRAM 串流出來,推論將會顯著加速:事實證明,速度可以提升十五倍!

那麼,最新的 Cerebras 晶片有多少內部記憶體?44GB。這讓 OpenAI 處於一種尷尬的境地。44GB 足以容納一個小型模型(約 20B 個參數,fp16 精度;約 40B 個參數,int8 量化),但顯然不足以容納 GPT-5.3-Codex。這就是為什麼他們提供一個全新的模型,以及為什麼 Spark 模型帶有一點「小型模型」的氣息:它是更大型 GPT-5.3-Codex 模型的一個較小版本。

編輯:我對此的看法是錯誤的——Codex 模型幾乎肯定比這更大,並且不需要完全裝入單個晶片的 SRAM 中(如果需要,我們應該會看到更快的速度)。感謝 Hacker News 的評論者糾正了我。但我認為 Spark 仍很有可能駐留在 SRAM 中(分散在幾個 Cerebras 晶片上),這正是加速的原因。

有趣的是,兩大實驗室在建構快速 AI 推論方面採取了兩種截然不同的方法。如果我必須猜測一個陰謀論,它會是這樣的:

顯然,OpenAI 在這裡的成就更具技術挑戰性。讓模型在 Cerebras 晶片上運行並非易事,因為它們非常奇特。訓練一個 20B 或 40B 個參數的 GPT-5.3-Codex 蒸餾模型,使其仍然「夠用」也非易事。但我讚賞 Anthropic 找到了一個巧妙的方法,在這次發布中領先一步,而這對非技術人員來說將是難以理解的。這讓我想起 OpenAI 在 2025 年中期偷偷推出 Responses API 以幫助他們隱藏推理 token 的做法。

看到兩大實驗室推出這項功能,您可能會認為快速 AI 推論是他們正在追逐的新主要目標。我不這麼認為。如果我的理論是正確的,Anthropic 並不太在意快速推論,他們只是不想顯得落後於 OpenAI。而 OpenAI 主要是在探索他們新 Cerebras 合作夥伴關係的能力。什麼樣的模型可以裝載在這些巨大的晶片上,這些模型有多大用處,以及經濟效益是否合理,這些問題仍然很大程度上是未解之謎。

我個人認為「快速、能力較弱的推論」並沒有特別大的用處。我一直在 Codex 中嘗試使用它,但我並不喜歡。AI 代理的實用性主要取決於它們犯的錯誤有多少,而不是它們的原始速度。以 6 倍的速度換取 20% 的錯誤率是一個糟糕的交易,因為使用者的大部分時間都花在處理錯誤上,而不是等待模型。

然而,快速、能力較弱的推論當然有可能成為 AI 系統中一個核心的底層原語。Claude Code 已經為某些操作使用了 Haiku。也許 OpenAI 最終也會以類似的方式使用 Spark。

編輯:關於這篇文章在 Hacker News 上有一些很好的評論。首先,一個很好的修正:Cerebras 已經提供了每秒 1000 個 token 的約 355B 模型 GLM-4.7,所以我關於 Spark 僅存在於單個晶片的 SRAM 中的說法是錯誤的。假設他們像處理 GLM-4.7 一樣,將 Spark 分片到多個晶片上。

許多評論者在批次處理的效能特性方面與我(以及彼此)意見不合。有些人說連續批次處理意味著沒有人會等待公車,或者 Anthropic 模型請求的數量意味著批次等待時間可以忽略不計。其他用戶則對晶片間通信是否是推論時間的瓶頸,或者將晶片鏈接在一起是否會影響吞吐量持不同意見。

我對連續批次處理只有初步的了解,但在我看来,您仍然必須等待一個插槽可用(即使您不必等待整個前一個批次完成),因此批次大小的吞吐量/延遲權衡仍然適用。

編輯:一位讀者寫信來,為 Anthropic 的快速 AI 模式提供了一個令人信服的替代解釋——他們正在使用更積極的推測解碼,這會消耗更多 token,但可能以顯著更高的成本提供 2.5 倍的速度提升(因為許多大型模型的展開是並行的,然後被捨棄)。我不知道我是否 100% 相信——我確信大型實驗室已經在使用推測解碼,並且您嘗試的序列越長,其可靠性就越低——但我認為這絕對是可能的。

這甚至還沒有考慮延遲。Anthropic 明確警告說,首次 token 的時間可能仍然很慢(甚至更慢),而 OpenAI 認為 Spark 的延遲足夠快,足以值得切換到持久的 websocket(也就是說,他們認為 50-200 毫秒的往返時間是首次 token 的顯著部分)。

無論是作為先前 token 的 KV 快取,還是作為推論通過多個 GPU 進行管線化時的某個大型中間激活張量。我在「Why DeepSeek is cheap at scale but expensive to run locally」中對此有更詳細的闡述,因為它解釋了為什麼 DeepSeek 可以以如此便宜的價格提供(大規模批次處理允許在昂貴的巨型 GPU 上實現規模經濟,但個別消費者根本無法獲得)。

低批次大小意味著低吞吐量,但這個快速通道系統卻為使用者提供了更高的吞吐量,這是否矛盾?不是。當某些使用者使用「快速模式」時,GPU 的整體吞吐量會降低,但這些使用者的吞吐量卻會提高。

請記住,GPU 速度很快,但將資料複製到 GPU 上則不然。每一個「將這些權重複製到 GPU」的步驟都是整體推論時間中有意義的一部分。

或者,GPT-5.3-Codex 本身是從某個更強大的基礎模型中蒸餾出來的,而 Spark 則是其較小的蒸餾版本。我不知道 AI 實驗室具體是如何做的,他們對此保密嚴密。更多資訊請參閱此處。

關於這一點,值得一提的是,Cursor 的熱度幾乎與他們發布自己「快得多,能力稍弱」的代理模型同時消失。當然,這很大程度上是因為 Claude Code 吸引了所有人的注意力,但擁有一個非常快速的模型肯定沒有幫助。