擴散語言模型(DLM)提供了一個引人注目的承諾:平行詞元生成可以打破自迴歸(AR)解碼的序列瓶頸。然而,在實際應用中,DLM 的品質始終落後於 AR 模型。
我們認為,這種差距源於內省式一致性(introspective consistency)的根本性失敗:AR 模型會與其生成的內容保持一致,而 DLM 則經常不然。我們引入了具內省式擴散的語言模型(I-DLM),它使用內省式跨距解碼(ISD)技術,在推進新詞元的同時,驗證先前生成的詞元。
實驗結果顯示,I-DLM-8B 是第一個品質能與同規模 AR 模型匹敵的 DLM,在 AIME-24 基準測試上以一半的參數量超越 LLaDA-2.1-mini(16B)+26 分,在 LiveCodeBench-v6 上超越 +15 分,同時在高併發情況下提供了 2.9-4.1 倍的處理吞吐量。透過門控 LoRA,ISD 能夠實現位元對位元無損加速。
我們發現當前 DLM 中存在三個根本性的瓶頸:
透過因果注意力(causal attention)、對數移位(logit shift)和全遮罩目標(all-masked objective)轉換預訓練的 AR 模型。
每次前向傳遞生成 N 個詞元,同時透過 p/q 接受標準驗證先前詞元。
嚴格的因果注意力使得可以直接整合到 SGLang 中,無需客製化基礎設施。
I-DLM 是第一個在 15 個基準測試中品質媲美同規模 AR 模型,並超越所有先前 DLM 的模型。
藍色標示 = 最佳非 AR <30B。粗體標示 = 最佳非 AR <100B。
在記憶體限制的解碼模式下,TPF(Tokens Per Forward pass)近似於實際執行時間加速:TPF 為 2.5 代表解碼速度約為 AR 的 2.5 倍。下方可探索接受率和跨距大小如何影響此結果。
門控 LoRA 在 MASK 位置增加了計算量,以實現位元對位元無損輸出。α=1.12 符合實驗上的開銷。
SDAR 使用基於信心的去噪方法,通常比 ISD 具有較低的每詞元接受率。
加速 ≈ TPF。前向傳遞延遲大致上與詞元數量無關。
在高併發情況下,計算開銷變得重要。此外,SDAR 必須在每個批次中最慢的區塊進行同步 — E[max(S 1 ..S B )] 隨批次大小增加而增大,降低了有效 TPF。ISD 沒有同步懲罰,因為每個請求獨立推進。
拖曳以查看批次同步如何降低 SDAR 的有效加速。ISD 曲線保持平坦。
加速 = TPF² / query_size。包含:(1) 每次前向傳遞更多詞元,(2) 需要更少的前向傳遞,(3) 每次前向傳遞的查詢成本。加速 > 1 = 總 FLOPs 少於 AR。
設定。考慮生成 L 個輸出詞元。令 Q = 每次前向傳遞的查詢大小(固定:ISD 固定為 2N-1,SDAR 為 N)。
步驟 1:總前向傳遞次數。TPF = 每週期平均詞元數 / 平均前向傳遞次數,因此要產生 L 個詞元,我們需要:總前向傳遞次數 = L / TPF
步驟 2:總查詢次數。每次前向傳遞處理 Q 個查詢:總查詢次數 = (L / TPF) × Q
步驟 3:與 AR 比較。AR 在 L 次前向傳遞中產生 L 個詞元,每次 1 個查詢 = L 次總查詢。AR_查詢次數 = L
步驟 4:計算開銷。開銷 = 方法成本 / AR 成本:開銷 = ((L / TPF) × Q) / L = Q / TPF 這表示與 AR 相比,每個輸出詞元我們使用了多少額外的總查詢次數。
步驟 5:計算限制下的加速。加速 = 比 AR 快多少,同時考慮到更少的前向傳遞和更大的查詢:加速 = TPF / 開銷 = TPF / (Q / TPF) = TPF² / Q 直觀來說:TPF 出現兩次是因為它在兩個方面提供了幫助 — 每次前向傳遞產生 TPF 個詞元(分子),我們需要 1/TPF 次前向傳遞(這減少了分母)。查詢成本 Q 懲罰一次。當加速 > 1 時,平行解碼使用的總 FLOPs 少於 AR。
步驟 6:顯示與 TPF/OH 的等價性。OH(計算開銷)= 總查詢次數 / 總輸出詞元數:OH = (平均前向傳遞次數 × Q) / 平均詞元數 = Q / TPF 因此:TPF / OH = TPF / (Q / TPF) = TPF² / Q ■
此恆等式適用於任何每次前向傳遞查詢大小恆定的方法,無論接受率 p 或跨距 N 如何。
在高併發情況下,前向傳遞延遲隨每次前向傳遞的查詢次數而縮放。我們可以將計算效率衡量為 TPF²/query_size — 相對於 AR(效率 = 1),每個 FLOP 產生多少有用輸出:
效率 > 1 表示平行解碼實際上節省了相對於 AR 的總體計算量。這就是為什麼 I-DLM 的吞吐量隨併發度擴展,而 SDAR 和 LLaDA 在上述吞吐量圖中趨於平穩。
接受率呈幾何級數增長:位置 k 的機率為 p^(k-1)。位置 1 總是接受(對數移位)。
訓練、服務和部署 I-DLM 所需的一切。點擊任何卡片以展開。
設定、依賴項和環境
內省式一致性訓練配方
跨距解碼演算法和配置
請參閱 inference/README.md 以獲取詳細的環境設定。
透過內省式一致性訓練將預訓練的 AR 模型轉換為 I-DLM:
請參閱 training/README.md 以獲取腳本和配置。
內省式跨距解碼(ISD)在單次前向傳遞中進行生成和驗證:
請參閱 inference/README.md 以獲取演算法配置。
I-DLM 使用嚴格的因果注意力,無需客製化基礎設施即可直接整合到 SGLang 中:
完整系統相較於樸素基準線,吞吐量提升了 2.1-2.5 倍。
殘差 ISD(R-ISD)增加了一個門控 LoRA 轉接器,以實現位元對位元無損加速:
所有模型均使用 trust_remote_code=True(自訂 SDARForCausalLM 架構)。
我們在 4 個類別的 15 個基準測試上進行評估,並啟用了思考模式:
請參閱 inference/eval/ 以獲取重現腳本。