我們介紹一組先進且具理論基礎的量化演算法,能對大型語言模型與向量搜尋引擎進行大幅壓縮。
向量是 AI 模型理解與處理資訊的基本方式。小向量描述簡單屬性,如圖中一點,而「高維」向量則捕捉複雜資訊,如影像特徵、詞義或資料集特性。高維向量功能強大,但佔用大量記憶體,導致關鍵值快取(key-value cache)瓶頸。關鍵值快取是一種高速「數位備忘錄」,將常用資訊以簡單標籤存放,讓電腦能即時取用,避免慢速搜尋龐大資料庫。
向量量化是一種強大的經典資料壓縮技術,可減少高維向量大小。此優化解決 AI 兩大關鍵面向:提升向量搜尋速度,支援大規模 AI 與搜尋引擎的快速相似度查找;並減輕關鍵值快取瓶頸,因為減少鍵值對大小,促進更快相似度搜尋並降低記憶體成本。然而,傳統向量量化通常帶來「記憶體額外負擔」,因多數方法需計算並以全精度儲存每個小資料區塊的量化常數,這會增加每個數字 1 至 2 位元的額外負擔,部分抵銷量化的目的。
今天,我們推出 TurboQuant(將於 ICLR 2026 發表),這是一種壓縮演算法,能最佳化解決向量量化中的記憶體額外負擔問題。我們也介紹 Quantized Johnson-Lindenstrauss(QJL)與 PolarQuant(將於 AISTATS 2026 發表),TurboQuant 利用這兩者達成成果。測試顯示,這三種技術在降低關鍵值瓶頸同時,保持 AI 模型效能,對依賴壓縮的應用,尤其是搜尋與 AI 領域,具有深遠意義。
TurboQuant 是一種壓縮方法,能在不損失準確度的前提下大幅減少模型大小,非常適合支援關鍵值快取壓縮與向量搜尋。它透過兩個關鍵步驟達成此效率:
為深入理解 TurboQuant 的效率,我們進一步探討 QJL 與 PolarQuant 演算法的運作原理。
QJL 利用 Johnson-Lindenstrauss 變換,一種數學技術,將複雜高維資料縮減,同時保留資料點間的距離與關係。它將每個向量數字縮減為單一符號位元(+1 或 -1)。此演算法本質上創造一種高速速記,且不產生記憶體額外負擔。為維持準確度,QJL 使用特殊估計器,策略性平衡高精度查詢與低精度簡化資料,使模型能準確計算注意力分數(決定輸入中哪些部分重要、哪些可忽略的過程)。
PolarQuant 則以完全不同方法解決記憶體額外負擔問題。它不使用標準座標(X、Y、Z)表示向量,而是將向量轉換為極座標系統。這類似於將「向東走3格、向北走4格」改為「以37度角走5格」。結果產生兩項資訊:半徑代表核心資料強度,角度代表資料方向或意義。由於角度分布已知且高度集中,模型不需執行昂貴的資料正規化步驟,因為資料被映射到固定且可預測的「圓形」網格,邊界固定,而非不斷變化的「方形」網格。這使 PolarQuant 消除傳統方法必須承擔的記憶體額外負擔。
PolarQuant 作為高效壓縮橋樑,將笛卡爾座標輸入轉換為緊湊的極座標「速記」以供儲存與處理。其機制從將 d 維向量的座標兩兩配對,映射到極座標系開始。半徑再兩兩配對進行遞迴極座標轉換,直到資料被濃縮為單一最終半徑與一組描述角度。
我們在多個標準長上下文基準測試中嚴格評估這三種演算法,包括 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 及 L-Eval,使用開源大型語言模型(Gemma 與 Mistral)。實驗數據顯示 TurboQuant 在點積失真與召回率方面達到最佳表現,同時最大限度減少關鍵值記憶體佔用。下圖展示 TurboQuant、PolarQuant 與 KIVI 基線在多樣任務(問答、程式碼生成、摘要)上的綜合表現分數。
TurboQuant 在 LongBench 基準測試中,針對 Llama-3.1-8B-Instruct 模型展現出強健的關鍵值快取壓縮效能(括號中為位元寬度)。
以下為長上下文「大海撈針」任務結果(測試模型是否能在大量文字中找到特定微小資訊)。TurboQuant 在所有基準測試中均達成完美下游結果,且將關鍵值記憶體大小至少縮減 6 倍。PolarQuant 在此任務中也幾乎無損失。
TurboQuant 證明能將關鍵值快取量化至僅 3 位元,無需訓練或微調,且不影響模型準確度,同時運行速度比原始大型語言模型(Gemma 與 Mistral)更快。其實現效率極高,運行時開銷可忽略不計。下圖顯示 TurboQuant 在計算注意力對數機率時的加速效果:4 位元 TurboQuant 在 H100 GPU 加速器上相較於 32 位元未量化鍵,性能提升最高達 8 倍。
TurboQuant 在不同位元寬度下,於關鍵值快取中計算注意力對數機率的性能大幅提升,與高度優化的 JAX 基線相比。
這使其非常適合支援向量搜尋等應用,大幅加速索引建立過程。我們以 1@k 召回率評估 TurboQuant 在高維向量搜尋中的效能,與最先進方法(PQ 與 RabbiQ)比較。1@k 召回率衡量演算法在前 k 項近似中捕捉真實最高內積結果的頻率。儘管基線方法使用效率低的大型碼本與資料集特定調整,TurboQuant 仍持續達成更優召回率(下圖)。此結果證實 TurboQuant 在高維搜尋任務中的穩健與效率。
TurboQuant 在 GloVe 資料集(維度200)中,針對多種先進量化基線,展現出強健的檢索效能,達成最佳 1@k 召回率。
TurboQuant 展現高維搜尋的變革性轉變。它設定了可達成速度的新標竿,以資料無關方式提供近乎最佳的失真率。這使我們的最近鄰引擎能以 3 位元系統的效率運作,同時保持較重模型的精確度。詳情請參閱論文。
TurboQuant、QJL 與 PolarQuant 不僅是實用工程解決方案,更是具強大理論證明的基礎演算法貢獻。這些方法不僅在實務應用中表現良好,且可證明其效率接近理論下界。這嚴謹基礎使其在關鍵大型系統中具備穩健性與可信度。
雖然主要應用是解決如 Gemini 等模型中的關鍵值快取瓶頸,但高效線上向量量化的影響更為廣泛。例如,現代搜尋正從單純關鍵字演進至理解意圖與語義,這需要向量搜尋——在數十億向量資料庫中找到「最近」或語義最相似項目。
像 TurboQuant 這樣的技術對此使命至關重要。它們允許以極低記憶體、近零預處理時間與先進準確度建立與查詢大型向量索引,使 Google 規模的語義搜尋更快更有效。隨著 AI 日益整合至各類產品,從大型語言模型到語義搜尋,基礎向量量化的研究將變得更加關鍵。
此研究由 Google 研究員 Praneeth Kacham、Google DeepMind 首席工程師 Majid Hadian、KAIST 助理教授 Insu Han、NYU 博士生 Majid Daliri、Google 研究員 Lars Gottesbüren 與 Rajesh Jayaram 共同合作完成。