IBM 近日發布了 Granite 4.1 系列開源語言模型,專為企業應用而設計。
該系列模型提供三種尺寸,採用 Apache 2.0 授權,並在 15 兆個 token 上進行訓練,其訓練流程的細緻程度值得深入了解。
其中一項基準測試結果之所以令人驚豔,是因為理解其建構方式後便能豁然開朗。
80 億參數的模型。採用密集架構,沒有採用 MoE(Mixture of Experts)技巧,也沒有延伸推理鏈。在幾乎所有測試的基準上,其表現都與 Granite 4.0-H-Small 相匹配甚至超越。後者擁有 320 億個參數,其中 90 億個參數是活躍的。而這個新模型僅有 80 億個參數。
這要麼是非常令人印象深刻的成就,要麼意味著舊模型建構不足。很可能兩者皆是。
以下將說明其建構方式、數據的實際意義,以及這些是否對您的使用案例有所影響。
在 ArenaHard 基準測試中,該測試由 GPT-4 根據模型處理 500 個具挑戰性的真實世界提示(prompt)的能力進行評分,是衡量實際聊天品質的良好指標之一。8B instruct 模型在此項測試中得分 69.0。前一代的 Granite 4.0-H-Small,一個擁有 320 億參數、90 億活躍參數的 MoE 模型,得分較低。在標準的工具調用基準測試 BFCL V3 上,8B 模型得分 68.3,而 32B MoE 模型得分 64.7。GSM8K 是針對小學程度數學推理的測試,8B 模型在此項測試中也達到了 92.5。在 AlpacaEval、MMLU-Pro、BBH、EvalPlus、MBPP 等測試中,結果也一貫如此。
一個更密集、更簡單、更小的模型正在獲勝。而且是一貫地獲勝。
這實際上意味著 IBM 在世代訓練之間取得了顯著的進步。4.0-H-Small 模型並非建構不良,它只是當時 IBM 所擁有的最佳模型。而 4.1 的 8B 模型,則是 IBM 在此期間專注於數據品質而非僅僅擴展參數所產生的結果。這也是 Granite 4.1 建構過程中貫穿始終的主線。
Granite 4.1 提供 3B、8B 和 30B 三種尺寸。所有三種模型都採用相同的 decoder-only 密集 Transformer 設計、相同的訓練管線和相同的數據策略。它們之間唯一的區別就是尺寸。沒有 MoE 路由、稀疏層或會膨脹 token 數的延伸推理鏈。您輸入的內容,每次都會被穩定地處理。
依賴長推理鏈的模型更難預測成本,也更難進行延遲預算。Granite 4.1 在設計上規避了所有這些。但架構本身並非故事的重點。故事的重點是他們在 15 兆個 token 上進行訓練,以及他們對這些數據的細心處理。
IBM 進行了五個不同的訓練階段,採用不同的數據混合比例、學習率排程和目標。第一階段是廣泛的:CommonCrawl 佔 59%、程式碼佔 20%、數學佔 7%。到第二階段,數學比例已躍升至 35%,程式碼佔 30%。到第三和第四階段,他們將鏈式思維推理軌跡和指令數據與最高品質的網路內容混合在一起。第五階段擴展了上下文視窗,最終 8B 和 30B 模型可達 512K token。
大多數團隊會選擇一個數據混合比例並堅持下去。IBM 則有明確的意圖,四次改變了他們的數據混合比例。
IBM 在數據品質管線上的投入足夠多,值得單獨說明。
在預訓練之後,他們需要將基礎模型轉變為一個能夠可靠遵循指令的模型。這需要使用良好行為的範例進行微調,但該數據集中的不良範例並不會被忽略。它們會被學習。模型會將幻覺回答、忽略指令的回應、錯誤但自信的計算,都視為訊號。
因此,在單一微調樣本觸及模型之前,IBM 就建立了一個過濾系統。一個 LLM-as-Judge(大型語言模型作為評審)對每個助手回應進行了六個維度的評估,包括指令遵循、正確性、完整性、簡潔性、自然度和校準度。每個回應都會獲得評分,低於閾值的樣本會被剔除。但有些情況會觸發自動拒絕,無論評分如何,例如幻覺、錯誤前提、不正確的計算。這些情況沒有部分分數。
評審者並非孤立地閱讀提示或使用者輸入。它是在模型能夠存取的完整上下文下,評估模型所說的內容。在 RAG(檢索增強生成)設定中,如果回應沒有基於檢索到的文件,則被視為幻覺。在工具調用場景中,輸出會與允許的工具及其參數架構進行檢查。
此外,一個獨立的基於規則的管線檢查了整個數據集的結構,如長度、格式、架構驗證、重複數據刪除等。所有內容都經過記錄並可審計。
最終產出的是 410 萬個樣本。這聽起來很多。但作為參考,這是經過刻意策劃的 410 萬個樣本。
這是 Granite 4.1 論文中最讓我感興趣的部分,主要是因為它誠實地描述了訓練過程中出現的問題以及他們如何解決。
微調後,IBM 進行了四個連續階段的強化學習。第一階段同時在九個領域進行聯合訓練,包括數學、科學、邏輯推理、指令遵循、結構化輸出、文本到 SQL、時間推理、通用聊天和上下文學習。同時進行所有這些訓練的原因是,聯合訓練可以防止模型在擅長後面的領域時忘記前面的領域。每一次梯度更新都能看到完整的任務範圍。
第二階段是使用獎勵模型進行通用聊天提示的 RLHF(人類回饋強化學習)訓練,以提高有用性。這奏效了。與微調後的檢查點相比,AlpacaEval 分數平均提高了約 18.9 分。
然後出現了問題。RLHF 階段雖然提高了聊天品質,卻導致數學基準測試分數下降。GSM8K 和 DeepMind-Math 都出現了退步。
第三階段是一個短暫的身份和知識校準階段,大約進行 40 次訓練步驟,以穩定模型對自身身份的表徵及其知識。
第四階段是專門針對數學的 RL 運行,旨在恢復 RLHF 所造成的損害。這奏效了,GSM8K 分數恢復並平均超過了微調基準約 3.8 分。DeepMind-Math 平均恢復了約 23.5 分。
在 IBM 自家的 BFCL V3 工具調用排行榜上,30B 模型以 73.7 分位居榜首,領先 Gemma-4-31B 的 72.7 分。這是真實的排行榜結果,而非經過挑選的內部比較。8B 模型得分 68.3,超越了前一代的 Granite 4.0-H-Small 的 64.7,而 3B 模型得分 60.8,仍然優於 Qwen3-8B 的 60.2,後者是其兩倍大小的模型。
在 IFEval 的指令遵循測試中,Gemma 以 94.1 分領先,這一點值得明確說明。但 8B 模型得分 87.1,幾乎與 Qwen3.5-9B 的 87.2 分持平,而 30B 模型得分 89.7,超越了圖表中所有尺寸的 Qwen 模型。
在數學方面,8B 模型在 GSM8K 上達到 92.5 分,在 DeepMind-Math 上達到 80.1 分。30B 模型將這些分數推升至 94.2 和 81.9 分。在程式碼方面,EvalPlus 將 8B 模型評為 80.2 分,30B 模型為 82.7 分。MBPP+ 分數分別為 70.6 和 71.7 分。
3B 模型是這裡的低調贏家。IFEval 得分 82.1,GSM8K 得分 87.0,BFCL V3 得分 60.8。對於一個擁有如此參數量的模型來說,如果您考慮邊緣部署或成本受限的推理,這些數字很難被忽視。
所有這些測試都有一個誠實的提醒:比較圖表是 IBM 自家的,使用了他們自己的評估工具。絕對數字是合理的,並且與第三方報告的結果一致,但基準測試方法論始終值得審視。這些是自行報告的結果。
讓模型能夠處理 512K token 是一個問題。讓它在處理 512K token 的同時又不忘記如何處理 4K token,則是另一個更難的問題。
IBM 在預訓練的第五階段透過分階段擴展的方法解決了這個問題。他們沒有直接跳到 512K。他們先擴展到 32K,然後到 128K,最後到 512K。每個階段都使用了與第四階段相同的數據混合比例,直到最後一次擴展,他們才為 8B 和 30B 模型專門切換到 80% 的書籍和 20% 的程式碼儲存庫數據。書籍和長程式碼儲存庫是天然的長上下文數據,它們在數萬個 token 中具有連貫的結構,這是網路數據所不具備的。
每次擴展階段後,IBM 都進行了模型合併。這是保護短上下文性能的部分。透過將長上下文檢查點與早期權重合併,而不是僅僅繼續訓練,他們保留了模型在較短長度下已經學到的行為。
RULER 基準測試用於測試長上下文能力是真實的還是僅僅表面存在的,結果顯示 8B 模型在 32K 時得分 83.6,在 64K 時得分 79.1,在 128K 時得分 73.0。30B 模型表現更好:分別為 85.2、84.6 和 76.7。隨著上下文的增長,性能有所下降,這是預料之中的且誠實的表現,但分數並沒有斷崖式下跌。
3B 模型僅擴展到 128K,而非 512K。如果長上下文是您使用案例的硬性要求,這一點值得注意。
最快的入門方式是使用 Ollama。拉取適合您硬體的任何尺寸模型,3B 模型可以在大多數消費級機器上順暢運行,8B 模型需要更多空間,而 30B 模型則需要 GPU 機器。三種模型都可以在 Hugging Face 的 ibm-granite 標籤下找到,如果您想透過該途徑進行操作。
對於生產環境使用,vLLM 和 Transformers 都原生支援這些模型。如果您想在投入本地基礎設施之前進行評估,IBM 也透過其 API 提供這些模型。
如果您對記憶體有限制,FP8 量化變體值得嘗試,它們的佔用空間約為全精度版本的二分之一,但性能損失不大。
所有模型均採用 Apache 2.0 授權,因此商業使用沒有問題。
如果您正在構建需要可靠工具調用、可預測延遲以及不會產生法律問題的授權的產品,那麼 Granite 4.1 值得認真考慮。8B 模型是最佳選擇,它真正能與運行成本更高的模型競爭,並且在基準測試中足夠誠實,讓您在部署時不會遇到意外。
3B 模型對於考慮邊緣用例或嚴格推理預算的人來說很有吸引力。30B 模型適用於您需要最高性能且擁有相應硬體的情況。
IBM 在這裡構建的是一個以生產為先的模型系列,其團隊顯然花費了更多時間解決問題而不是宣佈它們。四階段的 RL 管線能夠捕捉並糾正訓練中期的回歸,這種細節雖然不會成為頭條新聞,但卻能實實在在地體現在實際可靠性上。