我們展示 DeepSeek-V4 系列的預覽版本,包含兩個強大的混合專家 (MoE) 語言模型 — DeepSeek-V4-Pro,擁有 1.6 兆參數 (啟用 490 億);以及 DeepSeek-V4-Flash,擁有 2840 億參數 (啟用 130 億) — 兩者皆支援一百萬詞語的上下文長度。

DeepSeek-V4 系列在架構與優化上整合了多項關鍵升級:

我們在超過 32 兆的多樣化高品質詞語上預訓練了兩個模型,隨後進行了全面的後訓練流程。後訓練採用兩階段範式:透過 SFT 和帶有 GRPO 的 RL 獨立培養領域專家的能力,然後透過 on-policy distillation 進行統一模型整合,將不同領域的獨特專長整合到單一模型中。

DeepSeek-V4-Pro-Max,即 DeepSeek-V4-Pro 的最大推理模式,顯著提升了開源模型的知識能力,穩居當前最佳開源模型的地位。它在編碼基準測試中取得了頂尖的表現,並顯著縮小了與領先閉源模型在推理和代理任務上的差距。同時,DeepSeek-V4-Flash-Max 在給予較大的思考預算時,能達到與 Pro 版本相當的推理性能,儘管其較小的參數規模自然使其在純知識任務和最複雜的代理工作流程上略遜一籌。

*FP4 + FP8 混合精度:MoE 專家參數使用 FP4 精度;大多數其他參數使用 FP8。

DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 皆支援三種推理模式:

此版本不包含 Jinja 格式的聊天模板。取而代之的是,我們提供了一個專用的編碼資料夾,其中包含 Python 腳本和測試案例,演示如何將訊息以 OpenAI 相容格式編碼成模型的輸入字串,以及如何解析模型的文字輸出。請參閱編碼資料夾以獲取完整文件。

請參閱推理資料夾,了解在本地運行 DeepSeek-V4 的詳細說明,包括模型權重轉換和互動式聊天演示。

對於本地部署,我們建議將採樣參數設定為 temperature = 1.0, top_p = 1.0。對於 Think Max 推理模式,我們建議將上下文窗口設定為至少 384K 詞語。