備受期待的 V4 模型更有效率,對中國晶片製造商是一大勝利。
中國 AI 公司 DeepSeek 於 4 月 24 日發布了其備受期待的新旗艦模型 V4 的預覽版。該模型由於採用了新的設計,使其能夠更有效地處理大量文本,因此比上一代能夠處理更長的提示(prompts)。與 DeepSeek 先前的模型一樣,V4 是開源的,這意味著任何人都可以下載、使用和修改它。
V4 是 DeepSeek 自 2025 年 1 月推出推理模型 R1 以來最重要的發布。R1 在有限的運算資源下進行訓練,卻以其強大的性能和效率震驚了全球 AI 產業,幾乎在一夜之間將 DeepSeek 從一個鮮為人知的研究團隊轉變為中國最知名的 AI 公司。它也幫助引發了中國其他 AI 公司發布開源權重模型的浪潮。
此後,DeepSeek 一直保持相對低調——但在本月早些時候,它透過在其模型的線上版本中添加「專家」和「閃電」模式,有效地預告了 V4 的發布,引發了人們對這些更新與即將推出的更大版本相關聯的猜測。
儘管該公司已成為中國 AI 野心的強大象徵,但其重返尖端前沿模型是在經歷了數月的審查之後,包括主要人員離職、先前模型發布延遲,以及來自美國和中國政府日益嚴格的審查。
那麼,V4 會像 R1 那樣撼動 AI 領域嗎?幾乎不可能,但以下是這次發布之所以重要的三個重要原因。
與先前的 R1 一樣,DeepSeek聲稱 V4 的性能與市面上最好的模型相當,但價格卻低得多。這對開發人員和使用該技術的公司來說是個好消息,因為這意味著他們可以按照自己的條件,並且無需擔心成本飆升的情況下,獲得前沿 AI 的能力。
新模型有兩個版本,都可以在 DeepSeek 的網站和應用程式中取得,同時也對開發人員開放 API 存取。V4-Pro 是一個較大的模型,專為編碼和複雜的代理任務而建;V4-Flash 是一個較小的版本,旨在運行速度更快、成本更低。兩個版本都提供推理模式,模型可以在其中仔細解析使用者的提示,並顯示其解決問題的每個步驟。
對於 V4-Pro,DeepSeek 的輸入 token 每百萬個收費 1.74 美元,輸出 token 每百萬個收費 3.48 美元,遠低於 OpenAI 和 Anthropic 的同類模型。V4-Flash 甚至更便宜,輸入 token 每百萬個約 0.14 美元,輸出 token 每百萬個約 0.28 美元,使其成為市面上最便宜的頂級模型之一。這將使其成為構建應用程式的極具吸引力的模型。
在性能方面,V4 相較於 R1 有了巨大的飛躍,這或許並不令人意外——而且它似乎是目前所有最新大型 AI 模型的一個強大替代品。根據該公司分享的結果,在主要的基準測試中,DeepSeek V4-Pro 在性能上可與領先的閉源模型媲美,與 Anthropic 的 Claude-Opus-4.6、OpenAI 的 GPT-5.4 和 Google 的 Gemini-3.1 相匹配。與阿里巴巴的 Qwen-3.5 或 Z.ai 的 GLM-5.1 等其他開源模型相比,DeepSeek V4 在編碼、數學和 STEM 問題上都超越了它們,使其成為有史以來發布的最強大的開源模型之一。
DeepSeek 還表示,V4-Pro 在代理編碼任務的基準測試中,現已躋身最強大的開源模型之列,並且在衡量執行多步驟問題能力的測試中表現良好。根據該公司分享的基準測試結果,其寫作能力和世界知識也處於領先地位。
在與模型一同發布的技術報告中,DeepSeek 分享了一項針對 85 名經驗豐富的開發人員進行的內部調查結果:超過 90% 的人將 V4-Pro 列為他們在編碼任務方面的首選模型。
DeepSeek 表示,它已專門為 Claude Code、OpenClaw 和 CodeBuddy 等流行的代理框架優化了 V4。
V4 的一項關鍵創新是其長上下文窗口——即模型一次可以處理的文本量。兩個版本都可以處理 100 萬個 token,這足以容納《魔戒》和《哈比人》三卷本的全部內容。該公司表示,這個上下文窗口大小現在是所有 DeepSeek 服務的預設值,並且與 Gemini 和 Claude 等模型的尖端版本所提供的相匹配。
但不僅要知道 DeepSeek 取得了這一飛躍,還要知道它是如何做到的。V4 對該公司先前的模型進行了重大的架構更改——尤其是在注意力機制方面,這是 AI 模型幫助它們理解提示的每個部分與其餘部分之間關係的特徵。隨著提示文本變長,這些比較變得更加昂貴,使得注意力成為長上下文模型的主要瓶頸之一。
DeepSeek 的創新在於讓模型更有選擇性地關注內容。V4 不再將所有先前的文本視為同等重要,而是壓縮舊資訊,並專注於最可能在當前時刻重要的部分,同時仍然完整保留附近的文本,以免錯過重要細節。
DeepSeek 表示,這大大降低了使用長上下文的成本。在 100 萬個 token 的上下文中,V4-Pro 僅使用了其前一代模型 V3.2 所需運算能力的 27%,同時將記憶體使用量削減了 10%。V4-Flash 的削減幅度更大,僅使用了 10% 的運算能力和 7% 的記憶體。實際上,這可以降低構建需要處理大量資料的工具的成本,例如能夠讀取整個程式碼庫的 AI 編碼助手,或能夠分析長篇文檔檔案而不會不斷忘記先前內容的研究代理。
DeepSeek 對長上下文窗口的興趣並非始於 V4。在過去一年半的時間裡,該公司悄悄發表了一系列關於 AI 模型如何「記住」資訊的論文,實驗了壓縮和數學技術,以擴展 AI 模型實際能夠處理的範圍。
V4 是 DeepSeek 首款針對華為 Ascend 等中國本土晶片進行優化的模型——此舉使此次發布成為測試中國本土 AI 產業能否開始減輕對美國晶片巨頭 Nvidia 的依賴的試驗。
這在很大程度上是預料之中的,因為 The Information 本月早些時候報導稱,DeepSeek 並未提前向 Nvidia 和 AMD 等美國晶片製造商提供 V4 的早期存取權,儘管提前存取通常是為了讓晶片製造商在發布前優化對新模型的支援。據報導,該公司僅向中國晶片製造商提供了早期存取權。
週五,華為表示其基於 Ascend 950 系列的 Ascend 超級節點產品將支援 DeepSeek V4。這意味著想要運行自己修改版 Deepseek V4 的公司和個人將能夠輕鬆使用華為晶片。
路透社此前報導稱,中國政府官員建議 DeepSeek 在其訓練過程中整合華為晶片。這種壓力符合中國產業政策的更廣泛模式:戰略性產業經常被推動,有時甚至被要求與國家自力更生的目標保持一致。但就 AI 而言,緊迫性尤為突出。自 2022 年以來,美國的出口管制已使中國公司無法獲得 Nvidia 最強大的晶片,後來還限制了對降級版中國市場版本的存取。北京的回應是加速推動從晶片到軟體框架再到數據中心的本土 AI 堆棧。
據報導,中國當局一直在推動數據中心和公共計算項目更多地使用國產晶片,包括據報導禁止使用外國製造的晶片、設定採購配額,以及要求將 Nvidia 晶片與華為和寒武紀等公司的中國替代品配對。
儘管如此,更換 Nvidia 並不像更換晶片那麼簡單。Nvidia 的優勢不僅在於其晶片,還在於開發人員多年來圍繞它們建立的軟體生態系統。轉向華為的 Ascend 晶片意味著需要適應模型代碼、重建工具,並證明圍繞這些晶片構建的系統足夠穩定,可以投入嚴肅使用。
需要明確的是,DeepSeek 並未完全擺脫 Nvidia。該公司的技術報告顯示,它正在使用中國晶片來運行模型進行推理,即當有人要求模型完成任務時。但清華大學計算機科學教授劉知遠告訴 MIT Technology Review,DeepSeek 似乎只將 V4 的部分訓練過程適應了中國晶片。該報告並未說明一些關鍵的長上下文功能是否已適應國產晶片,因此劉表示 V4 可能仍主要在 Nvidia 晶片上進行訓練。由於圍繞這些問題的政治敏感性,匿名接受採訪的多個消息來源告訴 MIT Technology Review,中國晶片目前的性能仍不如 Nvidia 晶片,但更適合推理而非訓練。
DeepSeek 還將 V4 的未來成本與這一硬體轉變聯繫起來。該公司表示,隨著華為 Ascend 950 超級節點在今年下半年大規模出貨,V4-Pro 的價格可能會大幅下降。
如果這奏效,V4 可能會成為中國成功建立平行 AI 基礎設施的早期跡象。
Subquadratic 現在分享了更多關於其新模型的細節。但有些人仍然持懷疑態度。
一項新技術讓該公司能夠比以往任何時候都更深入地探究 LLM 的奇特工作原理。
該公司正加倍投入科學領域的 AI。
該公司呼籲更多科學家研究多代理系統的風險。
發現特別優惠、熱門故事、即將舉行的活動等。
感謝您提交電子郵件!