中國人工智慧新創公司 DeepSeek 於週五發布了其備受期待的 V4 大型語言模型預覽版,讓用戶能夠測試其新功能和特性。
此次發布距離該杭州公司推出其 R1 推理模型已超過一年,當時該模型因其令人驚訝的性能和成本效益而震驚了全球科技市場。
與 DeepSeek 之前的模型發布類似,最新的升級是開源的,允許開發人員下載程式碼,在本地運行,並在大多數情況下進行修改。
該模型提供「專業版」和「閃電版」兩種版本,取決於大小,DeepSeek聲稱 V4 在國內競爭對手中表現強勁,尤其是在基於代理的任務、知識處理和推理方面。
Counterpoint Research 研究副總裁 Neil Shah 告訴 CNBC:「DeepSeek 的 V4 預覽是一次嚴肅的展示」,其推理成本低於先前模型。
推理成本是指運行已訓練的 AI 模型以生成輸出的計算和財務費用。
DeepSeek 還表示,V4 已針對 Anthropic 的 Claude Code 和 OpenClaw 等流行代理工具進行了優化。
根據 Counterpoint 的首席 AI 分析師 Wei Sun 的說法,V4 的基準測試表現表明,它能夠以「顯著更低的成本提供出色的代理能力」。
DeepSeek 成立於 2023 年,並於 2024 年底因其免費開源的 V3 模型而受到關注,該模型據稱使用了性能較低的晶片訓練,成本僅為 OpenAI 和 Google 等公司模型的一小部分。
幾週後,在 2025 年 1 月,它發布了 R1 推理模型,該模型達到了類似的基準測試,甚至優於世界上許多領先的大型語言模型。
當 DeepSeek 透露僅用了兩個月時間,且花費不到 600 萬美元,使用低容量的 Nvidia 晶片就構建了 R1 模型時,該模型曾令投資者感到警惕。這引發了對美國在 AI 領域的領先地位以及大型科技公司在 AI 基礎設施上的巨額支出的質疑。
此後,DeepSeek 發布了一系列模型升級,但沒有一個能與 R1 的影響力相提並論。
Morningstar 高級股票分析師 Ivan Su 告訴 CNBC,V4 的推出不太可能產生與 R1 同樣的市場影響,因為交易員們已經消化了中國 AI 具有競爭力且使用成本更低的現實。
然而,Su 表示,DeepSeek 最新的定位將其他中國開源模型置於直接競爭對手的地位。
他補充說:「這是一種 R1 模型不存在的框架,僅憑這一點就足以說明國內競爭的激烈程度。」
自 R1 發布以來,DeepSeek 在中國蓬勃發展的 AI 行業面臨著日益激烈的競爭,阿里巴巴和字節跳動等公司今年也紛紛推出新模型。
週五,香港幾家中國 AI 公司的股價下跌。MiniMax 和智譜(Knowledge Atlas Technology)均下跌約 8%,而杭州開發商 Manycore Tech 則下跌 9%。
圍繞 DeepSeek V4 模型發布的一個主要問題是,用於訓練和支持它的晶片是哪些。
中國科技巨頭華為週五證實,其最新的 AI 計算集群(由其昇騰 AI 處理器提供支持)可以支持 DeepSeek 的 V4 模型。
然而,與美國 AI 晶片領導者 Nvidia 的晶片相比,華為晶片在訓練中的使用程度仍不清楚。
由於華盛頓不斷變化的出口管制,中國開發商被限制直接購買 Nvidia 最先進的 AI 晶片。
與此同時,北京加大了發展國內晶片產業的力度,並據報導敦促中國科技公司採用華為等晶片製造商的國產替代品。
Counterpoint 的 Wei Sun 表示,V4 在本地晶片上原生運行的能力可能具有巨大的影響,有助於北京實現更大的 AI 主權,並進一步減少對 Nvidia 的依賴。
她補充說:「這最終也將加速全球 AI 的發展。」
在 DeepSeek 宣布 V4 發布後,中國合同晶片製造商的股價在香港上漲,中芯國際(SMIC)和華虹半導體(Hua Hong Semiconductor)分別飆升 9% 和 15%。