我們很高興推出 Mercury 2 — 全球最快的推理語言模型,旨在讓生產環境中的 AI 體驗如瞬時般流暢。

生產環境中的 AI 不再是單一提示和單一答案。它是一連串的循環:代理、檢索管道和提取作業在背景大量執行。在循環中,延遲不會只出現一次。它會累積在每個步驟、每個使用者、每次重試中。

然而,目前的 LLM 仍然面臨相同的瓶頸:自迴歸、序列解碼。一次一個 token,從左到右。

Mercury 2 不會循序解碼。它透過平行精煉生成回應,同時產生多個 token,並在少數幾個步驟內收斂。它不像打字機,更像編輯一次修改完整草稿。結果是:生成速度快 5 倍以上,且速度曲線與以往截然不同。

這種速度優勢也改變了推理的權衡。如今,更高的智慧意味著更多的測試時間計算 — 更長的鏈、更多的樣本、更多的重試 — 直接以犧牲延遲和成本為代價。擴散式推理能在即時延遲預算內獲得推理級的品質。

Mercury 2 改變了生產部署的品質-速度曲線:

速度:在 NVIDIA Blackwell GPU 上每秒 1,009 個 token

價格:輸入 token 每百萬個 0.25 美元 · 輸出 token 每百萬個 0.75 美元

品質:與領先的速度優化模型競爭

功能:可調式推理 · 128K 上下文 · 原生工具使用 · 與架構對齊的 JSON 輸出

我們針對使用者實際感受到的速度進行優化:使用者體驗時刻的響應能力 — 高併發下的 p95 延遲、一致的輪次間行為,以及系統繁忙時穩定的吞吐量。

「Inception 的 Mercury 2 展示了當新模型架構遇上 NVIDIA AI 基礎設施時的可能性。在 NVIDIA GPU 上超越每秒 1,000 個 token,突顯了我們平台在支援各種 AI 工作負載方面的效能、可擴展性和通用性。」

Shruti Koparkar,NVIDIA 加速運算事業群產品資深經理

Mercury 2 在延遲敏感的應用程式中表現出色,這些應用程式的使用者體驗不容妥協。

自動完成、下一個編輯建議、重構、互動式程式碼代理 — 開發人員在其中參與的流程,任何停頓都會打斷思緒。

「建議的出現速度之快,讓人感覺像是自己思考的一部分,而不是需要等待的東西。」

代理工作流程每個任務會鏈接數十次推理呼叫。減少每次呼叫的延遲不僅節省時間,還改變了您可以負擔執行的步驟數量,以及最終輸出的品質。

「我們現在正在利用最新的 Mercury 模型來智慧化地優化大規模的廣告活動執行。透過即時呈現洞察並動態增強投放,我們正在推動更強的效能、更高的效率,以及一個更具彈性、由 AI 驅動的廣告生態系統。這項進展鞏固了我們對自主廣告的承諾,即智慧系統不斷優化執行,為我們的客戶帶來可衡量的成果。」

Adrian Witas,Viant 資深副總裁兼首席架構師

「我們一直在評估 Mercury 2,因為它無與倫比的延遲和品質,這對於即時轉錄清理和互動式 HCI 應用程式尤其有價值。沒有其他模型能接近 Mercury 所能提供的速度!」

Sahaj Garg,Wispr Flow 合夥創辦人兼技術長

「Mercury 2 的速度至少是 GPT-5.2 的兩倍,這對我們來說是遊戲規則的改變者。」

Suchintan Singh,Skyvern 合夥創辦人兼技術長

語音介面是 AI 中延遲預算最嚴格的應用。Mercury 2 讓推理級的品質在自然語音的節奏內變得可行。

「我們打造逼真的 AI 影片頭像,與真人進行即時對話,因此低延遲不是錦上添花,而是全部。Mercury 2 在我們的語音堆疊中是一個重大的突破:快速、一致的文字生成,讓整個體驗感覺自然且人性化。」

Max Sapo,Happyverse AI 執行長兼合夥創辦人

「Mercury 2 的品質非常出色,其低延遲讓語音代理更加響應迅速。」

Oliver Silverstein,OpenCall 執行長兼合夥創辦人

多跳檢索、重新排序和摘要的延遲會快速堆疊。Mercury 2 讓您可以在不超出延遲預算的情況下,將推理加入搜尋循環。

「我們與 Inception 的合作讓我們的搜尋產品能夠實現即時 AI。所有 SearchBlox 客戶,無論是在客戶支援、合規、風險、分析和電子商務領域,都能從跨所有數據的次秒級智慧中受益。」

Timo Selvaraj,SearchBlox 首席產品官

Mercury 2 與 OpenAI API 相容。直接整合到您現有的堆疊中 — 無需重寫。

如果您正在進行企業評估,我們將與您合作,根據您預期的服務限制,進行工作負載匹配、評估設計和效能驗證。