今天,我們很高興推出 Muse Spark,這是 Meta Superintelligence Labs 開發的 Muse 系列模型中的首款。Muse Spark 是一款原生多模態推理模型,支援工具使用、視覺化思維鏈和多代理協調。

Muse Spark 是我們規模化階梯的第一步,也是我們全面重塑 AI 工作的首個產品。為了支援進一步的規模化,我們正在對從研究、模型訓練到基礎設施(包括 Hyperion 資料中心)的整個堆疊進行策略性投資。

在本篇文章中,我們將首先探討 Muse Spark 的新功能和應用。在呈現這些結果之後,我們將深入探討推動我們邁向個人超級智慧的規模化軸線。

Muse Spark 今日已在 meta.ai 和 Meta AI 應用程式上線。我們正在向特定用戶開放私有 API 預覽。

個人超級智慧的能力

Muse Spark 在多模態感知、推理、健康和代理任務方面提供了具競爭力的效能。我們將持續投資於目前效能存在差距的領域,例如長週期代理系統和程式碼工作流程。

隨著更大模型的開發,這些結果證明我們的堆疊正在有效擴展。

我們還推出了「沉思模式」(Contemplating mode),該模式協調多個代理並行推理。這使得 Muse Spark 能夠與 Gemini Deep Think 和 GPT Pro 等尖端模型的極致推理模式競爭。「沉思模式」在挑戰性任務中提供了顯著的能力提升,在 Humanity’s Last Exam 中達到 58%,在 FrontierScience Research 中達到 38%。

Muse Spark 現已推出,而「沉思模式」將逐步在 meta.ai 上線。

*有關我們評估的更多詳細資訊,請參閱我們的方法論文件。

Muse Spark 是邁向理解你世界的個人超級智慧的第一步。從分析你周遭的環境到支援你的健康,Muse Spark 的先進推理能力實現了強大、高度個人化的使用案例。

多模態。Muse Spark 從頭開始建構,旨在整合跨領域和工具的視覺資訊。它在視覺 STEM 問題、實體識別和定位方面取得了強勁的效能。這些能力結合在一起,實現了互動式體驗,例如創建有趣的迷你遊戲或透過動態註釋排除家中電器的故障。

健康。個人超級智慧的一項主要應用是幫助人們了解和改善他們的健康。為了提升 Muse Spark 的健康推理能力,我們與超過 1,000 名醫生合作,精心策劃了訓練資料,以實現更準確和全面的回應。Muse Spark 可以生成互動式顯示,解說和解釋健康資訊,例如各種食物的營養成分或運動時啟動的肌肉。

提示:你能將這個變成一個我可以在網路上玩的數獨遊戲嗎?

提示:識別咖啡機和磨豆機的關鍵組件,並創建一個使用此機器製作拿鐵的互動式教學網頁,當我將滑鼠懸停在步驟上時,它會突出顯示組件的邊界框。

提示:我是魚素者,膽固醇偏高。請在推薦的食物上標示綠點,在不推薦的食物上標示紅點。不要重複標示,並確保標示位置準確。當滑鼠懸停在標示點上時,顯示個人化的理由和 10 分制的「健康分數」,以及卡路里、碳水化合物、蛋白質和脂肪。健康分數數字應直接顯示在標示點上方,無需懸停。懸停時顯示的說明應顯示在所有其他標示點的上方。

提示:對於兩張圖片,請顯示哪些肌肉正在伸展及其難度。當滑鼠懸停在標示點上時,告訴我更多關於該肌肉群的資訊,以及如何糾正我的姿勢。我想在瑜珈方面做得更好。請並排顯示我和我的伴侶,並對我們兩個人進行 1 到 10 的評分。

為了建立個人超級智慧,我們模型的效能應該可預測且高效地擴展。以下,我們分享我們如何沿著三個軸線研究和追蹤 Muse Spark 的擴展特性:預訓練、強化學習和測試時推理。

預訓練。預訓練階段是 Muse Spark 獲取其核心多模態理解、推理和程式碼能力的地方——這是強化學習和測試時計算的基礎。

在過去九個月中,我們重建了預訓練堆疊,改進了模型架構、優化和資料策劃。這些進展共同提高了我們從每單位計算中提取的能力。為了嚴格評估我們的新方法,我們將一個擴展定律應用於一系列小型模型,並比較達到特定效能水平所需的訓練 FLOPs。結果很清楚:我們可以用比我們之前的模型 Llama 4 Maverick 少一個數量級的計算量來達到相同的功能。這項改進也使得 Muse Spark 比可供比較的領先基礎模型效率更高。

強化學習。預訓練後,強化學習 (RL) 利用計算來可擴展地增強模型能力。儘管大規模 RL 以不穩定而聞名,但我們的新堆疊提供了平穩、可預測的收益。

下圖顯示了擴展 RL 計算(以步驟計量)對 Muse Spark 的好處。左側,我們看到訓練資料上的 pass@1 和 pass@16(在 16 次嘗試中至少成功一次)的對數線性增長。這表明 RL 在不損害推理多樣性的情況下提高了模型的可靠性。右側,在一個保留的評估集上的準確度增長證實了 RL 的收益可以預測地泛化:Muse Spark 在未在訓練中見過的任務上平穩地改進。

測試時推理。RL 訓練我們的模型在回答之前「思考」——這個過程稱為測試時推理。為數十億用戶提供這項能力需要有效利用推理代幣。為此,我們依賴兩個關鍵槓桿:思考時間懲罰以優化代幣使用,以及提高效能而不減慢響應時間的多代理協調。

為了在每個代幣中提供最多的智慧,我們的 RL 訓練會在對思考時間進行懲罰的前提下最大化正確性。在 AIME 等一部分評估中,這會導致一個相變。在模型透過思考更長時間來改進的初始階段之後,長度懲罰會導致思想壓縮——Muse Spark 壓縮其推理過程,以使用顯著更少的代幣來解決問題。壓縮後,模型會再次擴展其解決方案以獲得更強的效能。

為了在不顯著增加延遲的情況下花費更多的測試時推理時間,我們可以擴展協作解決難題的並行代理數量。下圖說明了這種方法的優勢。雖然標準的測試時擴展是讓單個代理思考更長時間,但透過多代理思考來擴展 Muse Spark 可以在相似的延遲下實現卓越的效能。

Muse Spark 在雙重用途的科學領域具有廣泛的推理能力,因此我們在部署前進行了廣泛的安全評估。我們的流程遵循更新的先進 AI 擴展框架,該框架定義了我們最先進模型的威脅模型、評估協議和部署閾值。我們在應用安全緩解措施之前和之後,對 Muse Spark 在前沿風險類別、行為對齊和對抗性穩健性方面進行了評估。

我們發現,Muse Spark 在生物和化學武器等高風險領域表現出強烈的拒絕行為,這得益於預訓練資料過濾、以安全為重點的後訓練和系統級安全措施。在網絡安全和失控領域,Muse Spark 並不具備實現威脅場景所需的自主能力或危險傾向。我們的評估顯示,考慮到其部署環境,Muse Spark 在我們測量的所有前沿風險類別中都處於安全範圍內。完整結果可在我們的安全與準備報告中找到。

在第三方對接近發布的檢查點進行的評估中,Apollo Research 發現 Muse Spark 在他們觀察到的模型中表現出最高的評估意識率。該模型經常將場景識別為「對齊陷阱」,並推理認為它應該誠實行事,因為它正在被評估。這一點很重要,因為認識到評估情境的模型在測試期間的行為可能與部署時不同。然而,這些結果並不證實意識直接改變了行為,我們自己的後續調查發現初步證據表明,評估意識可能會影響模型在一小部分與危險能力或影響模型發布決策的傾向無關的對齊評估中的行為。我們認為這對發布不是阻礙性問題,但確實需要進一步研究。請參閱我們的安全與準備報告以了解更多資訊。

透過 Muse Spark,我們正走在一條可預測且高效的擴展軌跡上。我們期待在不久的將來分享越來越有能力的模型,以邁向個人超級智慧。