我們今天預覽了在 Apple Silicon 上執行 Ollama 的最快方式,由 Apple 的機器學習框架 MLX 提供支援。

這將解鎖新的效能,加速您在 macOS 上最嚴苛的工作:

加速像 Pi 或 Claude Code 這樣的程式碼代理。

Ollama 在 Apple Silicon 上現在建構於 Apple 的機器學習框架 MLX 之上,以利用其統一記憶體架構。

這使得 Ollama 在所有 Apple Silicon 裝置上的速度都有大幅提升。在 Apple 的 M5、M5 Pro 和 M5 Max 晶片上,Ollama 利用新的 GPU 神經加速器來加速首次 token 的生成時間(TTFT)和生成速度(每秒 token 數)。

測試於 2026 年 3 月 29 日進行,使用了阿里巴巴的 Qwen3.5-35B-A3B 模型(量化為 NVFP4)以及 Ollama 的先前版本(量化為 Q4_K_M),使用 Ollama 0.18。Ollama 0.19 將實現更高的效能(使用 int4 量化執行時,預填充 1851 token/s,解碼 134 token/s)。

Ollama 現在利用 NVIDIA 的 NVFP4 格式,在降低推論工作負載的記憶體頻寬和儲存需求同時,維持模型的準確性。

隨著越來越多的推論供應商使用 NVFP4 格式擴展推論能力,這使得 Ollama 使用者能夠在生產環境中獲得與其相同的結果。

這進一步使 Ollama 能夠運行由 NVIDIA 模型優化器優化的模型。其他精度將根據 Ollama 的研究和硬體合作夥伴的設計和使用意圖提供。

Ollama 的快取已升級,以提高程式碼和代理任務的效率。

較低的記憶體利用率:Ollama 現在將在對話之間重複使用其快取,這意味著當使用像 Claude Code 這樣的工具共享系統提示時,記憶體利用率更低,快取命中率更高。

智慧檢查點:Ollama 現在將在其提示的智慧位置儲存快取的快照,從而減少提示處理時間並加快回應速度。

更聰明的逐出:即使較舊的分支被丟棄,共享的前綴也能存活更長時間。

此 Ollama 預覽版本加速了新的 Qwen3.5-35B-A3B 模型,其取樣參數已針對程式碼任務進行了調整。

請確保您的 Mac 擁有超過 32GB 的統一記憶體。

我們正在積極開發支援未來模型。對於擁有在支援架構上微調的自訂模型的用戶,我們將引入一種更簡單的方式將模型匯入 Ollama。同時,我們將擴展支援的架構列表。