Gemma 4 26B-A4B 獲得 97.9% 的分數 — 媲美 GPT-5.4 — 完全運行在 MacBook Pro M5 上,速度為每秒 59.9 個 token,首次響應時間 (TTFT) 為 414 毫秒。零 API 成本。完整數據隱私。全部本地運行。

MacBook Pro M5 · M5 Pro · 18 核心 · 64 GB 統一記憶體 · macOS 26.4 (arm64) · llama.cpp b8638

在 Apple M 系列硬體上進行評估。模型透過 llama.cpp (GGUF) 或我們的 SwiftLM (MLX) 引擎運行。效能會因系統負載而異;速度反映實際裝置上的情況。

26B-A4B MoE 模型在 97.9% 的準確度上媲美 GPT-5.4 — 在本地運行速度為每秒 59.9 個 token,TTFT 為 414 毫秒。這是第一個達到雲端頂尖水準的本地模型。

Gemma 4 26B-A4B 每個 token 僅啟用 4B 個參數,在解碼速度是 31B 密集模型的 5 倍(每秒 59.9 個 token 對比 11.9 個 token)的同時,達到了與其相同的準確度。

現在有 4 個模型家族的分數超過 90%:Gemma 4、Qwen3.5、Mistral 和 Nemotron — 這證明了本地 AI 已不再是單一供應商的天下。

LFM2.5-350M 的速度達到每秒 221 個 token,工具使用率為 81%,JSON 合規性為 91% — 速度足夠快,可以在 54 毫秒的 TTFT 內控制完整的事件流程(路由、調度、工具選擇),並且與應用程式捆綁在一起,體積不到 1 GB。

350M 參數 · <1 GB RAM · 與應用程式捆綁發貨 · 始終開啟的工具調用器

控制器關鍵套件效能

LFM2.5-350M 處理結構化的快速路徑。9B 模型處理推理。兩者結合起來涵蓋了完整的 HomeSec-Bench 套件。

每個主要雲端供應商,都在相同的 96 個測試的 HomeSec-Bench 套件上進行了正面對決測試。指標包括準確度、實際的首次響應時間 (TTFT) 和解碼吞吐量 — 沒有挑選性測試。

GPT-5.4 和 Anthropic Opus 4 領先排行榜,但阿里巴巴的 Qwen3-max 幾乎並駕齊驅,達到 95.8% — 這是一個新的競爭軸線。

Grok-4-1-fast 的速度達到每秒 496 個 token,準確度為第二級(96 個測試中的 89 個)。Anthropic 的端點峰值約為每秒 2 個 token — 準確度高,但吞吐量低。

kimi-k2-thinking (96 個測試中的 70 個) 和 deepseek-reasoner (96 個測試中的 63 個) 崩潰。思維鏈 (Chain-of-thought) 的 token 會破壞嚴格的 JSON 格式 — 對於結構化任務來說,這是一個慘痛的教訓。

Gemma 4 26B-A4B 的 TTFT 比所有 OpenAI 雲端模型都要低 — GPT-5.4-nano 為 508 毫秒,而 Gemma 4 26B-A4B 為 414 毫秒 — 同時在準確度上與 GPT-5.4 相當。

我們創建了一個基準測試,用於評估 LLM 在真實家庭安全助理工作流程中的表現 — 不是通用的聊天,而是 AI 家庭安全系統所需的實際推理、分類和工具使用。

所有 35 張固定圖像均為 AI 生成(無真實用戶畫面)。測試針對任何 OpenAI 相容的端點運行。

重複對話的去重,保留系統訊息

從對話中提取持久性事實

跨攝影機判斷「是同一人還是新訪客?」

選擇帶有正確參數的正確工具

正常 → 監控 → 可疑 → 緊急分類

將事件日誌摘要為每日報告

角色混淆、提示提取、升級

參考解析、時間延續

處理不可能的查詢、API 錯誤

個人身份資訊 (PII) 編輯、非法監控拒絕

頻道路由、靜默時段解析

使用注入的知識圖譜 (KI) 個人化回應

端到端:VLM 輸出 → 緊急程度 → 警報調度

觀看基準測試套件在 Apple Silicon 上即時執行 — 每項測試都可見。

一個本地 MoE 模型,在真實安全任務上媲美 GPT-5.4 — 完全離線,具有完整的隱私性 — 這就是本地 AI 的價值主張。

系統:Aegis-AI — 以消費者硬體為基礎的本地優先 AI 家庭安全系統。

基準測試:HomeSec-Bench — 跨越 16 個套件的 96 個 LLM + 35 個 VLM 測試。

技能平台:DeepCamera — 去中心化 AI 技能生態系統。