我們閱讀每一則回饋,並非常重視您的意見。
欲查看所有可用的限定符,請參閱我們的文件。
閱讀論文 — 包含完整技術細節、90多項實驗,以及一個AI與人類如何在24小時內共同打造此系統的故事。
這是一個純C/Metal推理引擎,能在配備48GB記憶體的MacBook Pro上運行Qwen3.5-397B-A17B(一個擁有3970億參數的混合專家模型),速度達4.4+ tokens/秒,並提供生產品質的輸出,包括工具調用功能。
整個209GB模型透過自訂的Metal計算管線從SSD串流讀取。無需Python或任何框架,僅使用C、Objective-C及手工調校的Metal著色器。
*2位元量化會在JSON輸出中產生\name\而非"name",導致工具調用不可靠。4位元量化為生產配置。
該模型包含60層Transformer:45層GatedDeltaNet(線性注意力)加15層標準全注意力。每層有512個專家,其中每個token啟用K=4個專家(加上一個共用專家)。隱藏維度為4096。
SSD專家串流 — 專家權重(4位元量化後為209GB)透過NVMe SSD按需讀取,使用平行pread()與GCD調度群組。每層僅載入K=4個活躍專家(約6.75MB)。作業系統頁面快取負責快取管理,無需自訂快取(遵循"信任作業系統"原則)。此設計靈感來自Apple的"LLM in a Flash"論文。
FMA優化反量化核心 — 4位元反量化矩陣向量乘法的內部迴圈將數學運算從(nibble * scale + bias) * x重新排列為fma(nibble, scale*x, bias*x)。預先計算scale*x與bias*x,讓GPU的融合乘加單元能在一條指令中完成反量化與乘法,速度比原始寫法快12%。
Metal計算著色器 — 手寫Metal核心包括:
延遲GPU專家計算 — CMD3(專家前向傳播)提交後不等待,GPU在CPU準備下一層時執行。結合、殘差與正規化也在GPU上完成,直接輸入下一層的注意力投影。
加速線性注意力的BLAS — GatedDeltaNet遞迴使用cblas_sscal、cblas_sgemv與cblas_sger更新64頭×128×128狀態矩陣,速度比純量程式碼快64%。
信任作業系統 — 無自訂專家快取。作業系統頁面快取(約35GB)透過標準LRU管理專家資料快取。我們測試過的所有自訂快取方法(Metal LRU、malloc快取、LZ4壓縮快取)因GPU記憶體壓力或開銷反而較慢。頁面快取自然達到約71%的命中率。
在Apple Silicon上,SSD DMA與GPU計算共用同一記憶體控制器,無法有效重疊。GPU的反量化核心帶寬飽和約418 GiB/s。即使少量背景SSD DMA也會透過記憶體控制器仲裁造成GPU延遲大幅增加。序列管線(GPU → SSD → GPU)為硬體最佳配置。
這是主要的開發機器。引擎明確控制記憶體:
在小筆電上運行大型模型。