在您的個人電競 PC NVIDIA 或 AMD 顯示卡(12GB 或以上)上運行擁有 1250 億參數的 AI 模型 · Windows 或 Linux · 免費且開源

A voxel pagoda garden, 1 shot prompt running on an RTX 5070 with Strata (IQ3_S, 128K context) · full video (49 s)

Strata 在一般 PC 上運行 Qwen3.8-Flash-Next。這是一個大型、智慧的 AI 模型,通常需要伺服器才能運行。它可以聊天、編寫程式碼、讀取圖片,並與您的應用程式和程式碼代理協同工作。所有資料都不會離開您的電腦。

我們在兩台普通的電競 PC 上進行了測試。一個 token 大約是 ¾ 個單字。

NVIDIA:Q2_0 使用引擎 0.1.36,其他列使用 0.1.26(4K 回應,32K 提示)。完整的表格在 DETAILS.md 中。擁有更多 VRAM 的顯示卡速度更快:RTX 3090(24GB)應該能每秒寫入約 100-140 個 token。長對話和其他顯示卡:每個模型的速度,社群結果。

Strata 是免費的。如果它在您的 PC 上運行良好,一杯咖啡的費用可以支持其持續開發。

安裝程式會設置好所有其他東西。兩張或三張顯示卡可以共享模型(多 GPU)。

由社群成員在自己的機器上編寫和測試的實驗性功能:

您是否使用 AI 編程助手(Claude Code, Cursor, Codex, GitHub Copilot, ...)?將以下內容貼入其中:

它會檢查您的顯示卡、RAM 和磁碟,並選擇適合的模型。然後它會安裝並啟動模型,並告訴您如何連接您的應用程式。AI 工具也可以透過其 MCP 伺服器安裝、啟動和停止 Strata。

下載 Strata 並解壓縮(或 git clone)。Windows:雙擊 START-HERE.bat。Linux:在 Strata 資料夾中執行 ./setup.sh。

步驟對 NVIDIA 和 AMD 都是相同的。安裝程式會找到您的顯示卡並為其設置正確的引擎。它會詢問您幾個問題:

每次按下 Enter 鍵即可選擇推薦的答案。然後它會下載模型(約 70GB)並啟動它。如果下載中斷,請再次運行:它會從中斷處繼續。您的瀏覽器將在 http://127.0.0.1:8080 打開 Strata 應用程式。

當模型啟動時,您的 PC 可能會變慢或停止回應 1-3 分鐘(第一次最長)。Strata 會將 35-55GB 的資料載入您的 RAM,並鎖定其中一部分供顯示卡使用。這是正常的。請耐心等待,不要關閉視窗。視窗會顯示 Strata 的操作。

下次,請再次運行 START-HERE.bat(或 ./setup.sh)。它會立即啟動,並且不會重複下載。關閉其視窗即可停止模型。UPDATE.bat(./update.sh)可以在不啟動模型的情況下更新 Strata。更新、Docker、多張顯示卡、檔案存放位置以及所有選項:docs/INSTALL.md。

安裝程式會為您的 RAM 推薦一個模型。同一個模型有幾種不同的尺寸,壓縮程度不同。較小的尺寸速度更快。較大的尺寸稍微更聰明。

尺寸、下載和適合的硬體:docs/MODELS.md。要稍後添加另一個模型,請運行 SETUP.bat(Linux:./setup.sh --setup)。

Strata 應用程式的 Monitor(左側)在編程代理編寫影片中的 pagodagarden 時(右側)

更多資訊:您的聊天記錄儲存位置,API。

更多問題及其解決方案:docs/TROUBLESHOOTING.md。仍然卡住?打開一個 issue 並附上 Strata 資料夾中的 strata-<model>.log。發現安全問題?請私下回報:SECURITY.md。

像這樣的模型通常運行在擁有數百 GB 圖形記憶體的伺服器上。您的顯示卡只有 12-24GB。Strata 透過在您的整個 PC 上分散工作來讓模型適應。想像一個廚房:您經常使用的東西放在檯面上,其餘的則放在儲藏室裡。

更詳細的解釋:docs/HOW_IT_WORKS.md。每個部分及其數字:詳細資訊和論文。

該模型是 Qwen team 的 Qwen3.8-Flash-Next。它由 ISTA-DASLab、UkisAI(Swift 1.5)和 Unsloth 壓縮。Strata 使用了 llama.cpp / ggml 的部分。所有鳴謝:docs/HOW_IT_WORKS.md。Strata 在 MIT 授權下開源。少數部分和所有模型都有自己的授權(哪些授權)。

Strata 是免費且開源的。如果您覺得它對您有幫助,您可以支持其開發:

Qwen3.8-Flash-Next 在任何消費級硬體上運行:Windows / Linux 的一鍵安裝。Strata 推理引擎,本地端的 OpenAI/Anthropic API,可選的圖像輸入。

Strata:讓大型 AI 模型 Qwen3.8-Flash-Next 在家用電腦上運行,支援一鍵安裝Strata:讓大型 AI 模型 Qwen3.8-Flash-Next 在家用電腦上運行,支援一鍵安裝Strata:讓大型 AI 模型 Qwen3.8-Flash-Next 在家用電腦上運行,支援一鍵安裝Strata:讓大型 AI 模型 Qwen3.8-Flash-Next 在家用電腦上運行,支援一鍵安裝Strata:讓大型 AI 模型 Qwen3.8-Flash-Next 在家用電腦上運行,支援一鍵安裝