此專案最初是 Andrej Karpathy 的 microGPT.py 的 C 語言移植版本 — 一個大約 200 行的 Python GPT,能從頭開始訓練一個字元級的 Transformer。我們將其重寫為純 C99,且零依賴,正如你對 C 語言的預期,它速度快得多。

接著我們提出一個更大的問題:微小的模型真的能具備智慧嗎?

不是透過讓它們變大 — 業界已經在這麼做了。而是讓它們協同工作。我們採用了相同的約 460K 參數引擎,並在不同任務上進行訓練:一個成為規劃者,另一個成為玩家,另一個成為裁判。每個模型都從相同的空白「幹細胞」開始,並根據其訓練數據進行分化。

我們稱它們為細胞器 — 就像生物細胞內的特化結構。

結果令我們驚訝。單獨一個細胞器玩連線遊戲 (Connect-4) 大約能贏 55% 的時間。但當規劃者和玩家透過共享協議協調時,系統能達到 90% — 即使個別模型仍然有一半的時間是錯誤的。管線能捕捉錯誤。協調才是智慧所在。

我們現在已經在 11 款邏輯遊戲中測試了這一點,從井字遊戲到數獨,模型參數從 30K 到 460K 不等。模式保持一致:規模適中的專家協同工作,始終優於單獨工作的單一較大模型。

接著我們問:這在真實數據上有效嗎?

我們進行了一項樂透預測實驗,作為細胞器智慧的負向對照。樂透模型在 0.50 的損失值處達到熵底線 — 它什麼都沒學到,因為樂透開獎是隨機的。這證明了引擎的完整性:在猜謎遊戲 (Mastermind) 和連線遊戲中看到的令人印象深刻的 78–91% 的準確度,是模型真正學習到潛在規則的結果,而不是訓練引擎中存在某些隱藏的缺陷。

我們也探索了將 OPA 應用於連續值域,如金融時間序列。這揭示了一個基本見解:使遊戲協調可靠的 31 個字元詞彙,破壞了預測所需的連續梯度 — 我們稱之為「離散化牆」。連接類別推理與數值感知是活躍的研究方向。

相同的引擎。相同的架構。一個學習遊戲模式,一個在隨機數據上觸及熵底線,一個劃分模式匹配與時間預測之間的界限。這是三種證明。

完整的研究歷程 — 從字元級 Transformer 到基於 VM 的程式碼生成,再到校準的三邊界縮放曲線閉合 — 已記錄在「邊緣的組合式智慧」(Composable Intelligence at the Edge) (21 章 + 附錄,線上版) 中。

誠實聲明 (2026 年 5 月):在關閉縮放曲線實驗捕捉到一個策展器自我重疊洩漏事件後,該專案的頭條數字經過了重新審計。修正後的校準聲明 — 在獨特名詞領域的新釋義測試中,約 75-80% 的檢索率,三個記錄的結構邊界 (策展器、模型、領域邊界),透過工具/scaling_leakage_audit.sh 內建的審計基礎設施 — 取代了先前誇大的檢索聲明。有關綜合資訊,請參閱 docs/research/ORGANELLE_STATE.md;有關監管機構友善的披露登記,請參閱 docs/engineering/CLEAN_ROOM_IMPLEMENTATION/RESEARCH_DISCLOSURE.md。此儲存庫僅供研究使用;產品化策略和各垂直領域的實施計畫已於 2026-05-01 遷移到私有的伴隨儲存庫 (organelles.bio) — 有關索引,請參閱 docs/MIGRATED_TO_ORGANELLES_BIO.md。

包含所有 11 款遊戲的實驗、樂透負向對照、3 個預訓練檢查點、97 個單元測試和 22 個基準測試。請參閱 demos/character-level/ 中的完整列表。

所有基準測試均在 Apple M2 Max (開發機) 上運行,單線程,除非另有說明。模型大小為 360KB–5.4MB,可在任何支援 C99 編譯器的環境中編譯。邊緣裝置測試是未來的研究階段。有關詳細資訊,請參閱 PERFORMANCE。

與 Karpathy 的 microgpt.py 比較:訓練速度約快 1,000 倍,推論速度約快 700 倍 (C 與 Python 的預期差異;真正的貢獻是協調層)。

所有遊戲:訓練好的細胞器對抗隨機對手,每種評估遊戲 100 場。詳細資訊請參閱 RESEARCH_ORGANELLE_GAMES。

此引擎中提供的關鍵技術貢獻:

可選:用於預訓練檢查點的 Git LFS (git lfs pull)。

MicroGPT-C 完全在裝置上運行,沒有遙測、沒有雲端呼叫、沒有數據收集。在狹窄語料庫上訓練的小型模型會繼承該語料庫的偏見 — 部署時請注意這一點。高信心表示模型已見過類似模式,而非輸出是正確的。對於安全關鍵應用,請務必透過確定性檢查 (裁判模式) 或人工審查來驗證。

有關道德準則,請參閱 CONTRIBUTING.md。

此專案以透明的方式透過人機協作建立 — 這與 MicroGPT-C 所探索的協調智慧的理念相同。

零依賴 C99 GPT-2 引擎,專為邊緣 AI 設計。參數少於百萬的模型可在裝置上於數秒內訓練。細胞器管線架構 (OPA) 協調專門化的微模型 — 在 11 款邏輯遊戲中,使用 30K–160K 參數的模型,勝率高達 91%。組合優於容量。