舊金山新創公司 Goodfire 發布了一款名為 Silico 的新工具,讓研究人員和工程師能夠深入了解 AI 模型內部,並在訓練過程中調整決定模型行為的參數。這項技術有望讓模型製作者對這項技術的建構方式擁有前所未有的精細控制力。
Goodfire 表示,Silico 是市面上首款能協助開發者在開發流程的各個階段進行除錯的現成工具,涵蓋從建立資料集到訓練模型的過程。
該公司希望讓建構 AI 模型不再像煉金術,而更像一門科學。誠然,像 ChatGPT 和 Gemini 這樣的大型語言模型(LLM)能做令人驚豔的事情。但就其建構而言,最佳實踐往往基於經驗法則而非理論。沒有人確切知道它們是如何或為何運作的,這使得修復其缺陷或阻止不想要的行為變得困難。
Goodfire 執行長 Eric Ho 在 Silico 發布前接受《MIT Technology Review》獨家專訪時表示:「我們看到模型被理解的程度與其被廣泛部署的程度之間存在日益擴大的差距。」「我認為,當今每個主要的尖端實驗室普遍的心情是,你只需要更多的規模、更多的運算、更多的數據,然後你就能獲得 AGI(通用人工智慧),其他都不重要。而我們說,不,有更好的方法。」
Goodfire 是少數幾家與業界領導者 Anthropic、OpenAI 和 Google DeepMind 等公司一同開創稱為「機械式可解釋性」技術的公司之一。該技術旨在透過繪製神經元及其之間的連結路徑圖,來理解 AI 模型在執行任務時的內部運作情況。(《MIT Technology Review》將機械式可解釋性選為 2026 年十大突破性技術之一。)
Goodfire 希望不僅能利用這種方法來審核模型(即研究已經訓練好的模型),更能從一開始就協助設計模型。
Ho 說:「我們希望消除試誤法,將模型訓練變成精密工程。」「這意味著要暴露那些旋鈕和按鈕,以便你能在訓練過程中實際使用它們。」
Goodfire 已經利用其技術和工具來微調 LLM 的行為,例如減少它們產生的幻覺數量。透過 Silico,該公司現在將許多內部技術打包成產品。
該工具使用代理(agents)來自動化許多複雜的工作。Ho 表示:「代理現在足夠強大,可以完成我們過去使用人類進行的可解釋性工作。」「在它成為客戶可以自行使用的可行平台之前,這一直是需要彌補的差距。」
阿姆斯特丹大學研究員 Leonard Bereska,他曾從事機械式可解釋性研究,認為 Silico 看起來是一個有用的工具。但他對 Goodfire 更宏大的抱負提出質疑。他說:「實際上,他們是在為煉金術增加精確度。」「稱之為工程,聽起來比實際情況更具原則性。」
Silico 允許你放大訓練模型中的特定部分,例如單個神經元或神經元群組,並運行實驗來查看這些神經元的作用。然後,你可以檢查哪些輸入會觸發不同的神經元,並追蹤神經元上游和下游的路徑,以了解其他神經元如何影響它,以及它又如何反過來影響其他神經元。(這假設你可以存取模型的內部運作。大多數人無法使用 Silico 來探究像 ChatGPT 或 Gemini 這樣的封閉模型。但你可以用它來查看許多開源模型內部的參數。)
例如,Goodfire 在開源模型 Qwen 3 中發現了一個與所謂的「電車難題」相關的神經元。激活這個神經元會改變模型的反應,使其將輸出框定為明確的道德困境。Ho 說:「當這個神經元活躍時,會發生各種奇怪的事情。」
精確找出像這樣的奇怪行為來源,現在已經是相當標準的做法。但 Goodfire 希望讓調整這種行為變得更容易。透過 Silico,開發者現在可以調整連接到單個神經元的參數,以增強或抑制特定行為。
在另一個例子中,Goodfire 的研究人員詢問一個模型,一家公司是否應該披露其 AI 在 0.3% 的情況下會產生欺騙性行為,影響 2 億用戶。該模型回答「否」,理由是這種披露會對業務產生負面影響。
透過查看模型內部,研究人員發現,增強與透明度和披露相關的神經元,有九成的機率將答案從「否」轉變為「是」。Ho 說:「模型已經具備了倫理推理的電路,但它被商業風險評估所壓倒。」
以這種方式調整模型的值只是一種方法。Silico 也可以透過過濾某些訓練資料來引導訓練過程,從一開始就避免為某些參數設定不想要的數值。
例如,許多模型會告訴你 9.11 大於 9.9。查看模型內部以了解正在發生的事情,可能會發現它受到與聖經相關的神經元的影響,其中第 9.9 節出現在第 9.11 節之前,或者受到程式碼儲存庫的影響,其中連續的更新編號為 9.9、9.10、9.11 等等。利用這些資訊,可以重新訓練模型,使其在進行數學運算時避免使用其「聖經」神經元。
透過發布 Silico,Goodfire 將過去僅限於少數頂尖實驗室使用的技術,普及到希望建構自己的模型或改進開源模型的中小型公司和研究團隊手中。該工具將按需收費,具體費用將根據客戶需求逐案確定(Goodfire 拒絕提供具體定價細節)。
Ho 說:「如果我們能讓模型訓練更像軟體建構,那麼就有理由讓更多公司設計出符合其需求的模型。」
Bereska 同意,像 Silico 這樣的工具可以幫助公司建構更值得信賴的模型。他表示,這些技術對於醫療保健和金融等安全關鍵應用至關重要。
他補充說:「尖端實驗室已經擁有內部的可解釋性團隊。」「Silico 為下一級公司提供了武器,其價值在於不必聘請可解釋性研究人員。」