我們發布了 Steerling-8B,這是首款可解釋的模型,能夠追蹤它生成的任何 token 到其輸入上下文、人類可理解的概念,以及其訓練資料。該模型在 1.35 兆 token 上進行訓練,在下游任務上的表現與訓練資料多 2-7 倍的模型相當。Steerling-8B 實現了多項功能,包括在推理時抑制或增強特定概念而無需重新訓練、任何生成內容的訓練資料來源追溯,以及透過概念控制進行推理時的對齊,用明確的概念級引導取代數千個安全訓練範例。
語言模型首次在 80 億參數的規模下,能夠以三種關鍵方式解釋其產生的每個 token。更具體地說,對於 Steerling 產生的任何一組輸出 token,我們可以將這些 token 追溯到:
我們發布了在 1.35T token 上訓練的基礎模型權重,以及用於互動和試玩該模型的配套程式碼。
下方我們展示了 Steerling-8B 在各種類別的提示下生成文本。您可以選擇一個範例,然後點擊輸出中的任何高亮顯示的區塊。下方的面板將會更新顯示:
Steerling 建構於因果離散擴散模型骨幹之上,這讓我們能夠跨越多個 token 進行生成引導,而不僅僅是引導下一個 token。關鍵的設計選擇是將模型的嵌入分解為三個明確的通道:約 33K 的監督式「已知」概念,約 10 萬個模型自行學習的「已發現」概念,以及捕捉剩餘部分的一個殘差。
然後,我們透過訓練損失函數來約束模型,確保模型能夠在不影響效能的前提下,透過概念傳遞訊號。概念透過線性路徑饋入 logits,每個預測都精確地分解為每個概念的貢獻,並且我們可以在推理時編輯這些貢獻而無需重新訓練。有關完整架構、訓練目標和擴展分析,請參閱 Scaling Interpretable Models to 8B。
儘管與同類模型相比,Steerling-8B 的訓練計算量顯著較少,但在標準基準測試中仍取得了具競爭力的效能。下圖顯示了平均效能(跨 7 個基準測試)與訓練 FLOPs 的對數尺度關係,垂直線標記了 Steerling 計算預算的倍數。
Steerling 在整體平均效能上優於 LLaMA2-7B 和 Deepseek-7B,儘管使用的 FLOPs 更少,並且其表現範圍與使用 2-10 倍更多計算量的模型相當。
Steerling 在各種基準測試中的表現,範圍涵蓋通用問答到專注於推理和數學的測試。
在之前的更新中,我們分享了多種評估模型表徵可解釋性的方法。在此,我們提供另一項指標,以深入了解模型對其概念的使用情況。在一個保留的驗證集上,超過 84% 的 token 層級貢獻來自概念模組:模型不僅僅是使用殘差來進行預測。這對於控制很重要:如果模型的預測確實通過概念傳遞,那麼在推理時編輯這些概念實際上會改變模型的行為,而不是在主要工作發生在其他地方時,僅僅微調一個側通道。
Steerling-8B 在保留驗證集上的 token 層級 logit 分佈。超過 84% 的 token 層級貢獻來自概念模組。
一個有用的檢查是移除殘差通道後會發生什麼。在幾個 LM Harness 任務上,移除殘差只產生了微小的影響,這表明模型的預測訊號主要通過概念傳遞,而不是隱藏的「其他所有」通道。
在沒有模型殘差部分的情況下,模型在各種基準測試中的效能變化。這表明模型主要依賴概念(無論是監督式還是已發現的)來產生其輸出。
最後,Steerling 在保留驗證資料集上,以 96.2% 的 AUC 偵測已知概念的能力。