使用其他 AI 模型來訓練 AI 模型,已成為新創實驗室的熱門目標——現在,Anthropic 研究員計畫中的一位研究員,讓我們得以一窺其在實際應用中的樣貌。

週五,Anthropic 發布了一篇題為「自動化研究員可可靠地緩解對齊失敗」(Automated Researchers Can Reliably Mitigate Alignment Failures)的新論文,詳細說明了 AI 系統如何可靠地提升模型在特定對齊基準上的表現。當給予 10 個關於特定不當行為的基準時,自動化系統能夠在每一個基準上都提升表現,同時不損害整體效能。

該系統由 Anthropic 研究員陳月涵(Chen Yueh-Han)領導,複製了傳統研究方法的許多方面。每個自動化系統都會搜尋現有文獻,提出一種方法,並使用該方法訓練模型 30 分鐘,在數次迭代中逐步提高基準。有效的做法會被保留,無效的則被捨棄,讓系統能夠快速且大規模地運作。

論文中寫道:「總體而言,這些結果提供了早期證據,表明訓練後的自動化對齊可能在短期內變得實用。」

這篇論文是邁向遞歸自我改進(recursive self-improvement)的一步,許多人認為這是 AI 進步的下一個重要階段。如果模型能夠改進自身的對齊訓練,那麼它們就有可能更廣泛地改進訓練實踐——屆時,人類 AI 研究員可能很快就會過時。

論文毫不避諱地探討了這個想法,明確地將自動化對齊研究員(AAR)與其人類對應者進行比較。論文中寫道:「最好的 AAR 方法平均在六小時內就能超越有經驗的人類提出的方法。人類引導的研究方向並不會帶來更強的表現。」

甚至還有成本比較,以防有人還沒被說服。「AAR 每小時的 API 推理成本約為 4 美元,而我們支付給人類研究員的費用為每小時 150 美元。」

公平地說,論文也指出了這種方法的一些局限性。自動化系統僅在基準反映實際對齊目標的情況下才有效,即使如此,在建立和維護這些基準方面仍有大量工作要做——更不用說維護和擴展自動化研究員所參考的文獻了。