黃金集合是機率性行為的單元測試:精心策劃的案例、版本化的評分標準和閘道,可防止品質迴歸意外上線。
這兩種方法都創造了引人注目的個人成長機會。
黃金集合是將「似乎更好」轉變為「確實更好」的方法——或者更現實地說,「比前一版本出現更少昂貴的錯誤」。
黃金集合是精心策劃的代表性案例集合,用於評估機率性工作流程在變更後是否仍符合可接受的範圍。
這個定義很重要,因為「評估」一詞經常被濫用。
許多團隊聲稱他們有評估,但實際上他們只有以下三種情況之一:
一個真正的黃金集合比這更嚴格。
這就是為什麼黃金集合屬於機率核心/確定性外殼模型。如果外殼強制執行行為,黃金集合則證明該行為是否在最新的變更中得以保留。
有關將黃金集合置於受管系統評估領域內的更廣泛架構,請參閱 AI 系統的 Heavy Thought 模型和簡潔的框架中心。
AI 系統特別擅長產生聽起來貌似合理的迴歸。
提示的微調可以改善一類答案,同時悄悄損壞拒絕行為。
檢索的變更可以提高召回率,同時使基礎變更糟。
模型升級聽起來可能更聰明,但在政策限制下變得不太可靠。
沒有黃金集合,這些迴歸通常會透過以下方式之一被發現:
這四種都是技術上的回饋管道。沒有一種是理想的。
黃金集合的存在是為了將發現(迴歸)提前。
它們在生產環境之前回答一個極其簡單的問題:
一個有用的黃金集合不僅僅是一個範例資料夾。它是一份帶有明確欄位的合約。
至少,每個案例應包含:
這些元資料很重要,因為您想知道案例在強調什麼:
這不是神聖不可侵犯的。重點是讓案例足夠明確,以便每次有人想要發布答案時,評分方法都不需要重新發明。
並非每個案例都是「以最大的說服力正確回答」。
這就是您如何防止系統因自信地做錯事而受到獎勵。
當迴歸的範圍是支出漂移而不是單純的答案品質時,適用的伴侶是 AI 系統中的成本尖峰控制。
當系統影響以下情況時,這變得強制性:
第一天您不需要一個巨大的黃金集合。
一旦工作流程的重要性足以讓在生產環境中發現迴歸會令人尷尬、昂貴,或兩者兼有,您就需要一個。
黃金集合不能取代:
它們與這些系統一起工作。它們不會取代它們。
當黃金集合的設計旨在對抗團隊通常欺騙自己的方式時,它們最有用。
該集合僅包含乾淨、討好的範例,讓工作流程看起來很聰明。
團隊將品質降低為一個總體分數,並錯過了特定行為類別中的迴歸。
如果成本敏感的行為很重要,也請包含一個對預算敏感的子集;欄位形狀的控制姿勢是 AI 系統中的成本尖峰控制。
案例並未表明它們的測試目的,因此檢索迴歸和提示迴歸混雜在同一片迷霧中。
該集合代表了上個季度的的流程,而不是今天的負載。
基於 LLM 的評估器會隨著時間改變行為,而團隊則將評分漂移誤認為產品改進。
該集合僅測試理想的成功路徑,並忽略拒絕、備用、隔離和寫入閘道場景。
最低可行黃金集合工作流程如下所示:
該架構很重要,因為評估不是一次性報告。它是發布閘道。
假設您升級了支援助理背後的模型。
一個嚴謹的黃金集合運行應該回答:
如果答案是「總體分數上升了」,您仍然不知道足夠的資訊可以發布。
對於模型升級使事件分類工作流程聽起來更順暢,同時削弱了升級行為的應用發布失敗,請參閱模型升級是發布,而不是設定。
您一開始不需要專門的評估平台。您需要有紀律的案例設計,以及將評分視為工程而非儀式的心態。
將案例劃分為操作上重要的類別。
這可以防止集合變成一個未區分的提示堆。
在使用 LLM 裁判之前,請詢問是否可以用更簡單的方法對案例進行評分:
確定性檢查更便宜、更快,並且不太可能誤導您。
對於細微的案例,請使用評分維度的標準,例如:
固定評分標準版本。如果評分標準變更,也將其視為變更表面。
除非您喜歡緩慢的管道和模糊的信號,否則不要為每次變更運行所有案例。
將變更映射到相關的測試切片:
每一次事件、差點發生的事故或痛苦的生產驚喜都應該引發一個簡單的問題:
生產故障是昂貴的。至少,讓它們可重複使用。
黃金集合之所以重要,是因為它們會影響發布決策。
這就是多指標閘道勝過單一總體分數的地方。
這不是閘道在製造麻煩。這是閘道在執行其職責。
一個能捕捉到迴歸的閘道仍然需要一種穩定的命名語言來命名發生了什麼迴歸。這就是錯誤分類學:在 AI 系統故障變成事件之前進行分類,將故障審查變成比一堆客製化軼事更有用的東西。
下一步是發布權限:評估閘道:在沒有猜測的情況下發布 AI 系統。
當與追蹤結合時,黃金集合也會變得更加強大。
機率系統不應因輸出模糊而獲得迴歸紀律的豁免權。
正是這種模糊性,使得迴歸紀律更加重要,而不是更不重要。
黃金集合是您停止憑直覺發布變更的方法。
這就是您如何防止 AI 系統在每週更新都聲稱一切「表現強勁」的同時,卻緩慢退化。
發布 Heavy Thought Cloud:生產 AI 架構原則、系統紀律和決策框架,為發布的工程師而設。