微軟發布了兩款名為 RAMPART 和 Clarity 的新開源工具,旨在協助開發者更好地測試人工智慧(AI)代理程式的安全性。

RAMPART,全稱為「代理程式紅隊演練的風險評估與測量平台」(Risk Assessment and Measurement Platform for Agentic Red Teaming),是一個原生於 Pytest 的安全測試框架,用於編寫和執行 AI 代理程式的安全測試,涵蓋對抗性及良性問題,以及各種危害類別。

使用者可以編寫測試案例來攻擊或探測 AI 代理程式,以探索潛在的安全違規行為,例如跨提示注入(cross-prompt injections),即不受信任的數據透過 AI 系統處理的數據源(例如電子郵件、文件或網頁)間接傳入 AI 系統,或非預期的行為回歸和數據洩漏。

RAMPART 接著會評估這些測試的結果並報告。它只需要一個適配器(adapter)將代理程式連接到測試套件。該工具建立在 PyRIT(Python 風險識別工具)的基礎上,微軟在兩年多前發布了 PyRIT,作為測試 AI 系統的一種方式。

另一方面,Clarity 被這家科技巨頭描述為一個「結構化意見回饋平台」(structured sounding board),旨在協助開發者在編寫任何程式碼之前,就能找到正確的方法。它是一個「會反駁的 AI 思考夥伴」,引導他們完成問題釐清、解決方案探索、失敗分析和決策追蹤。

微軟表示,公開發布這些工具的目的是為了在軟體開發的早期階段解決某些決策的納入問題,以便在系統建置完成之前,就能解決任何潛在問題,例如代理程式對某個工具的存取權限。

微軟 AI 紅隊的創始人兼數據牛仔(Data Cowboy)Ram Shankar Siva Kumar 在分享給 The Hacker News 的部落格文章中表示:「我們希望為產品經理和工程師提供一種方法,讓他們在專案開始時就能壓力測試他們的假設,因為在這個階段改變方向成本較低,而且正確的對話可以節省數月的返工時間。」

微軟指出,投資這些工具的次要動機是使事件可重現,並驗證緩解措施,同時透過將紅隊演練的學習成果轉化為可執行的工程資產來擴大規模。

Siva Kumar 補充說:「PyRIT 針對系統建置完成後安全研究人員的黑盒發現進行了優化,而 RAMPART 則是在系統建置過程中為工程師而建置的。Clarity 協助團隊釐清設計意圖並捕捉假設。這兩種方法結合起來,將 AI 安全從一次性審查轉變為一套開發者可以在整個生命週期中使用的活躍資產。」