Firefox 開發商表示,他們已「完全信服」AI 輔助的漏洞發現技術。
上個月,Mozilla 的技術長聲稱 AI 輔助的漏洞偵測意味著「零日漏洞的末日已近」以及「防禦者終於有機會獲勝」,當時的懷疑聲浪可謂顯而易見。畢竟,這看起來像是老套的模式:挑選少數令人印象深刻的 AI 成就,忽略可能描繪更複雜圖景的細節,然後讓炒作列車繼續前進。
考量到這種懷疑,Mozilla 在週四深入介紹了他們如何使用 Anthropic Mythos—一個用於識別軟體漏洞的 AI 模型—在兩個月內找出 271 個 Firefox 安全漏洞。在部落格文章中,Mozilla 的工程師表示,他們最終準備就緒的突破性成果主要歸功於兩件事:(1) 模型本身的改進,以及 (2) Mozilla 開發的客製化「引導程式」(harness),該程式在 Mythos 分析 Firefox 原始碼時提供了支援。
工程師們表示,他們早期與 AI 輔助漏洞偵測的接觸充滿了「不想要的雜訊」。通常,有人會提示模型分析一段程式碼。模型接著會產生看似合理的錯誤報告,而且規模往往前所未有。然而,當人類開發者進一步調查時,他們總是會發現大部分細節都是幻覺。人類開發者隨後需要投入大量工作,以傳統方式處理漏洞報告。
Mozilla 的傑出工程師 Brian Grinstead 在一次訪談中表示,Mozilla 與 Mythos 的合作有所不同。最大的差異點在於使用了代理引導程式 (agent harness),這是一段環繞著大型語言模型 (LLM) 的程式碼,用於引導其完成一系列特定任務。為了使這樣的引導程式有用,需要大量資源來客製化它,以適應其將被使用的專案特定語義、工具和流程。
Grinstead 描述了他的團隊建立的引導程式為「驅動 LLM 以達成目標的程式碼。它會給予模型指示(例如:『在這個檔案中尋找一個錯誤』),提供工具(例如:允許它讀寫檔案和評估測試案例),然後在迴圈中運行直到完成。」該引導程式讓 Mythos 能夠存取與人類 Mozilla 開發者相同的工具和管道,包括他們用於測試的特殊 Firefox 建置版本。
有了這些引導程式,只要你能定義一個確定且清晰的成功訊號或任務驗證訊號,你就可以不斷地告訴它繼續工作。在我們尋找記憶體安全問題的情況下,我們有 Firefox 的 Sanitizer 建置版本,如果你能讓它崩潰,你就贏了。我們將該代理指向一個原始碼檔案,並說:「我們知道這個檔案有問題,請去找出它。」它會編寫測試案例。我們有現有的模糊測試系統和工具來運行這些測試。它會說:「我認為如果我精確地編寫 HTML,這裡就會有問題。」它會將其發送給一個工具,該工具會說「是」或「否」。如果工具說「是」,則會有一些額外的驗證。
額外的驗證形式是第二個 LLM,它會對第一個 LLM 的輸出進行評分。高分讓開發者對透過更傳統的發現方法產生的報告具有相同的信心。
他表示:「就產生的錯誤而言,幾乎沒有誤報。」
週四的深入介紹包括公開了 Mozilla 使用 Mythos 和(較小程度上)Claude Opus 4.6 發現的 271 個漏洞中的 12 個完整 Bugzilla 報告。每個報告都提供了觸發不安全記憶體狀況的測試案例—即 HTML 或其他程式碼—這些案例符合 Mozilla 對所有被視為 Firefox 安全漏洞的標準。至少有一位研究人員週四表示,初步查看這些報告後,認為它們「相當令人印象深刻」。
Grinstead 表示,與先前漏洞披露的雜訊不同,其引導程式指導的 Mythos 分析所提供的詳細資訊,經過第二個 LLM 的確認,並最終包含在報告中,提供了他的團隊以前沒有的信心水平。
他表示:「這是解鎖我們能夠以目前規模運行的關鍵。它為工程師提供了一個可以拉動的曲柄,說:『是的,這有問題』,然後你可以迭代程式碼,並清楚地知道何時已修復,最終將測試案例納入程式碼庫,以免回歸。」
如前所述,Mozilla 將 AI 輔助漏洞發現描述為遊戲規則改變者的說法,在許多方面都遭到了大量、公開的質疑。批評者最初嘲笑 Mozilla 沒有為這 271 個漏洞中的任何一個獲得 CVE 編號。然而,與許多開發者一樣,Mozilla 不會為內部發現的安全漏洞獲取 CVE 編號。相反,它們會被捆綁到一個單一的補丁中。通常,詳細說明這些「彙總」的 Bugzilla 報告會在修復後幾個月內被隱藏,以保護那些修補緩慢的人。現在 Mozilla 公開了其中十二個,同樣的批評者肯定會聲稱它們也是被挑選出來的,並且隱藏了不太準確的結果。
在透過 Mythos 找到的 271 個錯誤中,有 180 個是 sec-high,這是 Mozilla 對內部報告漏洞的最高級別。這些類型的漏洞可以透過正常的用戶行為來利用,例如瀏覽網頁。(唯一更高的評級,sec-critical,保留給零日漏洞。)另外 80 個是 sec-moderate,11 個是 sec-low。
批評者堅持反駁是正確的。炒作是誇大 AI 公司已經虛高的估值的關鍵方法。鑑於 Mozilla 對 Mythos 的廣泛讚揚,即使是更信任的人也很容易想知道:它得到了什麼回報?週四的詳細說明不太可能平息爭論,反而可能進一步加劇爭議。
然而,根據 Grinstead 的說法,這些細節清楚地證明了 AI 輔助發現的有用性,而 Mozilla 的動機很簡單。
他表示:「人們對去年這些雜訊提交感到厭倦,所以我們覺得有必要展示我們的一些工作,公開一些錯誤,並更詳細地談論它,希望能激發一些行動或繼續對話。」「這裡沒有任何行銷角度。我們的團隊已經完全信服這種方法。我們正試圖傳達關於這項技術的一般訊息,而不是任何特定的模型提供商、公司或類似的東西。」