近20年來,網路安全的基本協議一直很簡單:當你點擊連結,任意程式碼會在你的裝置上執行,而多層沙盒機制則防止這些程式碼做出惡意行為。瀏覽器沙盒保護不受信任的JavaScript,虛擬機沙盒保護多租戶雲端環境,廣告iframe則防止橫幅廣告控制你的手機或筆電——現代網路的運作假設這些沙盒是安全的。然而,Anthropic剛發布的研究預覽顯示,Mythos模型能在72.4%的情況下生成有效漏洞利用程式,遠高於數月前不到1%的成功率。這個協議可能正在瓦解。
據我所知,Mythos是一個非常大型的模型。傳聞指出它的規模與短暫存在且表現平平的GPT4.5相似。
因此,我和許多評論者一樣認為,這項技術尚未廣泛部署的主要原因是計算資源不足。Anthropic目前可能是最缺乏計算資源的主要AI實驗室,我強烈懷疑即使他們想更廣泛地推出,也沒有足夠的計算能力。
根據洩漏的價格資訊,使用成本也相當高昂——每百萬字元輸出要價125美元,是Opus模型的五倍,而Opus本身已是市場上最昂貴的模型之一。
在所有對前沿大型模型的關注中,一點常被忽略的是小型模型在快速取得進展。我花了很多時間使用Gemma 4開源權重模型,它的表現令人印象深刻,且規模約是前沿模型的1/50。
因此,我毫不懷疑Mythos的能力將很快在更小、更易部署的模型中實現。
即使Mythos的巨大規模是其能力的關鍵(我非常懷疑,因為小型模型的擴展進展迅速),隨著新一代晶片的問世,未來也能大規模部署。重要的是要關注未來趨勢。
我之前曾提過,我認為大型語言模型(LLM)帶來極嚴重的資安風險。根本上,我們正目睹尋找並利用軟體嚴重漏洞的難度大幅降低,這對惡意用途極為危險。
先退一步,理解現代資安如何實現非常重要。沙盒是其中最關鍵的概念之一。你日常使用的幾乎所有電子裝置都有一層或多層沙盒保護系統。簡言之,沙盒是一種「虛擬化」環境,軟體可在系統上執行,但權限受限,與其他軟體隔離,且有強大邊界防止軟體「逃脫」沙盒。
如果你在現代智慧型手機上閱讀本文,從這個網頁到手機作業系統,至少有三層沙盒保護。
首先,瀏覽器有至少兩層沙盒。一層是JavaScript執行環境(執行網站互動程式碼),另一層是瀏覽器沙盒,限制整個網站的行為。最後,iOS或Android有應用程式沙盒,限制整個瀏覽器的行為。
這種深度防禦是現代資訊安全的基石,尤其讓使用者能安全瀏覽「不受信任」的網站。惡意網站要控制你的裝置,必須同時串聯多個漏洞,這在現實中極難做到(這類漏洞鏈在灰色市場價值數百萬美元)。
根據Anthropic,Mythos預覽版在72.4%的測試中成功生成Firefox JS shell的漏洞利用程式。相較之下,Opus 4.6在先前評估中成功率不到1%。
值得注意的是,這裡的JS shell是Firefox獨立的SpiderMonkey,代表逃脫的是最內層沙盒,而非整個瀏覽器鏈(渲染程序和作業系統應用沙盒仍在上層)。且這是Anthropic自家基準測試,非獨立評測。但即使考慮這些保留,趨勢仍然明顯——從「幾乎零」到「72.4%成功率」,且是針對真實目標,而非玩具式CTF。
若你懂得這背後的意義,這相當令人恐懼。如果大型語言模型能找到沙盒漏洞——這是地球上最安全的軟體之一——那麼你隨意瀏覽的每個網站都可能含有惡意程式碼,能「逃脫」沙盒,理論上控制你的裝置,並將手機上的所有資料傳送給不法份子。
這類攻擊極為危險,因為網路架構建立在沙盒安全的假設上。例如,每個瀏覽器載入的橫幅廣告都在獨立沙盒環境中執行,允許大量(多半未經測試的)程式碼運行,大家都依賴瀏覽器沙盒保護。如果沙盒失效,惡意廣告活動可能在數小時內控制數百萬裝置。
同樣地,沙盒和虛擬化是雲端運算大規模運作的基礎。現今大多數伺服器並非直接執行程式碼,而是由AWS等廠商將實體硬體「切片」成多個虛擬伺服器,分別賣給不同客戶。這讓單一伺服器能運行更多應用,並帶來不錯的利潤。
這與手機的運作模式類似,有多層保護防止客戶間資料互相存取,更重要的是防止存取AWS的控制平面。
因此,如果這些沙盒失效,我們將面臨極大問題,而今年的跡象顯示這可能成真。我應該稍微緩和災難論調——過去也曾有沙盒逃脫事件,並未造成大混亂,但我強烈感覺這次情況將更為嚴峻。
明確說明,當AWS美東1區(us-east-1)宕機時(這種情況發生過多次),全球媒體都會報導,且嚴重影響日常生活。這只是AWS眾多資料中心區域之一。如果惡意攻擊者能控制AWS控制平面,可能同時癱瘓所有區域,且恢復難度遠高於過去內部故障,因為惡意控制者不會配合修復。
基於以上原因,Anthropic對於公開釋出此技術持謹慎態度。但問題是,秘密已經曝光。即使Anthropic像電影角色Miles Dyson般將模型程式碼丟入熔岩坑,其他人仍會訓練強化學習模型並釋出。誘因太大,囚徒困境再次發生。
目前狀況似乎是,這些新一代模型將先提供給部分資安專業人士及相關組織,讓他們盡可能修補漏洞,搶先一步防範風險。
或許這是目前能做的最好安排,但這讓我想起資訊安全界流傳的「隱蔽性不是安全」的老話。且我認為這些有權限的組織不太可能在有限時間內找到大多數關鍵問題。
最後一點,雖然Anthropic提供1億美元信用額度及400萬美元現金捐助給開源專案,但並非所有開源專案都涵蓋其中。
許多開源專案是大家日常依賴卻未察覺的。像Linux核心這類明顯重要的專案會先獲得「存取權」,但數百萬個其他開源軟體(更別說商業軟體)對不少系統運作至關重要。我不確定計畫如何涵蓋這些軟體。
也許這只是貓捉老鼠遊戲的又一輪,最終達到相對穩定的平衡,頂多造成短期混亂。但回顧過去幾年產業的快速發展,我並不這麼樂觀。
有一點我確信,至少在某個領域,我們已擁有傳說中的超人能力。我不認為這會是最後一次。
不過,這也加劇了AI產業本已嚴重的計算資源瓶頸問題。