OpenAI 周一發布了一款名為 GPT-5.6-Cyber 的新型網路安全專用模型,表示該模型專注於漏洞研究、滲透測試和事件回應。

OpenAI 表示:「該模型建構於 GPT-5.6 Sol 之上,經過訓練以增強多項專業網路安全任務的能力(例如,尋找零日漏洞和開發攻擊鏈),並減少對某些高風險、雙重用途網路任務的拒絕。」

這家人工智慧(AI)公司表示,他們正透過 Daybreak Red 提供 GPT 5.6 Cyber,這是一個新的服務層,讓其他公司能夠存取其專門訓練的網路安全模型,用於授權的漏洞研究、攻擊驗證和安全測試。

GPT-5.6-Cyber 是 GPT-5.6 Sol 的一個更具網路安全開放性的版本,它建立在 OpenAI 於 2026 年 6 月發布的 GPT-5.5-Cyber 之上。

為了衡量 GPT-5.6-Cyber 透過 Daybreak Red 存取所提供的較低拒絕率,OpenAI 表示他們創建了一項名為「進階網路安全完成率」的內部評估,該評估衡量模型對與攻擊鏈開發、認證繞過、權限提升和其他進階網路安全場景相關的提示的回應頻率。

測試顯示,GPT-5.6-Cyber 能完成 95.0% 的這類請求,相比之下,GPT-5.6 Sol 僅為 1.5%,透過 Daybreak Blue 存取時為 2.0%。研究還發現,它成功完成的請求比 GPT-5.5-Cyber 還多,後者僅完成了 57.3% 的請求。

GPT-5.6-Cyber 經過訓練,旨在提高在涉及攻擊開發和進階安全研究的特定網路安全工作流程上的效能。ExploitGym 基準評估顯示,該模型的表現優於 GPT-5.6 Sol 和 GPT-5.5 Cyber。

OpenAI 表示,該模型由於經過專門訓練,在尋找和準確校準新型零日漏洞的嚴重性方面也顯示出改進,儘管在與儲存庫中的漏洞發現、概念驗證開發和提交高品質漏洞報告相關的開放式任務方面,其表現不如 GPT-5.6 Sol。

該公司指出,這是因為「模型有時會產生較短、較不詳細的漏洞報告。」

該模型發現的高嚴重性漏洞之一是 CVE-2026-15903(CVSS 評分為 8.8),這是 V8 JavaScript 引擎中的一個越界讀寫漏洞,攻擊者可能透過精心製作的 HTML 頁面在沙盒內遠端執行任意程式碼。

該漏洞可以與模型發現的另一個先前未知的漏洞串聯,以逃離 V8 堆積沙盒。Google 已於 2026 年 7 月中旬修補了 CVE-2026-15903。OpenAI 表示,該模型還被用於標記其他幾項缺陷。

Daybreak Red 是 OpenAI 在 2026 年 5 月推出的 Daybreak 計畫的一部分所設立的兩個存取層之一,另一個是 Daybreak Blue,它提供對包括 GPT-5.6 Sol 在內的邊緣通用模型存取,並內建了針對授權防禦性安全工作量身定制的防護措施。

該公司表示:「Daybreak Blue 存取移除了這些防護措施,有助於防禦者在實際安全任務中更充分地利用該模型,包括事件偵測與回應、調查、漏洞管理和安全評估。」

GPT-5.6-Cyber 已提供給 Accenture、Akamai、Cisco、Cloudflare、CrowdStrike、Fortinet、IBM、Palo Alto Networks、PwC 和 Sophos 等信任的客戶合作夥伴群組,以協助在攻擊者利用漏洞之前識別和修補漏洞,從而縮小「防禦差距」。

這些模型被推銷給企業,作為標記軟體中安全漏洞的一種方式,因為惡意行為者已顯著增加了對該技術的使用,以增強其攻擊活動並以前所未有的速度和規模進行網路攻擊,即使這尚未導致發現新穎或複雜的攻擊技術。

顯而易見的是,AI 代理正在使網路罪犯和國家級駭客能夠外包規劃和執行網路攻擊所需的繁重工作,為他們提供一種提高營運效率和生產力的方法,從而產生更好、更大、更快的攻擊。

更糟糕的是,AI 還縮短了從漏洞揭露到被利用的路徑,攻擊者利用這些工具為新揭露的缺陷編寫攻擊程式碼。隨著 AI 已經降低了攻擊開發的門檻並加速了漏洞研究,攻擊者未來可能會對已揭露的漏洞進行更廣泛的搜尋,以找到進入企業網路的方法。

雖然 AI 系統在尋找和利用軟體漏洞方面已大有進步,但它們仍然需要大量的專業知識,即使研究發現像 ChatGPT 5.5 和 Anthropic Claude Opus 4.8 這樣的網路能力推理模型在完全修補已發現的漏洞或避免在修補過程中引入新問題方面可能會遇到困難。

1Password 表示:「生成完全解決漏洞(且未實質改變應用程式行為)的修補程式的平均成功率僅為 26.0%。」「成功解決漏洞但在此過程中改變了應用程式行為的修補程式發生了 20.1% 的情況。相反,LLM 生成的修補程式未能解決漏洞、引入新漏洞或兩者兼有,平均發生了 53.9% 的情況。」

這些發現強調,目前在發現各種漏洞方面表現出色的模型,僅在有效修補其中「一小部分」方面表現良好,並有助於引導開發人員避開模型引入新錯誤(無論現有問題是否已修補)的場景,從而有效地擴大了惡意行為者可利用的攻擊面。

OpenAI 表示:「運行受限防護措施的模型帶有超出標準模型使用的風險,無論是來自濫用還是錯配。」「儘管存在這些風險,我們相信將邊緣智慧民主化給防禦者,對於加速和自動化網路防禦至關重要。」