N-Day-Bench 衡量了尖端語言模型在發現其各自知識截止日期之後披露的真實世界漏洞或「N-Day」漏洞的能力。所有模型都使用相同的框架和相同的上下文,沒有任何迴旋餘地進行獎勵駭客行為。此基準測試旨在衡量大型語言模型或 LLM 在網路安全方面的實際能力,特別是「漏洞發現」。
此基準測試是適應性的:測試案例會以月為週期進行更新,模型集也會升級到其最新版本和檢查點。
N-Day-Bench 是一項新基準測試,旨在衡量大型語言模型(LLM)在知識截止日期之後,發現真實世界中已揭露的漏洞(即「N-Day」漏洞)的能力。該測試以統一的環境和相同的上下文進行,以確保公平性,並專注於評估 LLM 在網路安全領域的實際漏洞發現能力。此基準測試會每月更新測試案例,並升級模型至最新版本,以保持其適應性和準確性。
值得注意此基準測試直接評估 LLM 在網路安全領域的關鍵能力,具有高度實用性和潛在影響力。
N-Day-Bench 衡量了尖端語言模型在發現其各自知識截止日期之後披露的真實世界漏洞或「N-Day」漏洞的能力。所有模型都使用相同的框架和相同的上下文,沒有任何迴旋餘地進行獎勵駭客行為。此基準測試旨在衡量大型語言模型或 LLM 在網路安全方面的實際能力,特別是「漏洞發現」。
此基準測試是適應性的:測試案例會以月為週期進行更新,模型集也會升級到其最新版本和檢查點。