N-Day-Bench 衡量了尖端語言模型在發現其各自知識截止日期之後披露的真實世界漏洞或「N-Day」漏洞的能力。所有模型都使用相同的框架和相同的上下文,沒有任何迴旋餘地進行獎勵駭客行為。此基準測試旨在衡量大型語言模型或 LLM 在網路安全方面的實際能力,特別是「漏洞發現」。

此基準測試是適應性的:測試案例會以月為週期進行更新,模型集也會升級到其最新版本和檢查點。