GCSA Agent在CyberGym取得91.3%成绩 跻身全球领先AI网络安全智慧体行列

2026-08-30 22:49:17 大公网 作者:石华
字号
放大
标准
分享

29 日,全球网络安全联盟(Global Cybersecurity Alliance,GCSA)宣布,GCSA Agent在 CyberGym基准测试中取得 91.3% 的成功率,进入CyberGym “Leading Systems Above 90%” 领先系统区间。

CyberGym是由美国加州大学伯克利分校研究团队开发的大规模真实世界网络安全评测框架,共收录1,507个历史真实漏洞测试实例,覆盖188个大型软件项目,旨在评估AI智能体在真实漏洞分析场景中的实际能力。

与主要评估代码理解、知识问答或静态分析能力的传统AI Benchmark不同,CyberGym要求 AI智能体直接面对真实的漏洞代码环境。

在其核心Level 1测试中,AI Agent仅获得漏洞描述以及尚未修复的码库,需要自主完成程式码分析、漏洞定位、攻击路径推理、PoC构造和执行验证。只有生成的PoC能够在漏洞版本中成功触发目标漏洞、同时无法在修复后的版本中重现,任务才被认定为成功。

因此,CyberGym所衡量的并不仅是AI是否“理解程式码”,而是AI是否能够真正完成从安全分析到漏洞重现和验证的完整过程。

从大模型走向安全智慧体

本次CyberGym测试中,GCSA Agent基于Grok 4.5与Grok 4.6模型运行,最终取得 91.3% 的成功率。

这一结果也反映出AI网络安全领域正在发生的一项重要变化:决定最终安全能力的,不再只是底层大模型本身。

真实漏洞研究通常需要连续完成漏洞描述理解、大规模程式码检索、攻击面识别、漏洞假设建立、测试输入生成、程序执行、反馈分析以及PoC反复迭代等多个环节。

GCSA Agent围绕这一完整过程构建智慧体化安全工作流。其目标并非简单地利用大语言模型进行程式码分析,而是让 AI 能够进入真实执行环境,围绕安全问题自主形成假设、收集执行证据、执行测试,并最终以可重现结果验证安全发现。

此次 CyberGym 测试,为这一能力提供了一个可量化的外部基准。

面向真实世界的漏洞研究能力

CyberGym的核心价值,在于缩小传统AI测试与真实网络安全研究之间的差距。

其评测环境会恢复软件项目漏洞修复前的程式码状态,AI Agent可能需要在包含数千个文件、数百万行程式码的大型程式码库中自主定位问题,并最终生成能够真正触发漏洞的PoC。

更值得关注的是,CyberGym 的进一步研究已经显示,这种智慧体化安全能力并不局限于重现已知漏洞。

在开放式漏洞研究实验中,AI Agent已发现多项此前未知的零日漏洞以及历史上并未完全修复的安全修补程式,显示出自主漏洞分析技术向真实漏洞发现能力迁移的潜力。

对 GCSA 而言,这也是更重要的发展方向。Benchmark 成绩不是终点。GCSA 的目标,是进一步建立能够服务真实网络安全场景的 AI Security Agent,使其逐步参与漏洞发现、分析、验证乃至后续修复的完整安全生命周期。

构建 AI 原生网络安全能力

随着人工智能加速软体开发,AI 同样正在改变漏洞研究与网络攻防的方式。

面对规模越来越大、复杂度越来越高的软体系统,下一代网络安全体系将越来越依赖人类安全专家与自主AI智慧体之间的协作。

AI Security Agent有望帮助安全团队:更早发现具有真实利用价值的软件漏洞;在大型程式码库中自动分析复杂攻击路径;自动生成PoC,对漏洞进行执行级验证;通过真实执行结果降低传统安全检测中的误报;加快漏洞研判、验证与修复效率;扩展专业安全团队能够覆盖的软体与系统规模。

GCSA Agent在CyberGym取得91.3%的成绩,是GCSA构建 AI 原生网络安全能力的重要阶段性成果。未来,GCSA 将继续推进自主漏洞分析、AI Security Agent 与智慧化网络安全技术研究,将前沿人工智慧能力进一步转化为真实世界中的安全能力,为构建更加安全、可信和具有韧性的数字环境提供技术支援。