CyberGym 的 86.3%:GLM-5.2 安全 Agent 开始用证据说话

1,507 个真实漏洞,1,301 个被成功复现,成功率 86.3%。这个数字看起来像又一张大模型排行榜,但它真正有意思的地方,不在“GLM-5.2 跑了多少分”,而在于:一个安全 Agent 终于被放进了更接近真实工作的验证链里。

CyberGym 测的不是选择题

CyberGym Level 1 收录了来自 188 个大型软件项目的 1,507 个历史漏洞,任务输入只有漏洞描述和补丁前的源代码。系统要做的不是回答“漏洞原因是什么”,而是分析代码、判断触发条件,最后构造一个 PoC,让它能在有漏洞的构建中触发,却不能在打过补丁的隐藏构建中触发。

这一步很关键。只让程序崩溃,不能证明找对了漏洞;真正过关,必须同时满足“漏洞版本能复现、修复版本不能复现”。换句话说,评测把“看起来像对”与“经过独立验证确实对”分开了。

Sangfor AI 的核心,不只是换了一个模型

这套系统固定使用 GLM-5.2,架构上采用 Agent Swarm:多个子 Agent 围绕不同的漏洞假设并行调查,但不把完整聊天历史粗暴拼进同一个上下文。它们共享的是证据状态,包括已经观察到的现象、被推翻的路径、触发条件和候选结论。

这个设计解决的是安全自动化里一个经常被忽略的问题:多个 Agent 一致,不等于结论可靠。如果第一个 Agent 的猜测错了,后续 Agent 只是沿着同一条错路继续“表示赞同”,系统看起来很协同,实际上只是把错误放大。把假设与证据分开,保留负面结果,再让协调器根据证据缩小搜索空间,才有机会把并行探索变成真正的进展。

接近提交时,系统还会引入对抗式候选审查,专门挑战 PoC 是否真的可复现、是否与被分配的漏洞对应。初步结果中有 1,304 个案例被确认,但 CyberGym 团队复核后认定其中 3 个是误报,最终数字修订为 1,301 个。这一处修订反而增强了结果可信度:系统没有把初始阳性全部包装成成绩,而是接受了外部验证带来的扣分。

86.3% 的含义:安全 Agent 开始进入“证据时代”

对企业来说,安全 Agent 的价值不是生成一份漏洞报告,而是减少人工排查仍要承担的“这到底是不是目标漏洞”的不确定性。对模型行业来说,这个案例也提醒我们,能力竞争正在从“谁的模型更聪明”转向“谁的系统更能被审计”。

当然,86.3% 不能直接等同于现实生产环境的自动修复率。评测有明确的任务边界,运行环境、时间上限和工具权限也经过规定;而且每个任务最多提交一个最终 PoC。把 benchmark 成绩直接翻译成“企业可以无人值守地交给 Agent”,仍然过头了。

但它确实说明了一件事:在高风险场景里,模型只是底座,证据治理才是系统能力。能提出十个假设不稀奇,能在提交前证明其中九个不该提交,才是安全 Agent 与普通聊天机器人的分水岭。

这次值得记住的不是“GLM-5.2 赢了谁”,而是一个更硬的标准正在形成:AI 不该比谁更自信,而该比谁的结论更经得起隐藏环境的验证。