

近日,在面向全球顶尖 AI 安全能力的国际权威基准测试 CyberGym 中,Sangfor AI 取得了优异成绩。在依托纯国产基座模型(GLM-5.2)的固定模型配置下,系统面对涵盖ARVO与OSS-Fuzz的全量高难度漏洞挑战,在1,507项任务中成功解决 1,301项,整体成功率达到 86.3%。本次评测中,Sangfor AI与OpenAI、Anthropic、Meta等全球头部科技厂商的模型与智能体同场竞技,最终整体评测成绩跻身全球前四。

CyberGym作为全球权威 AI 安全评测体系,摒弃了传统的静态或小规模理论测试,聚焦于真实世界的复杂挑战——涵盖大量主流开源软件与高难度历史漏洞(如ARVO、OSS-Fuzz等)。它严格考验大模型与安全Agent在海量源码、复杂上下文及多阶段对抗环境下的自主推理、漏洞复现与PoC验证能力,因其贴近真实工业界防护场景、验证标准严苛,被视为全球范围内评估代码安全大模型实战能力最具含金量的权威靶场之一。
拆解 86.3% 背后的架构逻辑:Agent Swarm 协同作战
漏洞挖掘不是一次性的代码分析或PoC生成,而是在信息不完备的条件下,持续提出假设、获取证据、排除错误路径并形成最终结论的研究过程。单一模型可以完成局部推理,但要稳定处理长链路探索、并行假设和严格验证,还需要一套能够组织、保留并约束这些能力的系统机制。为了破解这一难题,Sangfor AI并未采用简单的概率堆砌,而是开创性的构建了“智能体群体(Agent Swarm)协同作战”架构,并引入了严密的“证据管治”机制,确保每一步漏洞调查步骤都清晰可信:
- 有界探索:围绕不同的安全假设分别开启独立、边界清晰的调查分支,让多个可能的解释可以并行推进,而不会互相污染、也不会让某个未经证实的假设悄悄变成集体共识;
- 证据持久化:各调查分支之间通过“证据”而非完整对话历史来协同——已被验证的观察和已被证伪的路径都会被保留下来,避免同一条错误路径被反复重新试错;
- 动态假设裁决:一个协调层持续基于不断演化的证据状态,判断哪些假设仍然成立、哪些问题尚待解决、哪里还值得继续投入,让每一轮探索都成为对搜索空间的有效收窄;
- 对抗式候选评审:当证据支持某个具体的触发方案时,系统才会构造候选输入并提交“对抗式评审”——评审会同时挑战“这次崩溃是否可复现”以及“这次崩溃是否真的对应目标漏洞”,未通过评审的候选会被打回、用于修正下一步探索方向,只有真正经受住检验的候选,才会成为系统最终提交的安全结论。
正如项目团队在技术设计中所强调的:“以假设拓展探索,以证据裁定结论。” 这套机制让系统敢于「广撒网」式地探索多种假设,又能在真正下结论前把关得足够严格,最终,在来源于ARVO的任务上取得87.2%的成功率,在来源于OSS-Fuzz的任务上取得77.7%的成功率,综合成功率达到86.3%。
不止于登榜:创新成果如何真正走进企业研发流程
随着AI技术的快速发展,攻击者正利用AI大幅降低漏洞分析与攻击利用门槛,压缩从漏洞发现到规模化利用的时间窗口。对企业而言,必须抢在攻击者之前发现、验证并修复漏洞。而过去开发安全所依赖规则匹配的传统SAST,必须加速向具备自主推理、代码理解、业务逻辑分析和漏洞验证能力的安全Agent转型。新的安全Agent既要精准识别SQL注入、命令执行等常规漏洞,更要深入理解复杂业务流程,发现越权访问、认证绕过等传统工具难以覆盖的高风险问题。与此同时,能否依托国产开源大模型实现AI开发安全系统的关键能力突破,成为掌握代码安全的主动权的关键。
“登榜CyberGym”所代表的绝不仅是一张亮眼的评测成绩单,更是AI安全Agent在真实企业级代码安全场景中的战斗力映射。Sangfor AI的前沿技术正加速沉淀并赋能全线产品,深度融入企业研发全流程,为用户带来切实的价值质变:
- 提升漏洞检出能力: 有效攻克传统SAST盲区,全面识别业务逻辑漏洞、越权与认证绕过,大幅拓宽代码安全覆盖率。
- 降低人工审计成本: 凭借AI自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证,大幅解放安全专家的繁重人工劳动力。
- 减少误报、提升效率: 依靠多阶段推理与严苛的证据验证机制压降误报率,使研发人员能够聚焦真正亟需修复的风险,告别无效整改。
- 缩短研发交付周期:将安全检测前移至研发编写与CI/CD流水线中,实现“代码提交即自动审计”,大幅降低后期返工成本,加速业务高效上线。
- 提升企业整体安全能力: 帮助企业在更早阶段筑牢防线,遏制因数据泄露、业务中断带来的合规与经济风险,为数字化业务保驾护航。
对于广大企业用户而言,AI安全Agent的核心价值远不止于“发现更多漏洞”,更在于以极高准确率、极低人工成本与极快响应速度,实现研发效率与代码安全的同步跨越。

此次在CyberGym评测中的卓越成绩与国内领先,是Sangfor AI在代码安全智能化道路上的一个重要里程碑。未来,我们将继续深耕大模型安全技术创新,将前沿技术转化为企业实际业务场景中的生产力,让每个用户的数智化更简单,更安全。



