AI 代码审计工具越来越多,但开发者与安全团队真正关心的是三件事:能不能多找出真漏洞、误报多不多、要花多少钱。
要回答这三个问题,不能只看产品介绍,需要一组经过人工确认、可复现的已知漏洞作为标尺。
7 月底,OpenAI 开源了代码安全审计工具 Codex Security CLI,不到半个月 GitHub 星标接近 1 万。近日,长亭科技安全研究团队将旗下 AI 原生代码审计工具 MonkeyScan(今年 4 月上线)与 Codex Security 置于同一批已知真实漏洞的代码中,围绕检出数量、误报率与成本三个维度展开对比。
据悉,长亭科技是一家以攻防实战为技术底座、以 AI 安全为增长主线的智能安全厂商,MonkeyScan 是其 AI 代码审计方向的代表产品。
为保证测试公正准确,测试采用公开独立基准集 RealVuln v2.0,保证结果可复现、可第三方核验。 该基准集包含经人工确认的真实漏洞,并专门设置了容易诱发误报的代码;官方公布查准率(Precision)、检出率(Recall)与更看重少漏报的 F2 综合分三项指标。
测试前,人工核对了 RealVuln 的真实漏洞清单、固定源码版本与官方评分程序,确认每一个正确检出、误报与漏报均可复现。
本轮测试从 RealVuln v2.0 中选取 3 个可本地复现、源码版本可锁定的 Python Web 项目:DSVW(27 个真实漏洞)、DSVPWA(32 个)、Damn Vulnerable Flask Application(15 个),合计 74 个真实漏洞。
核心结论:在 RealVuln v2.0 的 74 个真实漏洞上,MonkeyScan 检出 57 个(检出率 77.03%),较 Codex Security 多找回 22 个,成本约为其 1/5。
具体而言,三轮扫描结束后,MonkeyScan 找回 57 个真实漏洞,Codex Security 找回 35 个;检出率分别为 77.03% 与 47.30%。在查准率上,Codex Security 以 66.04% 领先于 MonkeyScan 的 59.38%。不过团队指出,对安全审计而言,漏掉一个真实漏洞意味着研发团队连复核它的机会都没有,因此 RealVuln 采用更看重检出率、更看重少漏报的 F2 综合分作为主指标。在这一指标上,MonkeyScan 为 72.7,Codex Security 为 50.1。
成本方面,MonkeyScan 约为 Codex Security 的 1/5。 Codex Security 三次扫描合计消耗约 176.58 万有效 Token,按 GPT-5.6 Sol 标准档接口等价成本估算约 28.34 美元(折合人民币约 200 元);MonkeyScan 三次扫描合计消耗 2723 积分,按当前 39 元/3000 积分的零售价折算约 35 元。
结果可复核:全部扫描结果统一交由 RealVuln 官方评分程序(score.py)计算。 判定口径为:三项目源码版本与真实漏洞清单固定版本一致;两款工具扫描相同源码,只统计最终扫描发现项;扫描结果统一转换为 Semgrep 兼容的 JSON 格式;官方匹配规则(matcher)按文件路径、漏洞类型(CWE)及真实漏洞所在代码行上下 10 行范围判定;每个真实漏洞最多命中一次。
逐项来看,三组项目呈现相同趋势:DSVW 上 MonkeyScan 的查准率、检出率、F2 均高于 Codex Security;DSVPWA 上 Codex Security 查准率更高,但 MonkeyScan 命中 25 个真实漏洞、Codex Security 命中 14 个;Flask 项目对两款工具都更具挑战,MonkeyScan 检出率 60%、Codex Security 33.33%。
三个项目合计后,MonkeyScan 漏报仅为 17 个,Codex Security 漏报 39 个。
对于 MonkeyScan 以更低成本找回更多漏洞的原因,团队将其归纳为工作方式的差异:MonkeyScan 并非让更多智能体重复阅读同一份代码,而是先理解整个仓库:识别语言、框架、入口、函数与调用关系,建立仓库级代码知识;再依据目录、复杂度与风险目标,将审计任务拆给多个智能体并行执行;首轮结束后继续检查高风险路径中的覆盖缺口,仅对复杂候选追加深度分析。即"先理解项目、按风险分工、再补扫缺口,把更贵的推理留给真正复杂的问题"。
对开发与安全团队而言,AI 代码审计的价值不在报告数量,而在于能否以可接受的成本、尽可能少地漏掉真实风险。漏报意味着漏洞永远不会进入人工复核环节,很有可能带入真实业务环境,带来潜在安全隐患。随着MonkeyScan 等国产AI代码审计工具相继成熟,以公开基准进行可复现的横向对比,正在成为工具选型与能力评估的必要手段。
团队同时强调,公开基准测试集给出的是可复现的结果,但更重要的测试应当发生在开发者自己的代码仓库中。MonkeyScan 支持 GitHub 仓库与 ZIP 源码扫描,用户可自行验证其在实际项目中的检出表现。

评论
更多评论