AI学网络安全,先把漏洞变成考题
AI 读过很多 CVE,不等于它能在安全环境里复现、修补并验证漏洞。新论文 CyberFactory 的关键思路,是把公开漏洞材料从“可阅读文本”变成“可执行、可判分的训练题”。
来源事实:CyberFactory 覆盖三类任务——PoC 生成、漏洞修补和 CyberQA。以 PoC 为例,它采用差分判定:同一个测试输入,应在修补前触发目标行为、修补后不再触发。这样,训练数据不只描述答案,还带有环境、执行结果和可复核证据。
论文里的数据生产流程可以拆成四步:
1. 收集公开 CVE、补丁与源码等材料,并保留来源关系;
2. 在隔离环境中构建修补前后的程序版本;
3. 让带“漏洞分析 Skill”的教师模型检查源码、探索线索、验证证据并迭代修订;
4. 只保留能通过执行判定的实例,再用于训练 OpenAegis。
一个容易误读的细节是:这套 Skill 用于合成训练数据,OpenAegis 推理时并没有拿到它。也就是说,论文想验证的是高质量、可验证轨迹能否把能力蒸馏进模型,而不是测试时临时外挂提示词。
结果方面,完整 v2 正文的主表和结论报告:在 CyberGym、每题一小时预算、相同 scaffold 下,OpenAegis 的 Pass@1 为 58.1%,Qwen 3.5 基线为 29.6%,高 28.5 个百分点。需要特别说明,arXiv Atom 摘要仍显示旧数字 52.4% 和 +22.8;本笔记采用 v2 主表、正文摘要与结论一致的新数字。
我的判断是,这项工作最值得收藏的不是某个分数,而是一张“可验证训练数据”清单:
① 材料能否追溯来源;② 环境是否隔离且可复现;③ 成败是否由执行判定,而非模型自评;④ 是否保存失败与修订轨迹;⑤ 是否有留出集、权限闸门和人工审批。
边界同样重要:证据来自受控基准,不等于真实生产防御成效;PoC 有双重用途,只应在授权、无外网、可审计的沙箱中处理。论文对 PoC 的评测最完整,修补与 CyberQA 仍缺少同等严格的下游验证。
一手 网络安全 智能体训练 CVE
