推荐 5.5
Conf: 50%
本文提出RustMizan,一个针对Rust语言漏洞分析的可编译、污染感知的基准测试框架。现有漏洞分析基准通常依赖小型不可编译的代码片段,仅关注二分类(是否有漏洞),且未考虑公开数据集可能已包含在模型训练语料中带来的数据污染风险。RustMizan通过三个设计解决这些不足:1)提供在crate、文件和函数级别的可编译代码变体,并附带二进制漏洞检测、CWE分类以及函数级与行级定位的注释;2)引入配对突变框架,通过生成语义保持的代码突变体来测试模型对训练数据污染的敏感性和鲁棒性;3)在agentic设置下(具备命令行访问权限)对四个前沿模型进行评估。实验结果表明,二进制漏洞分类准确率在56-65%区间,但行级定位F1分数仅约20%,而对抗性线索导致行级F1下降约27%。该框架为评估LLM驱动的安全代理在真实Rust代码上的漏洞分析能力提供了标准化测试床,尤其关注数据污染对性能评估的影响。适合安全研究人员和AI安全从业者阅读。
💡 推荐理由: RustMizan是首个专门针对Rust语言、考虑数据污染的可编译漏洞分析基准,有助于准确评估LLM agent在真实场景中的漏洞检测与定位能力,避免因训练数据重叠导致的性能高估。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)