#vulnerability-dataset

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Omri Ram, Mitchell Horner, Ron Van der Meyden, Alsharif Abuadbba, Hammond Pearce

本文提出了 GraftyVul,一个通过将真实世界漏洞“嫁接”到开源项目中来自动构造含漏洞程序的数据集生成系统。现有漏洞数据集通常难以同时满足多样性(语言和漏洞类型)、可复现性与可执行性以及真实性这三项要求:部分数据集使用人工构造或合成代码,缺乏真实上下文;部分数据集虽有真实漏洞但缺少可用的构建和测试环境。GraftyVul 的核心思想是从已知漏洞提交中提取补丁差异,并将其移植到其他开源项目,从而保留真实漏洞的语义特征,同时利用目标项目原本正常的构建和测试环境,并借助漏洞触发脚本来验证新引入的漏洞确实改变了程序行为。作者使用该系统生成了 212 个经过验证且可被利用的易受攻击程序,覆盖五种编程语言(Python、TypeScript、Java、Go 和 C#)以及 23 个 CWE 类别。为了评估生成样本的保真度,论文提出了一种与语言和上下文无关的语义嵌入方法,通过对比漏洞的 sink、机制和宿主特征而非表面代码来衡量相似性。实验表明,该嵌入方法在跨语言克隆检测和 CWE 分类上优于标准代码嵌入,并且 GraftyVul 生成的样本与其来源漏洞在语义上有强相关性。此外,作者将 GraftyVul 与 13 个广泛使用的数据集进行对比,发现它在保持竞争力的多样性的同时,是唯一一个具备广泛语言和 CWE 覆盖的可复现可利用漏洞数据集。最后,论文通过一个工业案例研究展示了 GraftyVul 在评估生产级漏洞修复系统方面的实际效用。

💡 推荐理由: 为漏洞检测、自动化修复和安全的代码生成模型提供高质量、可复现且真实的训练与评估数据,弥补现有数据集在多样性、可执行性与真实性之间的缺口,有助于提升安全模型的泛化能力和可信度。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)