#vulnerability-localization

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Aman Priyanshu, Supriti Vijay, Kimia Majd, Xuhong He, Fraser Burch, Takahiro Matsumoto, Jianliang He, Baturay Saglam, Arthur Goldblatt, Zhuoran Yang, Amin Karbasi

该论文针对语言模型智能体在完整软件仓库上执行安全分析的能力评估问题展开研究。作者指出,当前网络安全领域的评测工作主要关注智能体能否「检测」、「复现」或「修复」漏洞,却很少衡量一个更基础的能力:能否在陌生仓库中准确定位与特定弱点类别相关联的实现文件。为此,论文提出「漏洞定位」(vulnerability localization)这一独立任务,并构建了 Vulnerability Localization Benchmark(VLoc Bench)基准。该基准包含来自 290 个仓库、覆盖六大软件包生态与 147 个 CWE 类别的 500 个真实漏洞案例;每个任务都提供修复前与修复后的仓库快照配对。在漏洞版本快照上,智能体仅获得 CWE 描述与只读终端访问权限,必须返回受影响的文件;在已修补快照上,智能体则需判断所记录的漏洞是否已不存在。作者在统一智能体接口下评估了 27 个语言模型与 4 种静态分析工具。结果显示,仓库级漏洞定位仍然十分困难:表现最好的系统仅达到 0.229 的 File F1,且有 38.4% 的任务没有任何被评估模型给出正确本地化结果。论文进一步发现,更强的定位能力并不等同于修复后的可靠行为——那些能有效识别漏洞文件的系统,在已修补仓库上仍可能报告缺乏依据的位置。该工作将漏洞定位确立为一种独立的仓库级能力,并为研究安全智能体如何搜索易受攻击代码、以及何时应当避免报告提供了实验框架。

💡 推荐理由: 安全智能体正被广泛用于仓库级代码审计与告警收敛,但「定位准」不等于「修复后不误报」。该基准揭示了当前模型在仓库级定位上的真实下限,并暴露修复后仍乱报的可靠性缺口,对构建自动化审计流水线与降低误报噪声有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

本文介绍了 Antares,一个用于智能体式漏洞定位的紧凑语言模型家族,包含 350M、1B 和 3B 三个参数规模。漏洞定位是软件安全中的基础步骤,要求模型能对大型代码库进行推理,并迭代地识别脆弱实现。Antares 基于 IBM Granite 基座模型,采用两阶段训练流程:首先在网络安全推理和仓库探索数据上进行监督微调,然后利用可验证奖励的强化学习在易受攻击的仓库上进行优化。在广泛评估中,Antares-3B 的性能接近 GPT-5.5,同时超过了规模大 200 倍以上的开放权重模型。Antares 家族还支持快速、低成本的本地推理,在单个 H100 GPU 上完成完整的 500 任务评估扫描约需 15 分钟,每个任务的平均评估时间低于 2 秒,成本低于 0.002 美元。该研究展示了小型专用模型在安全任务中通过针对性的训练和强化学习可以达到接近大型通用模型的性能,同时具备显著的计算效率。论文适合对 AI 辅助安全分析、漏洞挖掘自动化感兴趣的蓝队工程师和安全研究人员阅读。

💡 推荐理由: 该研究验证了紧凑型专用模型在漏洞定位任务上可接近甚至超越巨型通用模型,为蓝队提供了一种高效、低成本的自动化代码审计工具思路,并展示了将强化学习用于安全推理任务的可行性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

本文提出 AutoTrace,一个基于智能体(agentic)的流水线,用于从漏洞修复补丁中定位触发器(trigger),即导致脆弱程序状态转变为具体不安全操作的语句。该问题比二元漏洞检测更难,因为答案需要跨过程(interprocedural)的因果推理:在大量真实CVE中,触发语句往往位于修补函数之外的多个调用层级,超出了静态规则集和模式匹配语言模型的能力范围。AutoTrace 通过逐层探索代码属性图(Code Property Graph),由LLM代理决定下一步搜索方向,同时使用确定性可接受门(admissibility gates)来确定报告触发器前需要哪些证据。代理从不自行接受触发器;每个报告的触发器都有来自图中显式证据的支持,因此该流水线既能覆盖过程内也能覆盖过程间的漏洞,而不依赖于无根据的模型判断。在完整的InterPVD基准上,AutoTrace达到了75.0%的VulnHit和80.8%的FuncHit,超越了先前最先进的方法。基于相同的机制,作者构建了SinkTrace-Bench数据集,该数据集将每个漏洞暴露为从攻击者可控输入到危险操作的源到汇(S2S)因果链,源自匹配的脆弱和修补程序状态。它包含1542个经过验证、完美平衡的脆弱/安全样本,标签保真度经过专家注释审核。对前沿LLM的基准测试表明,即使最强的模型也难以区分这些匹配对,暴露了触发器定位所针对的因果推理差距。论文提供了完整的工件,适合安全研究人员、漏洞缓解工程师以及AI辅助代码分析开发者阅读。

💡 推荐理由: 本文提出了一种新颖的跨过程触发器定位方法,将LLM的搜索决策能力与代码属性图的显式证据相结合,显著提升了现实CVE中复杂漏洞的定位精度。它填补了从补丁到触发器的自动化推理空白,有助于安全团队更高效地理解漏洞根因和开发精准的检测规则。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)