#code-analysis

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

本文提出 AutoTrace,一个基于智能体(agentic)的流水线,用于从漏洞修复补丁中定位触发器(trigger),即导致脆弱程序状态转变为具体不安全操作的语句。该问题比二元漏洞检测更难,因为答案需要跨过程(interprocedural)的因果推理:在大量真实CVE中,触发语句往往位于修补函数之外的多个调用层级,超出了静态规则集和模式匹配语言模型的能力范围。AutoTrace 通过逐层探索代码属性图(Code Property Graph),由LLM代理决定下一步搜索方向,同时使用确定性可接受门(admissibility gates)来确定报告触发器前需要哪些证据。代理从不自行接受触发器;每个报告的触发器都有来自图中显式证据的支持,因此该流水线既能覆盖过程内也能覆盖过程间的漏洞,而不依赖于无根据的模型判断。在完整的InterPVD基准上,AutoTrace达到了75.0%的VulnHit和80.8%的FuncHit,超越了先前最先进的方法。基于相同的机制,作者构建了SinkTrace-Bench数据集,该数据集将每个漏洞暴露为从攻击者可控输入到危险操作的源到汇(S2S)因果链,源自匹配的脆弱和修补程序状态。它包含1542个经过验证、完美平衡的脆弱/安全样本,标签保真度经过专家注释审核。对前沿LLM的基准测试表明,即使最强的模型也难以区分这些匹配对,暴露了触发器定位所针对的因果推理差距。论文提供了完整的工件,适合安全研究人员、漏洞缓解工程师以及AI辅助代码分析开发者阅读。

💡 推荐理由: 本文提出了一种新颖的跨过程触发器定位方法,将LLM的搜索决策能力与代码属性图的显式证据相结合,显著提升了现实CVE中复杂漏洞的定位精度。它填补了从补丁到触发器的自动化推理空白,有助于安全团队更高效地理解漏洞根因和开发精准的检测规则。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hang Gao, Xiaoyu Chen, Baoquan Cui, Zhen Tang, Peng Qiao, Fengge Wu, Jian Zhang

恶意Python包已成为开源软件供应链生态系统(如PyPI)的主要安全威胁。现有基于学习的检测方法难以捕获不同程序实体之间的层次组织结构和异构交互。大型语言模型(LLM)在代码理解和语义推理方面表现出强大能力,但很少与结构化程序表示相结合用于细粒度恶意行为分析。本文提出了一种LLM增强的层次异构图表示学习框架,用于恶意Python包检测。该框架构建了一个层次异构代码图,显式建模异构代码实体和不同类型的结构依赖关系。进一步利用LLM推断函数级语义角色,引入额外的语义异构层。基于该图,开发了一种层次异构图神经网络,在不同节点和边类别上执行类型感知的消息传递,有效建模恶意行为传播以实现准确的包级分类。框架还融合了函数级归因机制,结合LLM推理,自动识别可疑函数并定位细粒度恶意行为,无需人工专家干预。在真实数据集上的大量实验表明,该框架在不同大小和依赖复杂性的包上,始终优于传统机器学习方法、基于图的检测器以及最先进的LLM,同时提供了准确、鲁棒且可解释的恶意行为定位。

💡 推荐理由: 本工作将LLM与层次异构图学习结合,为检测恶意Python包提供了新思路,有望提升软件供应链安全防御的自动化与精准度。

🎯 建议动作: 纳入内部研究评估

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Immanuel Kunz, Ching-Yu Kao, Daniel Kowatsch, Jens Hiller, Julian Schütte, Dmitry Prokhorenkov, Konstantin Böttinger

该研究提出了一种基于大型语言模型(LLM)的方法,用于自动识别源代码中个人数据的处理行为,以辅助隐私影响评估。当前软件产品的隐私合规审查高度依赖人工专家,耗时且易出错,尤其面对大规模、频繁变更的应用时挑战巨大。作者首先构建了一个标注数据集,代码片段依据W3C个人数据分类体系进行标记。随后设计了一个可扩展的分类框架,将源代码片段与个人数据类别进行映射,并探索了多种提示策略(如少样本学习、思维链等)。实验证明,LLM能够以较高的准确率检测源代码中的个人数据处理,有效支持人工审查者进行大规模软件评估。这项工作的主要贡献包括:公开可用的标注数据集、基于分类体系的自动分类方法及框架、以及多组实验对比结果,为后续研究提供了基准。适合隐私工程、合规自动化领域的研究人员和开发人员阅读。

💡 推荐理由: 该研究直接回应了GDPR等隐私法规下的实际需求,通过LLM自动化检测源代码中的个人数据处理,有望大幅提升隐私影响评估的效率和覆盖率,降低对专家的依赖。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mansour Ahmadi, Reza Mirzazade Farkhani, Ryan Williams, Long Lu

本文提出了一种利用代码自身检测功能相似但不一致代码的新方法。研究背景是软件开发中常出现功能相似但实现不一致的代码片段,可能导致难以发现的bug。核心问题是如何自动识别这类语义等价但语法有差异的代码对。方法上,作者设计了一个基于程序分析和机器学习的框架,通过提取代码的语义特征并比较其行为一致性,来发现潜在缺陷。实验在多个开源项目上进行,证明了该方法能有效检测出传统工具遗漏的bug。主要贡献包括提出新思路、构建原型系统以及公开评估数据集。适合代码审计工具开发者、软件质量工程师和编译器研究者阅读。

💡 推荐理由: 帮助安全工程师自动发现代码中因逻辑不一致导致的隐蔽缺陷,提升软件安全审查效率。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)