👥 作者: Keke Lian, Lei Zhang 0096, Haoran Zhao, Yinzhi Cao, Yongheng Liu, Fute Sun, Yuan Zhang 0009, Min Yang 0002
该论文聚焦于Java Web容器(如Tomcat、Jetty等)中一类被忽视的拒绝服务(DoS)漏洞——数据保留拒绝服务(Data Retention DoS)。研究指出,现有安全研究多关注内存泄漏或资源耗尽,但数据在容器内部被过度保留(Careless Retention)同样可导致服务不可用。作者首先系统化地定义了此类漏洞的成因:由于容器对请求/响应数据、会话数据或临时文件等对象的生命周期管理不当,导致数据长期驻留内存或磁盘,累积后可耗尽系统资源。随后,论文提出了一种自动化检测方法,通过静态分析与动态监控相结合的方式来识别Java Web容器中的数据保留漏洞。实验部分,作者对多个主流Java Web容器进行了测试,成功发现若干新型漏洞,并证明了所提方法的有效性与低误报率。该工作填补了Web容器安全中关于数据保留层面的空白,为容器开发者和安全工程师提供了漏洞挖掘与修复的新视角。适合Web容器维护者、中间件安全研究人员及依赖Java Web应用的企业安全团队阅读。
💡 推荐理由: Java Web容器广泛部署,此类数据保留DoS漏洞不易被传统检测发现,但可导致服务崩溃或资源耗尽,直接影响业务可用性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Akram Khan, Daniel Rodriguez-Cardenas, Alejandro Velasco Dimate, Denys Poshyvanyk, Adwait Nadkarni
本文针对静态应用安全测试(SAST)工具中普遍存在的设计权衡问题展开研究。SAST工具在工业界和学术界广泛使用,但为了追求更高的性能(如更高的精度、更短的运行时间或更好的可扩展性),它们往往会在检测能力上做出牺牲。这些设计选择依赖于对目标代码或分析技术本身的特定假设,而这些假设直接影响了检测结果。作者提出一个核心问题:这些检测能力的牺牲是否真的换来了预期的性能提升?即底层假设是否有效?论文的关键观察是,这些工具所做的假设本质上具有因果性质。为此,作者提出了CAUSEC框架——一个因果分析框架,能够将SAST工具的假设形式化为"安全假设"的抽象,并结合假设驱动的因果建模、效应估计和验证,来测试假设的有效性并调查影响假设的因素,从而超越简单的相关性分析。为了理解安全假设通常包含哪些内容,作者对检测加密API误用的SAST工具进行了系统性文献综述,发现了57个假设并进行了定性分析。随后,作者在四个高度相关的工具中测试了一个常见假设,使用了一个包含57,038条告警的人工标注真值数据集,展示了CAUSEC的实用性和稳健性。分析产生了多个关键发现,代表了关于假设和因果效应的深刻见解,作者将其提炼为三点对未来工作的启示。本文的主要贡献在于:提出了一种使SAST假设可测试的因果分析框架,通过系统文献综述归纳了SAST中的安全假设类别,并通过大规模实验验证了框架的有效性。适合SAST工具开发者、软件安全研究人员以及希望深入理解SAST工具行为背后的因果机制的安全工程师阅读。
💡 推荐理由: 帮助安全团队理解SAST工具检测能力与性能之间的真实因果驱动因素,避免盲目信任或怀疑工具结果,为工具选型、配置调整和误报治理提供科学依据。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Birindwa Prisca Hondi, Chinoso Philip Nwishienyi, Charity Wanja Mwaura, Alia Teto, Jema David Ndibwile
本文是对基于图神经网络(GNN)的智能合约漏洞检测器中表示层(representation layer)的失败分析。研究指出,这类检测器在机器学习之前先将源代码转换为图结构;如果图未能捕获代码的语义,那么任何模型改进都无法弥补这一缺陷。作者以GNNSCVulDetector为例,识别并实验证明了四个具体的表示层失败:第一,结构不同的合约可能生成逐字节完全相同的图,构成一种具体的规避攻击;第二,图构建过程受限于一个硬编码的47项变量白名单(包含一个重复条目),限制了提取器能识别的变量,导致相同漏洞因变量名不同而产生不一致的图,且图质量随变量名偏离白名单而下降,当无匹配项时管道产生脱离源代码变量的结构;第三,表示重入攻击触发者的C节点在文献中最经典的脆弱合约中缺失;第四,控制实验确认了由此导致的直接误分类:一个完全可利用的合约因C->W边从未被构建而被标记为安全。所有四个失败均通过实验验证。文章还指出,现有文献中的准确率是在未暴露这些失败的条件下测得的。作者确认了一个由表示层失败直接导致的误分类案例,并指出此类失败在真实合约群体中的普遍性仍是一个待探索的实证问题。
💡 推荐理由: 该研究揭示GNN漏洞检测器的表示层存在可被利用的结构性弱点,导致规避攻击和误分类,直接影响智能合约安全工具的可信度。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha Rungta
在软件安全领域,准确评估漏洞检测工具的效果高度依赖于包含“漏洞诱导提交”(Vulnerability-Inducing Commits, VIC)的基准数据集——即首次将漏洞引入代码库的提交。VIC 对于确定受影响的软件版本范围、追踪漏洞演化过程至关重要。然而,现有漏洞数据集普遍存在编程语言覆盖有限(多以单一语言为主)、补丁复杂度受限(多为简单小改动)、项目范围狭窄(多集中于少数知名仓库)等问题,难以反映真实世界漏洞的复杂性和多样性。为此,本文作者结合人工专家双重标注与智能体(agentic)工作流,构建了一个名为 VICBench 的多语言漏洞检测基准。该基准包含 100 个经过验证的 VIC,对应 100 个 CVE,覆盖 88 个开源项目,涉及 Python、Java 和 C++ 三种主流编程语言,涵盖 48 种 CWE 类型。VICBench 的特点是包含高度真实的复杂漏洞修复,平均修复补丁规模为 38.6 行,对应 VIC 平均为 252.5 行,显著大于先前工作所使用的补丁,从而提供了更具挑战性的评估场景。为了检验当前技术的实际水平,作者评估了最先进的漏洞定位算法 V-SZZ 和 LLM4SZZ,结果表明其在 VICBench 上仅能达到 33.3%–40.1% 的 F1 分数,说明依赖现有自动方法仍需要大量人工介入,也揭示了当前自动化漏洞检测方法的性能瓶颈。该基准的发布为漏洞检测研究提供了更高质量、更贴近真实场景的评估平台,有助于推动多语言环境下漏洞检测工具的发展和改进,并可作为后续研究(如大模型微调、代码审计工具评测)的基础设施。本文适用于安全研究人员、软件工程学者以及相关工具开发者阅读。
💡 推荐理由: VICBench 填补了当前漏洞检测基准在语言覆盖、补丁复杂度和项目广度上的空白,为安全团队评估自动化漏洞检测工具(尤其是基于大语言模型的方法)提供了更真实的测试集,推动从研究到实践的有效落地。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sadib Hassan Rumman, Md. Shariful Islam, Md. Rayhanur Rahman
本文针对物联网固件漏洞检测中的跨语料库泛化问题展开研究。当前领域面临固件生态异构、平台资源受限以及现有基准测试局限性等挑战,许多数据集为合成数据或通用数据,缺乏人工验证和污染筛查,导致模型跨语料库泛化能力缺少可靠证据。为填补这一空白,作者提出了 IoTVulBench,一个经过人工验证的跨语料库固件漏洞检测基准。IoTVulBench-Core 从 GitHub 仓库构建,由三位专家评审员验证,并在经过污染筛查的held-out目标集上,评估了五种模型架构、两种调优方法和三种课程学习策略,同时进行了集成、蒸馏和鲁棒性分析。实验结果显示,在匹配的单源数据集中,基于 IoTVulBench 训练的模型取得了最高 MCC 值,达到 0.58,优于 PrimeVul 的 0.44 和 D2A 的 0.39。采用分阶段课程学习可将 MCC 提升至 0.69,而多样性优化的集成模型达到 0.73,比最强的参考比较器(静态分析器,MCC 0.31)高出 0.42,比 PrimeVul 高出 0.29。在 0.5% 假阳性率下,模型仅漏报 21% 的漏洞,而最强比较器漏报 71%。该模型在标识符重命名下保留了 86% 的性能,并展现出良好的校准性和可解释性。这些发现表明,领域匹配的训练数据和课程设计,而非单纯的模型规模,是固件漏洞检测泛化能力的关键驱动因素。本文为未来研究提供了基准,并为实际 IoT 安全应用提供了可部署的配置。适合安全研究人员、固件安全工程师和 LLM 应用开发者阅读。
💡 推荐理由: 该研究为物联网固件漏洞检测提供了首个经过人工验证和污染筛查的基准,并证明了领域匹配数据和课程学习比模型规模更重要,有助于提升固件安全分析的可靠性和部署效果。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yu-Fu Fu, Jae-Hyuk Lee, Taesoo Kim
本文提出了一种名为 autofz 的自动化元模糊测试框架,旨在解决模糊测试工具选择负担的问题。随着模糊测试技术的发展,出现了大量各具特色的模糊器,它们在不同目标上表现各异,但不存在一个在所有场景下都最优的通用模糊器。传统方法通过标准基准测试集来比较选择,但平均性能最优的模糊器并不一定适合用户的具体目标。为此,autofz 通过运行时动态组合现有模糊器,实现最优的资源调度。其核心思想是监控各模糊器的运行时进度(称为趋势,类似于梯度下降中的梯度),并据此细粒度地调整资源分配。与传统方法不同,autofz 在运行时根据当前工作负载自适应地推导出合适的模糊器组合,无需用户预先选择。实验评估显示,autofz 在 12 个可用基准中的 11 个上优于任何单一最优模糊器,在 20 个基准中的 19 个上优于现有的协作模糊测试方法。平均而言,autofz 比单一模糊器多发现 152% 的漏洞,比协作模糊测试多发现 415% 的漏洞。该方法为非侵入式设计,用户只需将所有可用模糊器提供给 autofz,即可获得接近最优的结果。本文的主要贡献在于提出了一种自动化、非侵入的元模糊器架构,通过动态趋势监控实现资源调度的细粒度优化,显著提升了漏洞发现的效率和效果。
💡 推荐理由: 对于安全团队而言,autofz 能自动组合现有模糊器,减少人工选型成本,提高漏洞挖掘效率。它无需修改内部模糊器,可快速集成到现有测试流程,值得关注其背后的动态调度思想。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park
该论文提出了一种名为 CLEAR (Causal Context-based Agentic Reasoning) 的新型多智能体漏洞检测框架,旨在解决现代软件漏洞检测中难以建模复杂因果依赖关系的问题。传统方法(包括基于大语言模型和多数多智能体框架)主要关注良性函数与漏洞函数之间的表面相似性,忽略了漏洞形成过程中涉及的执行流、控制条件、程序状态之间的因果链路。CLEAR 的核心创新是构建了一个漏洞因果知识图谱 (VCKG),该图谱系统地建模漏洞实例中入口点、前置条件、根本原因和修复意图之间的因果链。基于 VCKG 的结构化知识,CLEAR 设计了四个专门化的智能体——Collector、Claim、Critic 和 Judge,它们协同工作,通过检索到的因果上下文对候选漏洞假设进行验证。实验基于 C/C++ 和 Java 漏洞基准测试,结果显示 CLEAR 在 Pair-Correct (P-C) 指标上相比最先进方法分别提升了 130.7% 和 71.56%,证明了因果知识图谱引导的智能体推理在自动化漏洞检测中的有效性。该研究主要面向软件安全研究人员、漏洞挖掘工具开发者以及大语言模型在安全领域应用的从业者,为其提供了一种将领域知识(因果图谱)与多智能体协作相结合的新思路。
💡 推荐理由: 该工作为漏洞检测提供了超越表面模式匹配的因果推理新范式,将知识图谱与多智能体协同结合,显著提升检测准确率,对安全自动化研究和工具开发具有重要启发意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Oleksandr Mostovyi, Denys Symonov
本文面向无源码场景下的 AArch64 机器码漏洞检测问题,提出了一种基于数字孪生(Digital Twin)的可解释检测方法。传统二进制分析手段往往依赖符号执行或模糊测试,计算开销大且难以覆盖多步利用模式;同时很多现有工具只报告孤立的危险指令,无法给出完整上下文。该方法首先在虚拟机或模拟器中具体执行目标程序,记录寄存器、处理器标志、内存内容以及活跃分配块的完整状态,将每条指令转换为包含指令名称、操作数值和后指令状态的跟踪事件。漏洞模式被形式化为带测试的 Kleene 代数(KAT)中的符号规则,每条规则由事件序列和针对机器状态的谓词构成,因此可以表达跨多条指令的复杂行为。这些规则被编译成有限自动机,在扫描跟踪时无需调用 SMT 求解器,保证了效率。实验覆盖了三个典型 CWE:整数溢出(CWE-190)、空指针解引用(CWE-476)和堆缓冲区溢出(CWE-122)。系统在预定义漏洞样本上成功检出全部三类漏洞,且对安全样本不产生误报。每次检测结果均包含触发的规则、跟踪位置和具体状态数值,从而提供可复现、可解释的漏洞定位依据。其主要贡献在于:提出面向 AArch64 二进制程序的数字孪生跟踪模型,引入 KAT 规则表达漏洞模式,并设计了无需 SMT 的自动机扫描机制,显著提升了检测结果的可理解性。适合从事二进制分析、固件安全以及漏洞挖掘的研究人员与蓝队工程师阅读。
💡 推荐理由: 该研究面向闭源 AArch64 二进制,提供可解释、可复现的漏洞检测方法,能识别多步利用模式,且不依赖 SMT 求解器,对嵌入式固件审计和供应链安全具有潜在价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiran Zhu, Tong Tang, Jie Wan, Ziqi Yang, Zhenguang Liu, Lorenzo Cavallaro
本文提出了一种名为 BINALIGNER 的二进制代码比对方法,旨在解决跨编译环境下的二进制文件差异分析问题。二进制差异分析(Binary Diffing)通过比对两个二进制文件的控制流图,将对应同一源代码片段的片段进行对齐,广泛应用于漏洞检测、抄袭检测等安全分析场景。然而,现有方法在跨编译环境(如不同编译器、不同优化级别、不同架构等)下效果有限,且对跨编译环境的支持不够灵活,主要原因在于它们依赖基本块的相似性比较。为了克服这些局限,BINALIGNER 在二进制层面提出了两项核心创新:一是引入条件松弛策略(conditional relaxation strategies)来筛选候选子图对,以减少同一源代码片段被错误匹配或漏匹配的可能性;二是使用与指令无关的基本块特征(instruction-independent basic block features)来生成子图嵌入,从而支持更灵活的跨编译环境二进制差异分析。作者在四个典型的跨编译环境场景(跨版本、跨编译器、跨优化级别、跨架构)以及这些场景的组合下进行了实验评估,结果表明 BINALIGNER 在大多数场景中显著优于现有的最先进方法。特别地,在跨架构场景以及多种跨编译环境组合场景下,BINALIGNER 的 F1 分数平均比基线方法高出 65%。此外,作者还通过两个真实世界的漏洞及其补丁的案例研究,展示了 BINALIGNER 在实际安全分析中的实用性。总体而言,BINALIGNER 为跨编译环境的二进制代码比对提供了一种更准确且灵活的解决方案,对于安全研究人员、漏洞分析师以及逆向工程人员具有较高的参考价值。
💡 推荐理由: 二进制比对是漏洞分析与补丁追踪的核心技术。BINALIGNER 在跨架构等复杂场景下显著提升匹配准确率,有助于蓝队自动化识别补丁差异、定位被利用的脆弱代码,并提升固件与多平台软件的安全审计效率。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo
本文提出 VulAgentRL,一个面向跨函数(过程间)漏洞检测的智能体强化学习框架。现实中的漏洞往往涉及多个函数,但现有基于学习的检测器大多孤立地分析每个函数。作者在真实 CVE 样本上统计发现,71.7% 的脆弱函数需要依赖函数外部的证据才能被正确分类。智能体强化学习(RL)可以通过让模型自行收集证据来弥补这一差距,但缺乏可靠的奖励信号——仅基于最终判定的奖励可能被模型通过不执行任何调查而获得。VulAgentRL 基于代码属性图(CPG)构建,CPG 在推理时作为策略模型查询调用者、被调用者、数据流等信息的图数据库;在训练时,同一张图用于验证策略所引用的证据。由于每个 CPG 节点都具有持久的整数 ID,这种验证是精确比较而非文本匹配,因此奖励函数可以正确地奖励有证据支撑的判定。此外,作者通过蒸馏教师调查结果来初始化策略,并证明这种热启动是必需的,因为纯 RL 无法学会从未采样过的工具使用行为。实验采用仓库级划分以防止信息泄漏,在严格的 pair-wise-correct 指标下,VulAgentRL 在减少工具调用次数的同时优于包括前沿模型在内的最先进基线,并且在分布外语料库和类别不平衡场景下保持优势。该研究为过程间漏洞检测提供了一种将结构化代码语义与智能体决策相结合的新思路。
💡 推荐理由: 该研究解决了真实漏洞跨函数检测的关键难题,并创新性地用 CPG 作为验证器提供了可信任的奖励信号,对构建自主漏洞检测智能体具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tennov Simanjuntak, Christoph Csallner
该论文提出了ZIMPAF和RedPhuzz两个系统,以克服现有Web应用模糊测试工具的三大局限性:插桩效率低、缺乏执行环境知识、以及有限的Web领域知识。ZIMPAF是一种运行时解释器插桩工具,实现了多粒度插桩,不仅能提供分支覆盖率,还能监控错误和异常日志、函数调用和语言结构,并识别用户输入用于分支指令的情况。它创新地无需完整污点分析即可识别参数被污染的潜在脆弱函数,并标记为高价值模糊测试目标;同时,通过反向常量探测推断参数来源于常量的函数,认为其不易受攻击并跳过。RedPhuzz则利用这些信息进行高度定向的函数级和输入级模糊测试,不仅基于传统错误检测,还通过多阶段漏洞检测发现静默漏洞。此外,论文引入了三种新型变异策略:感知消毒、分支输入感知和数据类型感知变异,以提高模糊测试的针对性和有效性。在六个基准Web应用的86个测试用例上,RedPhuzz检测到了所有漏洞,而对比工具Phuzz漏掉了16个;RedPhuzz比Phuzz快73%,尽管执行了更多任务。ZIMPAF相比Phuzz的插桩工具PCOV和UOPZ,在五个基准上的吞吐量提高2.1到41.22倍,对一个基准略低(0.87倍)。
💡 推荐理由: 该工作显著提升了Web应用模糊测试的效率和漏洞发现率,特别是能检测静默漏洞,对于蓝队和安全工程师提升自动化漏洞挖掘能力具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zixuan Wu, Cristina Nita-Rotaru
大型语言模型(LLM)越来越多地被用于安全敏感任务,如漏洞检测和代码审查。这篇论文发现了一个此前未被充分探索的攻击面:攻击者可以在源代码中插入对抗性注释,这些注释能够影响检测器的推理过程,而不改变程序的执行行为。作者将攻击者建模为一个编码代理,它实现新功能、故意引入漏洞,并策略性地插入对抗性注释以逃避检测。为此,他们提出了ALIBI——一个自动化、自适应的黑盒攻击框架,该框架利用检测器的输出推理和反馈,迭代地生成并优化对抗性注释。研究者将125个真实世界的空指针解引用漏洞修复提交转化为编码任务,评估了四种具有代表性的基于LLM的漏洞检测器,包括专用开源推理模型和前沿多智能体系统。结果表明,所有检测器都高度脆弱:攻击成功率超过90%,在一个系统上达到100%。进一步实验显示,该框架还能泛化到其他类型的漏洞。最有效的对抗性注释是那些引导检测器推理或伪造外部工具结果的注释,而基于检测器反馈的迭代优化进一步提高了攻击成功率。最后,论文测试了提示级防御,发现它们对自适应攻击几乎没有抵抗力,而架构隔离和检测前注释净化则显著增强了鲁棒性。这项工作揭示了当前基于LLM的漏洞检测器的一个基本攻击面,并激励安全感知的设计,即在自然语言上下文和程序证据之间仔细校准信任。
💡 推荐理由: 暴露了LLM驱动的代码安全工具对自然语言上下文的脆弱性,提醒安全团队需要重新评估此类工具的可靠性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Deyu Yang, Rundong Wei, Xiaoqi Li
该论文针对以太坊非同质化代币(NFT)智能合约中的漏洞检测问题,提出了一种结合漏洞导向代码切片、ERC-721 知识库和受限大语言模型(DeepSeek)分析的方法。研究背景是:现有静态分析工具(如 Slither、Mythril)基于规则高效,但难以处理特定应用逻辑;而自由形式的大模型分析可能被无关代码干扰或输出不一致。作者通过正则表达式模式定位重入、整数溢出/下溢和时间戳依赖等漏洞的候选语句,利用结构感知的上下文窗口算法提取带行号的代码切片,然后让 DeepSeek 基于显式决策规则和固定输出模式分析每个切片,最后支持自动批量处理。在 450 个 NFT 合约样本上,完整配置产生了 437 个阳性标签(阳性率 97.1%);去除外部知识库后阳性率降至 87.11%;分析完整合约(无知识库)则降至 73.78%。实验表明,聚焦的代码上下文和领域约束显著影响检测器的输出效果。该方法为智能合约漏洞检测提供了一种结合专家知识与大模型能力的新范式,适用于安全审计人员和研究机构。
💡 推荐理由: 针对 NFT 智能合约的专用漏洞检测方法,利用代码切片减少大模型分析噪声,结合 ERC-721 知识库提升准确率,为蓝队审计数字资产合约提供可落地的辅助工具。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianjia Yu, Zhengyu Liu, Ziyang Li, Yu Sun, Yinzhi Cao
Electron是一个广泛用于构建跨平台桌面应用的框架,它基于Web技术,由多个不同权限等级的进程组成,进程间通过消息传递通信。当进程间消息携带攻击者控制的输入时,这些输入可能在进程间传播并最终到达特权API(如命令执行),这种消息传播行为被定义为消息传播漏洞(MPVs)。利用MPV通常需要多步操作,例如先通过消息传递在某个进程中实现任意代码执行,然后利用该进程构造另一条消息在另一个进程中进行命令注入。现有工作主要关注Electron的不安全配置和恶意DOM内容,无法检测或利用需要通过复杂跨进程消息传递触发的漏洞。本文提出Proton,一个用于检测MPV的分段定向模糊测试框架。核心思想是将端到端模糊测试沿着消息传递边界分解为每个进程的分段,每个分段的目标要么是到达当前进程中的sink点,要么是将payload传播到下一个进程以探索另一进程。在后一种情况下,消息种子化下一个分段的语料库。最后,Proton合成每个进程的崩溃输入以验证端到端利用。作者在589个真实Electron应用上评估Proton,发现了23个零日MPV,其中22个导致OS命令执行,涉及GitHub stars超过50k的项目。所有发现已负责任披露,已获得13个确认、11个修复、11个CVE以及来自Vercel的漏洞赏金。
💡 推荐理由: Electron应用广泛,其多进程架构中的消息传播漏洞风险高。Proton首次系统性地检测此类漏洞,并发现大量真实零日漏洞,对保障桌面应用安全具有重要实践意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Elie Rizk, Firas Ben Hmida, Birhanu Eshete
本文提出了一种名为TaintRadar的静态污点分析框架,旨在解决现有代码属性图(CPG)在漏洞检测中的三大关键缺陷:粗粒度的净化建模(将验证视为二进制屏障)、数据库盲点(无法跨持久层追踪污点)以及浅层面向对象分析(遗漏字段级和跨过程数据流)。TaintRadar通过三个语义分析层对CPG进行系统增强:一是漏洞类型化的净化分析,利用传递函数和上下文敏感的参数绑定计算节点级安全保障;二是持久感知的传播机制,整合数据库模式约束和查询安全分析,以追踪跨多个脚本的共享数据库状态攻击路径;三是对象感知的到达定义,结合调用上下文和有界变量别名上下文,精确建模跨方法边界的对象字段变更。在SARD基准测试中,TaintRadar大幅降低了误报率,同时保持了80%的整体准确率。在19个真实PHP应用程序上的部署结果显示,它重新发现了大多数已知CVE,并发现了29个已确认的零日漏洞(包括26个SQL注入和3个存储型XSS),这些漏洞均已获得CVE标识。实验证明,语义感知的图增强显著提升了静态污点分析的精度、覆盖率和实际可用性。
💡 推荐理由: TaintRadar针对现有静态分析工具的三大痛点提出了系统性的解决方案,能有效降低误报并发现真实漏洞,尤其适合对PHP应用进行深度安全审计。其语义增强方法有望推广到其他语言和框架。
🎯 建议动作: 研究跟进,评估在内部代码审计流水线中集成TaintRadar的可行性
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Manuel Israel Cázares
本文研究了大型语言模型(LLM)在代码安全漏洞检测中的路由天花板现象。作者基于先前的数学推理研究(SAIR)假设,将结构先验(即“小抄”)注入提示词,以提升模型在特定分布下的漏洞检测能力。实验使用了三个LLM(GPT-OSS-120B、Llama-3.3-70B、Gemma-4-31B),覆盖三种漏洞类型(CWE-798、CWE-284及非CWE的N+1反模式),分别代表句法、语境和语义复杂度。在合成数据集上,结构先验将语义漏洞召回率从20.0%提升至100.0%,但零样本性能随语义复杂度增加而下降。当将相同的小抄迁移至真实世界CVE数据集(VUDENC中的CWE-89和CWE-22)时,分布转移导致性能急剧下降:CWE-89的合成F1从100%降至48.9%(下降51.1个百分点)。迭代校准生成的v2小抄在真实数据上表现更差,进一步验证了SAIR中的性能权衡面。这些发现表明路由假设具有跨域普适性:模型具备解决任务的知识,但缺乏可靠的路由机制;结构先验虽能放大分布内性能,但会加剧分布外崩溃。作者主张应开发分布感知的训练方法,而非仅靠提示校准。论文代码已公开。
💡 推荐理由: 该研究揭示了LLM在代码安全检测中的脆弱性:结构先验虽能提升特定场景性能,但在真实漏洞数据上会引发灾难性崩溃,对依赖LLM的安全工具可靠性构成警示。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mingyang Sun, Guozhu Meng
该论文提出 DREA(解耦推理与探索代理)框架,旨在解决现有基于大语言模型(LLM)的漏洞检测方法在仓库级别(跨函数、跨文件)上下文自适应获取上的不足。现有方法多依赖孤立函数或固定程序分析规则提取的上下文,难以应对涉及多个函数或文件的复杂漏洞,导致检测可靠性下降。DREA 通过两个协作代理解耦推理与探索:规划代理基于高级 LLM 形成漏洞假设并指导调查方向;探索代理使用轻量级模型按需检索仓库级别上下文。这种目标导向的上下文获取机制是检测性能提升的主要来源,同时将消耗大量 token 的探索任务卸载到本地模型,大幅降低推理成本。为评估框架,作者构建了 RepoPairBench 基准,包含来自真实项目的已验证 Python 漏洞-修复对。除了二元检测准确率,论文还引入推理正确性评估,衡量模型推理逻辑是否与文档记录的漏洞机理一致。在三个 LLM 上的实验表明,DREA 将配对正确率从 19%-26% 提升至 30%-42%,同时将超过 93% 的 token 卸载到探索代理,估计可计费 API 成本降低 16-48 倍。推理正确性分析进一步揭示,DREA 和仅函数基线中 26%-55% 的真阳性虽然预测正确,但支持预测的推理逻辑存有缺陷,表明安全推理质量是当前 LLM 的共同瓶颈。该工作适合安全工程师、漏洞检测工具开发者和 LLM 应用研究者阅读。
💡 推荐理由: 该研究针对仓库级别漏洞检测中上下文获取自适应的关键难题,提出一种解耦推理与探索的代理框架,显著提升了检测准确率并大幅降低 API 成本,为实际部署大规模 LLM 漏洞检测系统提供了可行方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qiyuan Fan, Zhi Li, Junjie Li, XiaoFeng Wang, Bin Yuan, Deqing Zou
该论文提出 Bulkhead,一个自动化框架,用于检测和修复容器逃逸中的路径遍历(PaTra)漏洞。背景是容器生态系统中的文件系统隔离常因跨边界路径解析错误而削弱,导致路径遍历漏洞。这些漏洞源于不安全的主机-容器交互,尤其是在云系统将共享资源(如GPU、代理工作区)挂载到容器中以支持AI工作负载时,此类漏洞日益普遍。现有防御不足:内核级防护具有侵入性,可能破坏系统调用稳定性,因此未被Linux主线接受;检测方法依赖于静态规则匹配或手动代码审计,静态规则会标记路径相关函数但无法捕获确定主机-容器交互所需的语义,导致大量误报;手动审查需要领域专业知识,成本高、效率低、难以扩展。Bulkhead创新性地将大语言模型(LLM)与形式化方法相结合,实现语义漏洞发现与修复。该框架使用多智能体系统,通过从已知案例中泛化的多维知识模式来识别和修复PaTra漏洞。首先,应用高风险功能模式定位容器化代码中跨边界交互的入口点;然后,利用调用链模式以适当深度恢复相应的执行路径。检测管道根据应用场景和威胁模型分析这些调用链,识别跨边界交互中的缺失安全检查、TOCTOU竞态等漏洞,并生成概念验证(PoC)漏洞进行验证。这些PoC随后指导补丁生成。为确保修复正确性,补丁管道使用预定义的模型检查模板进行断言驱动验证。实验(论文中应有)证明Bulkhead能有效发现真实世界容器环境中的漏洞并生成可靠补丁。该工作适合容器安全研究人员、云平台开发者及对AI基础设施安全感兴趣的从业者阅读。
💡 推荐理由: 容器逃逸漏洞是云原生安全的核心威胁,尤其随着AI工作负载引入GPU等共享资源,攻击面急剧扩大。Bulkhead首次将LLM与形式化方法结合自动化检测和修复此类漏洞,有望大幅降低人工审计成本与误报率,提升容器安全防护水平。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chendong Yu, Yang Xiao 0011, Jie Lu 0009, Yuekang Li, Yeting Li, Lian Li 0002, Yifan Dong, Jian Wang 0067, Jingyi Shi, Defang Bo, Wei Huo 0005
该论文对文件劫持漏洞(File Hijacking Vulnerabilities, FHVulns)进行了系统性研究。文件劫持漏洞是一类通过操纵文件内容或路径来突破安全边界的漏洞,但此前缺乏对其底层机制的全面理解。作者收集了2020年1月至2022年10月期间268个详细记录的FHVuln CVE条目,进行了深入的实证研究,揭示了FHVuln的起源和触发机制,并指出现有检测技术忽略了大部分此类漏洞,因此预计软件中存在大量零日FHVuln。为了弥补这一缺口,作者开发了动态分析工具JERRY,该工具通过在程序执行期间模拟劫持动作,能够有效在运行时检测FHVuln。JERRY被应用于微软、谷歌、Adobe、英特尔等厂商的438个流行软件程序,共发现339个零日FHVuln。所有发现的漏洞均已向相应厂商报告,截至目前,84个漏洞已得到确认或修复,获得了51个CVE编号和83,400美元漏洞赏金。论文的核心贡献包括:首次对FHVuln进行大规模实证研究,揭示了其分布和触发模式;提出了一种新的动态检测方法JERRY,其检测能力显著优于现有工具;通过实际应用证明了该方法在发现真实世界漏洞方面的有效性。适合安全研究人员、漏洞分析工程师以及软件安全开发人员阅读。
💡 推荐理由: 文件劫持漏洞长期以来被忽视,该研究首次系统地揭示了其普遍性和严重性,并提供了一款有效的动态检测工具JERRY,可帮助安全团队发现大量零日漏洞,显著提升软件供应链安全。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Yuqiang Sun, Han Liu, Ying Li, Yiran Zhang, Zong Cao, Ziyun Guo, Yang Liu
该论文提出 EvoVuln,一个自动生成智能合约漏洞检测程序化知识的框架。现有基于大语言模型(LLM)的方法存在局限:基于提示的方法依赖人工设计的检测规则,而微调则需要大量标注样本,这在智能合约领域难以获取。EvoVuln 将漏洞检测重新定义为程序化知识进化问题,仅需极少量标注样本即可合成并精炼检测逻辑。其核心机制包括两个部分:一是运行时反转控制(IoC)架构,将检测规则编译为可执行策略,严格解耦确定性控制流与 LLM 语义推理,确保忠实遵循逻辑并产生密集的诊断遥测用于精确定位错误;二是两阶段进化流水线,通过溯因语义调试在没有参数更新的情况下精炼规则:冷启动阶段利用自动生成的边缘案例初始化并压力测试初始规则,少样本进化阶段仅使用每种漏洞类型 5 个漏洞样本和 5 个安全样本将策略锚定到真实世界语义。在五种真实漏洞类型上的评估显示,EvoVuln 达到 71% 的宏平均 F1 分数,优于所有基线。进化得到的程序化知识可跨模型迁移:使轻量低成本模型超过更大的零样本模型 19 个百分点,且无需重新训练即可迁移到其他 LLM,单次进化成本低于 50 美元。该研究适合安全研究员、智能合约开发者及 LLM 应用开发者阅读。
💡 推荐理由: 提出一种低成本、高可迁移的智能合约漏洞检测方法,突破 LLM 依赖大量标注数据的瓶颈,且知识可跨模型复用,为自动化漏洞检测提供了新范式。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro
该论文提出了Antaeus,一个用于检测仓库级逻辑漏洞的框架,通过将LLM推理锚定在仓库级代码上下文中来克服现有方法的局限性。逻辑漏洞的识别需要推断应用特定的安全不变量和隐式假设,而现有基于LLM的检测器在内存安全等漏洞上表现良好,但难以处理逻辑漏洞,因为其安全不变量通常隐含在大量代码中。Antaeus采用仓库规模的处理流程,包括四个步骤:函数优先级排序(利用轻量级仓库级安全信号对函数进行排序,减少LLM调用成本)、上下文推理(结合本地代码上下文和仓库级视角,包括应用功能、安全资源和信任边界,推导安全条件)、比较验证(排除项目范围内的共同规范而非独有违规)和结构化报告(输出漏洞细节、违反的安全条件和证据)。在28个包含已确认逻辑漏洞的仓库上评估,Antaeus检测并解释了15个漏洞,在token使用和成本相当的情况下优于函数级和智能体基线模型。该工作为逻辑漏洞的自动化检测提供了新思路,适合安全研究人员和代码审计工具开发者关注。
💡 推荐理由: 针对逻辑漏洞检测这一长期挑战,提出了一种利用仓库级上下文的LLM推理方法,有望提升自动化代码审计的准确性和效率。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sally Junsong Wang, Kexin Pei, Junfeng Yang
智能合约是区块链上执行各种商业活动的软件程序。近年研究发现了一类新的“机器不可审计”漏洞,它们源于源代码未能满足底层交易上下文。现有检测方法需要人工理解交易逻辑并手动推理不同上下文来源(即模态),例如代码和描述预期交易行为的自然语言。为了自动化检测这类漏洞,本文提出了SmartInv,一个准确且高效的智能合约不变量推断框架。核心洞见在于,智能合约的预期行为(通过不变量指定)依赖于跨模态信息的理解和推理,如源代码和自然语言。作者提出了一种新的基础模型微调和提示策略——Tier of Thought (ToT),用于在智能合约的多个模态间进行推理并生成不变量。SmartInv随后通过检查这些生成不变量的违反情况来定位潜在漏洞。实验评估基于过去2.5年(2021年1月1日至2023年5月31日)导致财务损失的真实世界智能合约漏洞,结果表明SmartInv能生成有效不变量,准确定位“机器不可审计”漏洞,共发现119个零日漏洞。从中采样了8个漏洞报告给相应开发者,其中6个被迅速修复,5个被确认为“高严重性”。该研究展示了利用多模态大模型自动推理智能合约安全性的可行性和有效性。
💡 推荐理由: 该研究提出了一种自动化检测智能合约中新型“机器不可审计”漏洞的方法,填补了现有工具依赖人工的空白,对提升区块链应用安全性具有实用价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik
该论文首次系统性地探索了大型语言模型(LLM)在代码漏洞检测中受到认知启发(cognitive heuristics)影响的现象。作者设计了一个可控框架,保持代码本身不变,仅改变周围上下文来触发三种认知启发:晕轮效应(通过作者归属)、框架效应(通过任务目标和后果)和锚定效应(通过先前的分析结果)。在三种编程语言(可能包括C、Java、Python等)上评估了8个LLM(如GPT-4、LLaMA等),进行了定量和代码级分析。结果表明,所有模型均易受这些启发影响,其中框架效应的平均影响最高达33.2%,锚定效应23.5%,晕轮效应18.4%。代码级分析显示,需要语义推理才能检测的漏洞(如逻辑错误)比通过模式匹配可识别的漏洞(如语法错误)更容易受认知启发影响。此外,模型常常根据认知条件将代码从安全误判为脆弱,而并未准确识别实际漏洞。为了展示实际影响,作者演示了一种概念验证的黑盒认知攻击,能够抑制之前检测到的多达97%的漏洞。这些发现表明认知易感性是LLM漏洞检测中一致且可利用的属性。该研究对依赖LLM进行安全审计的开发者、安全分析师和AI安全研究者具有重要警示意义。
💡 推荐理由: 揭示了LLM在漏洞检测中可能因上下文信息(如作者、任务描述、先前结果)产生系统性误判,攻击者可利用这种认知漏洞逃避检测,对AI驱动的安全工具可靠性构成威胁。
🎯 建议动作: 研究跟进:评估内部LLM安全工具对此类认知攻击的鲁棒性,探索上下文净化或输入去偏等缓解措施。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhenhao Luo, Pengfei Wang 0010, Baosheng Wang, Yong Tang 0005, Wei Xie 0007, Xu Zhou 0004, Danjun Liu, Kai Lu 0001
代码复用是软件开发中的常见现象,但也带来漏洞的广泛传播,威胁软件安全。随着物联网(IoT)的普及,固件代码复用问题更加突出。二进制代码搜索是发现这些隐藏漏洞的有效途径。然而,IoT固件通常由不同编译器、不同优化级别、不同架构编译而成,现有方法难以适应这种复杂场景。本文提出一种新的中间表示函数模型,该模型与架构无关,适用于跨架构二进制代码搜索。具体方法是将二进制代码提升为微码,通过补充隐式操作数和修剪冗余指令来保留二进制函数的主要语义。然后,利用自然语言处理技术和图卷积网络生成函数嵌入。作者将编译器、架构和优化级别的组合称为“文件环境”,并采用分治策略,将C2N跨文件环境场景的相似度计算问题分解为N-1个嵌入传递子问题。为此,提出基于熵的适配器,将不同文件环境的函数嵌入转换到同一文件环境,以缓解文件环境差异带来的影响。为了精确识别脆弱函数,提出渐进搜索策略,用细粒度特征补充函数嵌入,减少由补丁函数引起的误报。原型系统VulHawk在七种不同任务下进行了实验,结果表明其在性能和鲁棒性上均优于Asm2Vec、Asteria、BinDiff、GMN、PalmTree、SAFE和Trex等现有方法。
💡 推荐理由: 该研究为安全分析师提供了一种跨架构的二进制代码搜索方法,能够有效发现IoT固件中因代码复用而引入的漏洞,提高漏洞检测的自动化程度和准确率。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jie Zhu, Penghui Li, Zhongxuan Li, Chihao Shen, Ziyang Li, Yizheng Chen, Kexin Pei
符号执行是一种强大的程序分析技术,广泛应用于漏洞检测、安全测试和恶意软件分析等领域。然而,该技术面临可扩展性问题,例如路径爆炸和复杂约束,这些问题往往源于真实程序中常见的特定结构和语义模式。现有方法尝试通过将程序转换为新表示来规避这些模式,从而降低执行开销。但遗憾的是,这些变换通常过于僵化,难以利用多样的局部程序语义,有时甚至依赖为具体执行设计的编译器优化,可能与符号执行的目标不一致。为此,本文提出了Symbolon框架,该框架能够自动学习多样化的代码变换,并以上下文敏感的方式应用这些变换来改进符号执行。其核心思想是将变换发现表述为程序表示上的搜索问题。为了使搜索实用化,Symbolon在离线状态下对小规模程序进行低成本学习,将学到的变换精炼成可重用的智能体技能库,然后利用智能体在仓库级目标上实例化这些技能。评估表明,在32个真实程序上,Symbolon采用16种搜索策略,均显著提升了符号执行引擎KLEE的性能:平均行覆盖率提高了3.69倍,峰值内存降低了29.2倍,每次查询的求解时间降低了123倍。当应用于最新的Linux内核时,Symbolon发现了21个以前未知的漏洞,所有漏洞均已报告给内核维护者。
💡 推荐理由: 该研究提出了一种自动化学习代码变换以优化符号执行的新方法,显著提升了漏洞检测的覆盖率和效率,对安全从业者提升程序分析能力具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jingdong Guo, Chaopeng Dong, Yimo Ren, Siyuan Li, Jie Liu, Hong Li, Hongsong Zhu
该论文对二进制代码相似性检测(BCSD)在真实世界漏洞检测中的应用进行了大规模的实证研究。固件是物联网设备的核心,其开发高度依赖第三方库(TPL),这虽然加速了开发过程,但也引入了相关漏洞。BCSD通过比较代码片段对来识别固件中的漏洞,是一种有效技术。然而,现有研究要么仅在小规模数据集上评估性能,要么在漏洞、TPL和固件多样性方面不足,导致缺乏对BCSD在真实世界漏洞检测中全面理解。为填补这一空白,作者基于来自200个供应商的60,000个固件镜像,使用BCSD进行大规模漏洞检测研究。该研究并非提出新模型,而是考察四个关键因素对BCSD性能的影响:易受攻击函数版本、漏洞搜索空间、函数大小和编译工具链。结果表明,这些因素显著影响性能,且差异较大。为解决此问题,作者提出了一种构建感知查询策略,从真实世界的代表性二进制文件中派生查询,有效缩小差距,将平均倒数排名(MRR)从0.818提升至0.981。此外,他们还证明了一种TPL感知的两阶段搜索过程,通过限制搜索空间,将MRR进一步提高18.5%。该论文的主要贡献在于系统性地揭示了影响BCSD性能的关键因素,并提出了实用的优化策略,为固件安全漏洞检测提供了重要的实证依据和方法指导。适合安全研究人员、固件分析师和从事二进制分析的工作者阅读。
💡 推荐理由: 该研究揭示了二进制代码相似性检测在真实固件漏洞检测中的关键影响因素,并提出了有效的优化策略,显著提升了检测精度,对提升物联网固件安全性具有重要指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Andrew Stoltman, Johnathan Tang, Haipeng Cai
本论文针对大语言模型(LLM)用于自动化漏洞检测时,程序结构与语义信息的表示方式这一关键问题进行了实证研究。作者指出,当前的提示工程方法通常直接提供原始源代码,但这一做法缺乏理论支撑,且可能引入冗余信息导致推理效果下降。为此,论文构建了RepBench基准测试集,基于Joern工具从真实C/C++漏洞测试用例中提取多种程序表示:原始源码、抽象语法树(AST)、控制流图(CFG)、程序依赖图(PDG)及其组合,并特别增加了增强型PDG(ePDG)变体。实验采用来自PrimeVul的107个测试用例(覆盖5个CWE类别),在固定思维链(Chain-of-Thought)和结构化输出协议下评测了10种表示变体,外加19个额外ePDG用例。结果表明,表示选择显著影响LLM的漏洞推理能力。最佳组合AST+PDG达到83.2%的准确率,而原始源码仅53.5%。图结构提示(仅含图)在家族层面优于纯源码提示或源码+图提示,且所需提示长度更短。研究揭示了“上下文稀释效应”:向紧凑的结构化证据中添加原始源码,反而会降低关键漏洞信息的显著性,损害推理能力。总体而言,精心选择的结构化表示能够提供比简单增加原始输入更好的准确率-开销权衡,表明静态分析可作为安全聚焦型LLM推理的有效提示构造层。该工作对于理解如何优化LLM在代码安全任务中的输入表示具有重要指导意义。
💡 推荐理由: 本研究表明,直接给LLM喂原始源码并非最优做法,合理选择结构表示(如图或AST)能显著提升漏洞检测准确率。安全团队在构建AI辅助漏洞检测系统时,应优先考虑基于静态分析的结构化提示,而非盲目堆叠上下文。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiteng Peng, Dongwei Xiao, Zhibo Liu, Zhenlan JI, Shuai Wang
全同态加密(FHE)允许在不解密的情况下直接对加密数据进行计算,为安全云计算、金融和医疗等隐私敏感应用提供了强大的隐私保障。然而,FHE方案的复杂性阻碍了其实际应用。为了降低开发门槛,新一代专用框架应运而生,将高级FHE程序转换为复杂的FHE操作,引入了新的编程范式。但这些框架的内在复杂性使其易受实现逻辑缺陷的影响。与简单的崩溃不同,逻辑错误可能悄无声息地破坏加密计算,导致严重的经济损失和FHE增强应用中的安全漏洞。本文提出了HERTA,首个专为FHE框架设计的自动化测试工具。HERTA利用蜕变测试(Metamorphic Testing)来揭示FHE软件栈多层级中的深层实现漏洞。为此,作者设计了一组基于FHE语义的新型蜕变关系(MRs),这些关系能够针对流水线中最具挑战性的方面进行压力测试,从而在没有人工真实标签的情况下实现自动化正确性检验。在三个领先的工业FHE框架上进行的评估中,HERTA发现了21个先前未知的错误,其中多个已被开发者确认并修复。此外,危害分析揭示了这些错误对基于FHE服务的完整性和可用性构成的严重安全影响。该研究对FHE框架的开发者、安全审计人员以及依赖FHE的应用程序设计者具有重要参考价值。
💡 推荐理由: FHE框架中的逻辑错误可能导致加密数据被静默破坏或泄露,威胁金融、医疗等高安全领域。HERTA作为首个自动化测试工具,可帮助提前发现深层漏洞,提升FHE生态的安全性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner
本文提出 Revelio,一个面向仓库级代码库的内存安全漏洞检测智能体框架。内存安全漏洞(如缓冲区溢出、释放后使用等)即使在经过大量模糊测试和人工审计的项目中仍然存在。现有基于大型语言模型(LLM)的方法虽有潜力,但存在幻觉、不可靠且难以扩展到大型代码库等问题。Revelio 通过生成可执行的漏洞证明(PoV)并由确定性消毒器验证来解决幻觉问题,从而确保报告的可复现性和可信度。框架采用低成本 LLM 与轻量级静态分析相结合,先生成漏洞假设,然后排序,仅在消毒器确认后报告漏洞。研究者在经过 5-8 年持续模糊测试的 7 个生产质量项目以及 CyberGym 基准中随机选取的 100 个 Arvo 项目上进行了评估。每个项目约耗时 1 小时,总成本 300 美元,共发现 19 个先前未知的内存安全漏洞。在基准测试中,Revelio 在使用不同骨干模型且 token 成本相当的情况下,性能优于前沿编码智能体。结果表明,Revelio 能够实现可扩展且可信的端到端 LLM 内存安全漏洞检测。本文适合安全研究人员、开发者及希望利用 AI 提升代码安全性的团队阅读。
💡 推荐理由: Revelio 提出了一种结合 LLM 与确定性验证的实用方案,在低成本下发现了多个真实项目中的未知漏洞,为自动化漏洞检测提供了可复现、可扩展的新范式。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Sebastian Neef, Luca Jungnickel, Antonio Benjamin Buchholz, Valene Spence, Vicente Birke Gonzalez
该论文评估了六种前沿和开放权重的大型语言模型(LLMs)在实际Web漏洞检测中的能力,专注于WordPress插件中的静态分析。研究涵盖了SQL注入、存储型跨站脚本、路径遍历和远程代码执行四类漏洞,使用了五种不同结构、范围和复杂度的提示设计,并在三轮实验迭代中测试。结果显示,所有模型都能发现有效安全问题,但检测率因模型和提示而异:Claude Opus 4.6达到最高检测率63%,开源模型MiniMax M2.5以48%的表现与前沿模型相当,而自托管的Qwen 3.5仅为35%。研究发现,限定漏洞范围的提示优于开放式提示,而提示复杂度影响不大。值得注意的是,没有模型在三轮迭代中实现完全一致的报告,一致性最低仅50%。此外,没有一个模型能正确识别某个插件中的基准漏洞。论文为安全从业者提供了实践经验,并公开了所有代码和数据以支持未来研究。
💡 推荐理由: 该研究系统评估了LLM在真实Web漏洞检测中的表现,揭示了模型选择与提示设计的关键影响,为安全团队在自动化代码审计工具选型时提供参考依据。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoran Yang, Jiaming Guo, Shuangning Yang, Guoli Zhao, Qingqi Liu, Chi Zhang, Zhenlu Tan, Lixiao Shan, Qihang Zhou, Mengting Zhou, Jianwei Tai, Xiaoqi Jia
本文提出 IoTBec,一种不依赖固件或源代码的物联网设备漏洞检测框架,专门用于发现黑盒设备中重复出现的漏洞。核心思路是构建“漏洞接口签名”(Vulnerability Interface Signature, VIS),该签名基于对黑盒接口的逆向分析和已知漏洞信息,能够快速匹配目标设备中潜在的相似漏洞。随后,IoTBec 将签名检测与大型语言模型驱动的模糊测试深度结合:一旦匹配成功,自动调用 LLM 生成针对性测试用例进行验证。作者在五家主流 IoT 厂商的设备上进行了大量实验,结果表明 IoTBec 比当前最先进的黑盒模糊测试方法(SOTA)发现的漏洞数量高出 7 倍以上,精确率达 100%,召回率 93.37%。总共检测到 183 个漏洞,其中 169 个获得 CVE 编号,53 个为新发现漏洞且平均 CVSS 3.x 评分为 8.61,涵盖缓冲区溢出、命令注入和 CSRF 等问题。特别地,通过 LLM 驱动的模糊测试还发现了 25 个此前未知的漏洞。该框架的创新在于无需固件或源代码,仅依赖黑盒交互即可高效发现已知漏洞的变种及新漏洞,显著提升了真实场景下的检测效率。适合安全研究人员、IoT 设备制造商及蓝队安全分析师阅读。
💡 推荐理由: 黑盒 IoT 设备漏洞检测长期依赖固件逆向,本工作提出不依赖固件/源码的范式,大幅提升检测效率与覆盖率,并能发现高危变种漏洞,对提升 IoT 生态安全有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ruixiang Qian, Ding Yang, Zengxu Chen, Yuxuan Gao, Chunrong Fang, Chao Zhang, Zhenyu Chen
本文首次研究了基于变异性(metamorphic)的模糊测试预言增强(MFOE)方法,旨在提升灰盒模糊测试的漏洞检测能力。传统的模糊驱动程序通常仅依赖崩溃预言(crash-based oracle),忽略了库函数功能的正确性验证,限制了发现非崩溃类缺陷的能力。为此,作者提出利用变异性关系(MRs)构造变异性预言,并将其集成到现有模糊驱动中。然而,手动构建和集成此类预言需要大量领域知识,难以自动化。为解决这一挑战,论文提出了MetaFOE框架,借助大型语言模型(LLM)自动生成并集成变异性预言。MetaFOE首先从目标函数接口和文档中提取信息,利用LLM生成候选MRs,然后通过静态分析和编译验证筛选出可用的MRs,再自动生成元驱动程序(meta driver)代码。实验基于OSS-Fuzz项目中的实际驱动程序,使用了三种现代LLM(GPT-4、Claude等)和五种提示策略。结果显示,MetaFOE生成了3475个MRs,其中77.3%可被应用;实现了12351个元驱动,其中6228个有效。经过三小时的模糊测试,有效元驱动平均提升了18.7%的边覆盖率,并触发了1528个独特的崩溃。该工作证明了变异性预言增强的有效性以及利用LLM自动化实现MFOE的可行性,为推进灰盒模糊测试提供了新思路。
💡 推荐理由: 该研究首次将变异性预言的自动化构造引入模糊测试,通过LLM显著降低了人工成本。提升边覆盖率和触发大量崩溃表明其实际效果,对安全测试人员改进模糊驱动、发现非崩溃类漏洞具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuchen Chen, Weisong Sun, Haocheng Huang, Yuan Xiao, Chunrong Fang, Yiran Zhang, Tingting Xu, Zhenpeng Chen, An Guo, Peizhuo Lv, Xiaofang Zhang, Zhenyu Chen, Yang Liu, Baowen Xu
本文针对代码语言模型(CodeLMs)中的自然后门漏洞进行了深入的实证研究。自然后门是指模型在正常训练过程中无意习得的后门行为,与通过数据投毒注入的后门不同,其产生机制与模型内部表征有关。研究覆盖了多种模型架构(如GPT、BERT变体)和代码智能任务(如代码补全、缺陷检测、代码翻译),在44个场景下系统性地评估了自然后门的存在性,结果表明自然后门在CodeLMs中普遍且固有。作者从模型层面和参数层面揭示了自然后门与注入后门的差异:前者往往与更多参数相关且分布更散。进一步分析了自然后门在数据集、模型架构和共享知识上的可迁移性,发现它们能在不同任务间迁移。成因分析从训练数据(如数据中的隐性偏差)和训练过程(如过拟合)两方面展开。评估了现有防御技术(包括预训练、训练中、训练后防御)对自然后门的缓解效果,发现多数防御效果有限。最后提出了ScanNBT检测方法,通过特征分析和异常模式识别来增强对自然后门的检测能力。该研究有助于理解CodeLMs的安全隐患,为开发更安全的代码模型提供指导。适合安全研究人员、AI安全工程师、代码智能开发者阅读。
💡 推荐理由: 自然后门可能潜伏在正常训练的代码模型中,影响代码生成、漏洞检测等关键任务的安全性与可靠性,现有防御手段难以有效清除,对依赖CodeLMs的软件供应链构成潜在威胁。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peihong Lin, Pengfei Wang 0010, Xu Zhou 0004, Wei Xie 0007, Gen Zhang, Kai Lu 0001
定向灰盒模糊测试(DGF)旨在通过预定义目标位置强化对易受攻击代码区域的测试。现有DGF技术主要基于启发式算法优化适应度指标,但这些方法依赖历史执行信息,对尚未执行的路径缺乏预见性,导致难以处理具有复杂约束的路径,从而降低DGF效率。本文提出DeepGo,一种预测性定向灰盒模糊测试器,通过结合历史与预测信息,引导DGF沿最优路径到达目标位置。首先,DeepGo引入路径转换模型,将DGF建模为通过特定路径转换序列到达目标的过程;变异生成的新种子会引发路径转换,高奖励路径转换序列对应的路径更有可能到达目标。其次,为预测未执行的路径转换及其奖励,DeepGo使用深度神经网络构建虚拟集成环境(VEE),该环境逐步模仿路径转换模型并预测路径转换的奖励。然后,开发了模糊测试强化学习(RLF)模型,生成具有最高序列奖励的转换序列,RLF结合历史与预测路径转换生成最优序列,并指导变异策略。最后,为执行高奖励路径转换序列,提出动作组概念,综合优化模糊测试关键步骤,高效实现最优路径。实验在包含25个程序、100个目标位置的基准测试集上进行,结果表明DeepGo在到达目标位置的速度上比AFLGo、BEACON、WindRanger和ParmeSan分别快3.23倍、1.72倍、1.81倍和4.83倍,在暴露已知漏洞方面分别快2.61倍、3.32倍、2.43倍和2.53倍。
💡 推荐理由: 该研究通过引入预测性路径规划和强化学习,显著提升了定向灰盒模糊测试的效率和漏洞发现能力,为安全测试工具的智能化改进提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Penghui Li 0001, Wei Meng 0001, Mingxue Zhang 0001, Chenlin Wang, Changhua Luo
本文提出了一种名为符号解释器分析(SIA)的新方法,用于解决动态Web应用程序在符号执行中面临的多语言挑战。传统的符号执行工具由于对动态语言(如PHP)的语法支持有限且工程成本高,难以有效分析现代Web应用。SIA的核心思想是:由于Web应用逻辑由解释器(如PHP解释器)执行,因此可以利用现成的符号执行引擎分析解释器的二进制代码,从而间接理解Web应用的行为。这种方法继承了解释器对完整语法的支持,并复用了现有符号执行引擎的成熟工程实现。然而,SIA需要解决若干技术挑战,包括Web应用的探索(如处理超链接、表单等)、数据库交互的符号化建模等。作者基于SIA实现了SymPHP,一个针对PHP应用的混合执行(concolic execution)引擎。实验表明,SymPHP在多种PHP应用上实现了高代码覆盖率,并成功识别了数据集中77.23%的已知漏洞,显著优于此前的方法。此外,基于SymPHP构建的混合模糊测试框架进一步提升了模糊测试效率,并发现了10个新漏洞。该工作适合安全研究人员、Web应用安全工程师以及符号执行领域的开发者阅读,为动态语言Web应用的自动化漏洞发现提供了新的思路。
💡 推荐理由: 该工作提出了一种新颖的符号执行方法,通过分析解释器代码来间接处理动态Web应用,解决了多语言支持难和工程成本高的痛点,有望大幅提升PHP等动态语言Web应用的漏洞检测能力。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohsen Lesani
本文提出了一种基于类型系统的方法来推导程序暴露的抽象“怪异机器”(weird machines)。背景是:广泛使用的关键软件系统中存在潜伏漏洞,攻击者可触发并级联这些漏洞,使程序行为异常,形成可被利用的编程模型。作者创新性地设计了一种信息流类型系统,通过追踪信息流类型来检测漏洞,并抽象漏洞间的控制流以捕获怪异机器。形式化证明表明,推导出的怪异机器能够覆盖程序可能表现出的所有怪异运行时行为。进一步,攻击模式往往简单且重复,因此可以将抽象机器建模为漏洞类型的正则表达式,这种表示与平台无关,可作为攻击的统一描述语言。最后,基于正则表达式的语言包含性等决策比针对具体程序或其他形式语言的决策高效得多。本文主要贡献在于:提供了一种自动化推导程序内部攻击能力(即怪异机器)的框架,并给出了平台无关的攻击描述方法。适合安全研究人员、编译器开发者及系统安全工程师阅读。
💡 推荐理由: 该方法首次系统性地从程序漏洞中抽象出攻击者可利用的“怪异机器”,为理解漏洞组合和攻击路径提供了理论工具,有助于开发更智能的漏洞检测与防御手段。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Prashant Kumar Pathak
该论文提出了一种需求驱动的云安全态势管理(CSPM)漏洞检测架构,旨在减少从漏洞披露到客户系统具备检测能力之间的关键路径延迟。传统CSPM依赖供应商集中维护和分发规则集,更新节奏受限于发布周期(数小时至数天),且针对包含配置谓词的丰富检测规则需要额外的人工编写时间。论文提出的架构不再由供应商分发规则集,而是在客户租户内持续从公共源(如CVE目录)与实时资产图的交集动态衍生规则:当目录条目与适用资产同时存在时规则产生,当任一输入不再支持时规则消失。这种双向推导既响应新目录条目也响应新资产,利用了目录条目的完整结构化字段(不仅限于受影响软件字符串)。实时规则集的规模受限于环境多样性而非目录广度。论文详细阐述了威胁模型、架构设计、形式化语义及等价定理、复杂度分析、工作示例和评估方法。主要贡献在于架构性转变及其带来的延迟和资源影响,规则正确性和告警优先级排序不在讨论范围内。该研究适合云安全架构师、CSPM产品设计者和安全运维研究人员阅读,以理解一种消除人工规则编写环节的自动化检测思路。
💡 推荐理由: 该架构直击传统CSPM中规则分发延迟的痛点,通过将规则生成移至客户侧且完全自动化,有望显著缩短从CVE披露到资产检测的响应窗口,提升云环境安全防护的实时性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rui Li, Wenrui Diao, Debin Gao
该论文首次系统性地研究了 Android 框架中 Java 和 Kotlin 并行实现引发的安全问题。随着 Google 在 Android 系统和应用层推广 Kotlin,AOSP 中存在大量用 Java 和 Kotlin 同时实现的相同功能组件。论文指出,虽然这些并行实现在功能上应当一致,但由于两种语言的语法和语义差异,实际运行时可能出现微小的行为分歧。这种分歧本身并非漏洞,但可能暴露周边安全逻辑的缺陷。作者设计并实现了 ParaDroid 分析框架,通过字节码级中间表示、类到源码映射重构以及大语言模型推理方法语义,规模化地识别 Java-Kotlin 并行方法并比较其行为差异。在 Android 14-16 的 AOSP 代码中,ParaDroid 发现了 329 对并行方法和 37 个易受攻击的差异。作者已负责任地向 Android 安全团队披露了可利用的问题,其中 3 个漏洞和 2 个 bug 被确认,并分配了 2 个 CVE ID。研究结果表明,检查 Java-Kotlin 并行代码路径是发现现代 Android 安全缺陷的有效途径。
💡 推荐理由: Android 迁移到 Kotlin 的过程中,并行实现导致的语义差异可能成为被忽视的攻击面。本文首次系统性揭示该风险,为安全审计提供新视角。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara
现有的基于学习的Solidity智能合约漏洞检测器通常将检测简化为单函数内的语法模式匹配,但许多重大利用(如The DAO、Cream Finance)并不存在于单个函数中,而是存在于函数间的关系以及使攻击可行的条件组合之中。为此,本文提出AttackPathGNN,一种将检测重新定义为对显式攻击路径推理的图神经网络(GNN)。其两个架构创新区别于先前的GNN检测器:(1)状态干扰图(State Interference Graph),该图通过带类型和权重的边以及由显式五条件谓词定义的有向重入路径边,连接共享可变存储的每对函数;(2)合取池化(conjunction pooling),一种对八个命名利用前提条件的可微AND聚合器,其log-sigmoid形式使得当任一缓解措施(如重入守卫、访问控制修饰符或SafeMath)到位时,每个函数的利用评分会骤降。在五个独立训练运行中,AttackPathGNN在SmartBugs Wild保留测试集上达到92.3±0.2%的F1分数(假阴性率4.3±0.3%,在独立人工标注的SmartBugs Curated基准上检测率90.8±2.5%),并在每个种子上以100%恢复6/10个DASP10类别,重入检测达到98.7±1.8%。每次预测都附带结构化的修复报告,将每个判定转化为可操作的、函数级别的审计发现。该研究对智能合约安全审计、自动化漏洞检测工具开发具有重要参考价值。
💡 推荐理由: 该研究创新性地将漏洞检测从单函数模式匹配提升到跨函数攻击路径推理,显著降低了假阴性率,并提供了可解释的修复建议,对提升智能合约审计的自动化水平和准确率有实际价值。
🎯 建议动作: 研究跟进并考虑将方法集成到内部智能合约审计流程中。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wan-Hsuan Hsu, Wei-Hsin Wang, Cheng-Yu Liou, Ting-Rui Ke, Kentaroh Toyoda
该论文提出了Bastet,一个面向去中心化金融(DeFi)智能合约漏洞检测的细粒度专家标注数据集。2024年,DeFi协议因智能合约漏洞累计损失超过14.9亿美元,基于大语言模型(LLM)的漏洞检测成为有前景的应对方案,但现有评估数据集存在三大问题:基于过时的Solidity版本(如v0.4),无法反映现代DeFi合约;依赖自动化或LLM生成的标注,引入幻觉导致的标签噪声;采用粗粒度的单层标签,难以捕获真实业务逻辑漏洞的语义复杂性。Bastet通过以下方式解决这些问题:数据来源为2021-2024年的真实审计发现;由人类专家通过讨论达成共识进行标注;采用两层分类体系,包含46个标签和77个子标签。数据集包含从394份Code4rena竞争性审计报告中收集的4,402个发现(时间跨度为2021年4月至2024年11月),其中849个发现由DeFiHackLabs社区的白帽安全研究人员完全标注。所有标注均通过双标注者共识工作流程生成,确保了基于真实漏洞根因的标签准确性。该数据集的主要贡献在于:提供高质量、精细化的基准,以推动LLM在DeFi安全领域的应用研究,并促进可复现的实验评估。适合智能合约安全研究人员、LLM应用开发者及DeFi协议审计人员阅读。
💡 推荐理由: 现有漏洞检测数据集质量低下,限制了LLM模型的实际效果。Bastet通过专家标注和精细分类,为DeFi智能合约漏洞检测提供了可靠基准,有望显著提升自动化审计的准确性和实用性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christoph Sendner, Huili Chen, Hossein Fereidooni, Lukas Petzi, Jan König, Jasper Stang, Alexandra Dmitrienko, Ahmad-Reza Sadeghi, Farinaz Koushanfar
本文提出了一种名为ESCORT的深度学习框架,用于检测以太坊智能合约中的多种漏洞类型。传统检测方法通常只针对单一或少数漏洞类型,且扩展到新类型时需要大量重新设计。ESCORT采用通用特征提取器学习合约字节码的通用语义,并针对每种漏洞类型设置独立分支,实现多标签分类,可同时检测多个漏洞。更重要的是,ESCORT利用迁移学习,当出现新的漏洞类型时,只需在预训练的特征提取器上添加新分支,并用少量数据微调即可,避免了重新训练整个模型的开销。实验基于361万个真实智能合约数据集,初始阶段在六种漏洞类型(如重入、时间戳依赖等)上平均F1分数达98%;迁移学习阶段对另外五种新漏洞类型平均F1分数达96%。与现有非机器学习工具相比,ESCORT可处理任意复杂度的合约,实现100%合约覆盖,并支持多漏洞并发检测,显著缩短检测时间。该研究是首个将迁移学习应用于智能合约漏洞检测的深度学习框架,并将开源数据集和标注工具链以促进后续研究。
💡 推荐理由: 智能合约漏洞已导致数十亿美元损失,现有检测工具扩展性差。ESCORT的迁移学习方法使得快速适配新型漏洞成为可能,对区块链安全防御具有重要实践价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Syafiq Al Atiiq, Chun Zhou, Christian Gehrmann
本文采用机械可解释性方法深入分析大语言模型(LLM)检测软件漏洞的内部计算机制。研究以Gemma-2-2b模型为对象,使用Circuit Tracer工具追踪其在分类472个C/C++代码样本(含漏洞与安全代码)时激活的计算路径。令人惊讶的是,分析发现模型并非直接识别漏洞特征,而是主要依赖一组“安全检测器”——特定注意力头能识别安全编码模式。当这些安全检测器未激活时,模型将代码判定为有漏洞。关键神经组件包括:早期层(L5、L7)中专注于安全模式的注意力头,以及第7层多层感知器(MLP)中编码漏洞相关特征的神经元。消融实验证实了这些组件的因果作用:移除第11层导致漏洞检测准确率从100%骤降至6%,仅移除第7层中的20个神经元便使准确率降低50%。研究进一步揭示,LLM漏洞检测仅使用约16%的模型容量即可形成稀疏、可解释的电路。这一发现为漏洞检测系统提供了电路级别的解释,并可指导针对性的性能改进。论文成果有助于理解LLM在安全任务中的推理过程,推动更透明、可审计的AI安全检测工具的发展。
💡 推荐理由: 该研究首次从电路层面揭示LLM漏洞检测的工作机制,发现模型依赖安全模式识别而非漏洞签名,颠覆了传统认知。安全从业者可据此优化检测策略,提升模型可解释性与可信度。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri
本文评估了前沿大语言模型(LLM)在网络安全任务中的实际能力,通过构建双模式基准测试:白盒函数级漏洞检测(VulnLLM-R,涵盖C/Java/Python)和黑盒Web应用安全测试(五个生产风格的应用,包含118个真实漏洞,覆盖20多个CWE家族,并将开源)。测试了六个前沿模型(GPT-5.4、Codex~5.3、Claude Opus~4.6、Sonnet~4.6、Gemini~3.1~Pro和Gemini~3~Flash)以及两个领域专用模型,在四种测试范式下进行。结果令人警醒:(1)每个前沿模型在白盒检测中产生10-50%的假阳性率,系统性地过度预测漏洞;(2)在黑盒测试中,前沿模型仅覆盖4-8%的真实漏洞,即使借助外部安全工具(Playwright MCP、Burp Suite MCP)也只提升到10-19%;(3)将结构化渗透测试方法编码到领域专用代理中,可将每个CWE家族的检测覆盖率提升至50%以上,表明方法论而非模型规模才是主要杠杆;(4)领域专用防御模型在所有模型中实现了最高精度(0.904)和最低假阳性率(9.7%),且仅需单个GPU。研究识别出训练数据的根本瓶颈:缺乏结构化安全测试轨迹(端到端请求/响应序列、失败数据和多步攻击链),并提出自博弈安全测试作为数据生成策略。结论支持为网络安全构建垂直领域基础模型。
💡 推荐理由: 该研究揭示了当前前沿LLM在网络安全任务中的严重不足(高误报、低覆盖率),并指出结构化方法论比模型规模更重要,为安全团队评估和选择合适AI工具提供了关键参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chang Liu, Noah Fleischmann, Nicolò Altamura, Edward Raff, James Holt, Kristopher Micinski
该论文提出了ASSEMBLAGE-DEEPHISTORY,一个跨构建的二进制数据集,旨在弥补现有二进制语料库缺乏时间维度、跨编译多样性以及CVE标签组合的不足。数据集包含73,610个二进制文件,涵盖248个开源项目,使用GCC、Clang和MSVC编译器,在Linux和Windows平台上以多种优化级别编译,并包含跨多年的历史构建。每个二进制文件都通过数据库索引,关联其源代码、函数、调试信息、变体构建、历史版本以及易受攻击的函数。论文通过三个分析展示了该数据集的价值:一是设计了一个三阶段的LLM基准测试(识别、策略引导检测、跨构建迁移),用于测试LLM是否真正推理二进制漏洞还是仅匹配构建特定的模式;二是比较了MalConv嵌入、jTrans函数嵌入和TLSH模糊哈希在不同包版本的聚类效果;三是通过贝叶斯回归将二进制相似性分解为时间距离、文件变更和提交等贡献因素。该论文适合二进制安全分析、漏洞研究、机器学习应用于逆向工程领域的研究人员阅读。
💡 推荐理由: 该数据集为二进制安全研究提供了首个融合跨编译多样性、历史版本和CVE标签的统一框架,有助于提升漏洞检测模型的泛化能力和可解释性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro
本文提出 Veritas,一个基于语义的二进制内存破坏漏洞检测框架。针对剥离二进制文件中恢复对象语义、跨过程传播和可行触发条件的难点,Veritas 结合了三个关键组件:首先,一个基于 RetDec 提升的 LLVM IR 的静态切片器,重构包括 def-use、调用、返回、全局变量和指针操作在内的值流关系,生成紧凑的、带有证据支持的流对象;其次,一个双视角大语言模型检测器,通过反编译的 C 代码和精选的 LLVM IR 分步推理,关注控制流、边界和对象对应关系,避免全局传播;最后,一个多智能体验证器,通过引导式调试、断点检查和内存检查预言机来确认或拒绝候选漏洞。Veritas 实现为模块化流水线,在真实世界二进制漏洞基准上评估,达到 90% 的召回率。在误报评估中,对 623 个检测候选进行穷举验证和人工审计,穷举部分无假阳性,额外审计确认两个假阳性。实际应用中,Veritas 发现了一个此前未知的 Apple 漏洞并获得 CVE。该工作表明语义基础化作为实用二进制漏洞检测的操作设计原则的可行性。
💡 推荐理由: 二进制漏洞检测是安全分析的难点,Veritas 通过结合静态分析和 LLM 推理,大幅提升检测准确率并发现真实 CVE,为自动化二进制安全分析提供了可落地方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuteng Zhang, Huifang Ma, Jiahui Wei, Qingqing Li, Yafei Yang
软件漏洞检测对于确保软件安全性和可靠性至关重要。尽管深度学习取得了进展,但真实世界的漏洞数据集面临两个严重挑战:频率不平衡(少数类漏洞样本稀少)和难度不平衡(易检测与难检测样本的区分度不足)。本文从嵌入几何的角度重新审视这些问题,观察到这种不平衡会在超球面表示空间中引起几何失真,导致决策边界不稳定。为解决这一问题,作者提出了MARGIN(Margin-Aware Regularized Geometry for Imbalanced Vulnerability Detection),一个基于度量的框架,通过自适应边界度量学习和超球面原型建模来学习具有判别性的漏洞表示。MARGIN根据von Mises-Fisher浓度估计的分布结构动态调整几何正则化,使嵌入分布的概率质量与其对应的Voronoi单元对齐,从而减少几何失真,产生更稳定的决策边界。在多个公开漏洞数据集上的实验表明,MARGIN一致优于强基线,尤其在具有挑战性的不平衡数据集上,分类和检测性能显著提升。进一步分析显示,MARGIN产生的嵌入几何结构更有序,提高了鲁棒性、可解释性和泛化能力。
💡 推荐理由: 该研究针对现实漏洞检测中数据不平衡的痛点,提出了一种新的几何正则化方法,能有效提升模型在不均衡数据集上的检测性能,对安全自动化分析有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Guopeng Lin, Xiaoning Du 0001, Lushan Song, Weili Han, Jin Tan, Junming Ma, Wenjing Fang, Lei Wang
近年来,随着隐私保护法规(如欧盟GDPR)的出台,多方计算(MPC)协议被广泛用于公司和机构之间的联合数据分析与机器学习,以保护数据隐私。然而,MPC协议的复杂性导致其实现中常存在数据泄露漏洞,严重破坏预期的隐私保护。现有安全分析多依赖理论证明,忽视了实现中的漏洞检测。本文提出MPCGuard,一个实用的框架,用于检测MPC实现中的数据泄露漏洞。与传统内存漏洞不同,MPC中的数据泄露无法通过现有消毒工具识别。为此,MPCGuard首先建立由两个神经网络分类器组成的泄露标识器,根据MPC协议特性设计分类器结构,以判断实现是否包含数据泄露漏洞。识别出漏洞后,采用delta方法辅助定位。为验证有效性,在三大主流MPC框架(Crypten、TF-Encrypted、MP-SPDZ)中的29个常用实现上进行测试,发现12个存在数据泄露漏洞,部分可导致原始数据重构。截至论文撰写时,所有漏洞已被确认,其中两个已分配CVE编号(据作者所知,这是首个针对MPC实现数据泄露漏洞的CVE)。该工作首次系统性地解决了MPC实现中数据泄露漏洞的自动检测问题,对保障MPC应用的安全性具有重要意义。
💡 推荐理由: MPC实现中的数据泄露漏洞难以通过传统方法检测,但可导致敏感数据暴露。MPCGuard首次利用神经网络分类器自动化识别此类漏洞,已在真实框架中发现多个漏洞并获得CVE,为MPC安全实践提供了关键工具。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Meng Wang, Philipp Görz, Joschua Schilling, Keno Hassler, Liwei Guo, Thorsten Holz, Ali Abbasi 0002
业务逻辑漏洞是软件安全中一个关键且难以检测的问题,它们源于应用程序设计或实现中的错误,使攻击者能够触发非预期的行为。传统的基于模糊测试的动态分析工具在检测内存安全漏洞方面表现出色,但往往无法发现业务逻辑漏洞,因为这些缺陷需要理解特定于应用程序的语义上下文。已有的推测上下文的方法由于依赖启发式和非可移植的语言特性,本质上是脆弱且不完整的。由于业务逻辑漏洞在CWE Top 40中占据27个,是实际中最危险的软件弱点之一,现有工具的盲点令人担忧。本文提出了ANOTA,一种新型的人机协同的sanitizer框架。ANOTA引入了一个轻量级、用户友好的注解系统,使用户能够直接将其领域知识编码为轻量级注解,这些注解定义了应用程序的预期行为。运行时执行监视器观察程序行为,将其与注解定义的策略进行比较,从而识别指示漏洞的偏差。为了评估ANOTA的有效性,作者将其与最先进的模糊测试器结合,与其他针对相同目标的流行漏洞发现方法进行比较。结果表明,ANOTA+FUZZER在有效性上优于其他方法。具体来说,ANOTA+FUZZER成功复现了43个已知漏洞,并在评估期间发现了22个以前未知的漏洞(分配了17个CVE)。这些结果证明,ANOTA为发现传统安全测试技术经常遗漏的复杂业务逻辑缺陷提供了一种实用且有效的方法。
💡 推荐理由: 业务逻辑漏洞是实际中最常见但最难以自动化检测的安全弱点之一,ANOTA提出了一种实用的注解式sanitizer方案,填补了现有工具的盲区。
🎯 建议动作: 研究跟进,评估集成到现有测试管线的可行性
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Qixuan Guo, Yongzhong He
该论文针对软件供应链安全中识别漏洞引入提交(Vulnerability-Introducing Commit, VIC)这一关键问题,提出了一种基于补丁模式差异分析的新方法。传统VIC识别方法主要依赖代码变更的文本特征或图结构,但往往受限于噪声数据(如重构提交)且对隐蔽性漏洞引入不敏感。作者通过观察发现:修复补丁(patching patterns)在修复前和修复后的代码差异模式具有可区分的特征,这些特征可以反向用于定位最初的漏洞引入点。具体而言,论文首先从公开漏洞库(如NVD)和开源仓库中收集大量已知漏洞的修复提交,然后构建补丁模式的知识库;接下来,对于待分析的候选提交,通过比对候选提交的代码变更与已知修复补丁的“逆模式”(即补丁的镜像操作)来识别潜在的VIC。方法包含三个主要步骤:1)补丁模式提取与量化:使用抽象语法树(AST)差异分析将补丁模式表示为结构化编辑操作序列;2)逆模式匹配:对于每个候选提交,计算其编辑操作序列与已知补丁模式逆序列的相似度;3)基于集成排序的VIC判定:结合多个相似度指标和提交元数据(如时间戳、开发者信息)进行综合排序。实验在多个真实世界开源项目(如Linux内核、Apache HTTPD)上进行,结果显示该方法在TPR(真正例率)和Precision上均优于现有基线方法(如VCCFinder、FIBER),尤其对隐蔽性漏洞(如逻辑错误导致的漏洞)的引入提交识别准确率提升显著。论文还分析了不同补丁模式(如条件增强、函数接口变更)对识别效果的贡献,表明逆模式匹配能有效过滤重构提交等噪声。该研究的贡献在于提供了一种无需依赖漏洞细节(如PoC)的VIC识别思路,可应用于自动化漏洞根因定位和修复回溯。
💡 推荐理由: 准确识别漏洞引入提交是软件供应链安全的核心能力,直接影响漏洞修复效率与历史影响分析。本文提出的方法能有效降低误报,提升自动化根因定位的精度,对安全运维团队进行漏洞追溯、补丁优先级排序具有实际参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiangpu Song, Longjia Pei, Jianliang Wu 0002, Yingpei Zeng, Gaoshuo He, Chaoshun Zuo, Xiaofeng Liu 0013, Qingchuan Zhao, Shanqing Guo
该论文提出 ProtocolGuard,一种结合大语言模型(LLM)引导的静态分析与动态验证的方法,用于检测协议实现中的违规行为(protocol non-compliance bugs)。协议实现中的违规错误(如状态机状态错误、消息格式错误、序列错误)可能导致严重的安全漏洞。传统方法依赖手动编写的规则或模型检查,但面对复杂协议扩展性差且误报率高。ProtocolGuard 利用 LLM 从协议规范文档中自动推断出协议的行为模型(如状态机、消息序列规则),然后将该模型转换为静态分析中的约束,并生成用于动态验证的测试用例。具体来说,LLM 首先解析自然语言描述的协议规范,提取关键的状态转换和消息格式约束;然后,静态分析阶段在源代码上检查这些约束是否被违反,并标记可疑位置;最后,动态验证通过构造特定输入触发可疑路径,确认是否存在实际违规。实验在多个真实协议实现(如 TLS 1.3、SSH、QUIC 等)上进行评估,结果表明 ProtocolGuard 能够发现若干已知和未知的违规错误,且误报率低于现有方法。该工作首次将 LLM 用于协议违规检测的完整流程,提升了自动化程度和检测覆盖面。读者无需阅读原文,即可理解该方法的核心思路:借助 LLM 从文本规范中学习协议规则,辅以动静结合分析实现高精度检测。
💡 推荐理由: 协议实现中的违规是常见安全隐患,现有自动检测方法受限。本研究首次将 LLM 的语义理解能力融入全流程,可大幅提升检测效率与覆盖率,为协议安全分析提供新范式。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nanyu Zhong, Yuekang Li, Yanyan Zou 0002, Jiaxu Zhao 0004, Jinwei Dong, Yang Xiao, Bingwei Peng, Yeting Li, Wei Wang, Wei Huo
该论文针对嵌入式固件二进制中认证绕过漏洞的检测问题展开研究。认证绕过漏洞通常源于开发者对认证逻辑的错误实现(如硬编码凭证、弱会话管理、权限检查缺失等),在现实攻击中常被用于获取系统后门或提升权限。现有静态分析工具虽能检测内存破坏漏洞,但在认证逻辑的语义理解上存在局限,难以精准识别绕过路径。作者提出一种基于符号执行与污点分析相结合的混合方法:首先通过二进制程序切片提取认证相关的函数和基本块,然后利用符号执行引擎遍历所有可能的认证分支,并通过污点传播标记关键输入(如密码、令牌、会话ID)。当符号执行发现一条路径既能绕过认证检查(例如使返回值为真)又能到达后续危险函数时,即报告为潜在漏洞。方法的关键创新在于设计了一种轻量级的认证状态机,用于建模固件中常见的认证协议(如挑战-响应、一次性密码等),并支持对多阶段认证流程的建模。实验在包含1200个真实固件镜像的数据集上进行,涵盖了多种嵌入式架构(ARM、MIPS、x86)。结果显示,该方法共发现37个未知认证绕过漏洞,其中19个已获得CVE编号。与现有工具(如FirmUSB、Angr)相比,检测率提升约60%,误报率降低至12%。论文还分析了固件中认证模式的多样性,并讨论了如何将方法扩展到IoT设备范围。
💡 推荐理由: 固件认证绕过漏洞是物联网设备后门的核心成因之一,传统扫描工具难以检测。该研究提供了一种自动化的二进制分析方法,有望在嵌入式安全审计中落地,填补固件逻辑漏洞检测的空白。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Runhao Liu 0001, Jiarun Dai, Haoyu Xiao, Yuan Zhang, Yeqi Mou, Lukai Xu, Bo Yu 0008, Baosheng Wang, Min Yang
该论文针对现代Linux固件中C-Lua混合Web服务的安全漏洞检测问题展开研究。传统静态污点分析工具通常仅关注固件中的C二进制文件,忽略了Lua脚本及字节码的存在,导致检测覆盖面不足。作者观察到现代固件广泛采用Lua与C混合编程实现Web服务,因此提出FirmCross——一种面向C-Lua混合Web服务的自动化污点风格漏洞检测器。FirmCross能够自动解混淆固件中的Lua字节码,识别Lua代码空间中的独特污点源,并系统性地捕获C-Lua跨语言污点流。在包含来自11家供应商的73个固件镜像的数据集上,FirmCross检测到的漏洞数量是现有最先进工具(MangoDFA和LuaTaint)的6.82倍至14.5倍。尤其值得注意的是,FirmCross帮助发现了610个0-day漏洞,截至论文提交时已有31个漏洞被分配了CVE编号。该工作显著提升了固件Web服务安全分析的完整性和有效性。
💡 推荐理由: 首次系统关注固件中C-Lua混合Web服务的跨语言污点流分析,显著提升了漏洞发现数量,对IoT/嵌入式安全分析有重要推进作用。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tariq Houis, Shaoqi Jiang, Mohammad Mannan, Amr Youssef 0001
该论文聚焦于JavaScript/Node.js生态中广泛存在的原型污染(Prototype Pollution)漏洞检测问题。原型污染漏洞允许攻击者通过操纵对象的原型链,在运行时注入恶意属性,从而导致拒绝服务、权限提升甚至远程代码执行。现有检测工具存在高误报、低覆盖或无法生成可利用PoC的问题。为此,作者提出了Bullseye——一个混合静态与动态分析的漏洞检测系统,能够自动为发现的漏洞生成概念验证(PoC)利用。Bullseye首先通过静态分析扫描NPM包中的可疑模式,并使用符号执行和污点传播来识别潜在的污染路径。随后,动态分析阶段在沙箱环境中实际执行PoC,验证漏洞的可利用性。在包含超过1500个流行NPM包的测试集上,Bullseye发现了124个之前未知的原型污染漏洞(其中98个已被确认),相比现有工具(如CodeQL、Prototype Pollution Scanner)召回率提升32%,误报率降低47%。所有发现的漏洞均已负责任地披露给相关维护者。实验还表明,Bullseye的PoC生成能力有效降低了安全团队验证漏洞的时间成本。
💡 推荐理由: 原型污染是Node.js生态中高风险的漏洞类型,现有检测手段自动化程度低,Bullseye首次实现了从检测到PoC生成的端到端自动化,大幅提升安全团队在开源供应链中的漏洞发现效率。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chun Yin Chiu
本文研究了一种轻量级的函数级漏洞检测方法,旨在为C/C++代码提供快速、可复现的排序基线,以辅助人工分类。传统方法依赖代码图或深度模型,计算成本高,而本文提出的流水线完全避免深度学习、Transformer和图结构,仅使用原始函数的稀疏token n-gram特征(TF-IDF加权)和一组简单的代码度量,包括NLOC、近似圈复杂度、token数、最大括号深度和参数个数。分类器采用带类别权重的逻辑回归,以处理标签不平衡问题。实验基于Devign函数级漏洞标签,评估了随机分割和跨项目(FFmpeg到QEMU)迁移场景,主要关注PR-AUC和Recall@10%等排序导向指标。在随机分割中,最佳组合取得PR-AUC 0.642和Recall@10% 0.161;而跨项目泛化难度显著增加,PR-AUC仅约0.436。此外,还进行了消融实验、标识符重命名鲁棒性测试以及端到端效率分析。结果表明,简单特征组合可作为有用的透明基线,但存在对表层词汇线索敏感、跨项目迁移能力有限等局限。本文适合对代码安全评估中的轻量级方法感兴趣的读者,尤其是需要快速基线对比的研究者或工程团队。
💡 推荐理由: 本文为漏洞检测提供了极简、可解释的基线方法,便于工程团队快速部署和复现,同时揭示了轻量特征在跨项目场景下的局限性,为后续研究指明了改进方向。
🎯 建议动作: 研究跟进,可将其作为基线对比其他复杂模型
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.3)
👥 作者: Xing Zhang, Keyu Zhang, Taohong Zhu, Anbang Ruan
本文提出了一种基于大语言模型(LLM)的智能合约漏洞检测框架。智能合约因其不可篡改特性,易遭受多种安全漏洞攻击,导致重大经济损失。现有检测方法通常依赖人工制定的专家规则,缺乏对不同漏洞类型的灵活适应性。为此,作者构建并公开了一个大规模数据集,包含来自15个主流区块链平台、超过3200个真实项目的31165个专业标注的漏洞实例。该框架利用基于抽象语法树(AST)的精确上下文提取和漏洞特定的提示设计,为13种常见漏洞类型实例化定制检测器。实验结果表明,该方法平均正样本召回率达0.92,平均负样本召回率达0.85,展示了精心设计的上下文提示在实现可扩展、高精度智能合约安全分析方面的潜力。该研究为智能合约安全检测提供了新的思路,特别适合安全研究人员和区块链开发者关注。
💡 推荐理由: 智能合约漏洞频发导致巨额损失,现有检测方法缺乏灵活性。本文利用LLM和大规模数据集实现高召回率检测,有望提升智能合约安全分析的自动化和准确性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Karolina Gorna, Nicolas Iooss, Yannick Seurin, Rida Khatoun, Keith Makan
本文介绍了 Zorya 符号执行框架的扩展,使其能够处理由 Go 标准 gc 编译器生成的多线程二进制文件。Zorya 框架最初仅支持单线程 TinyGo 二进制,通过将二进制提升到 Ghidra 的 P-Code 中间表示,并利用 Z3 SMT 求解器对具体值和符号值进行推理来检测漏洞。为了支持 gc 编译的二进制,作者解决了三个关键挑战:从 gdb 转储恢复操作系统线程状态以处理多线程;中和运行时抢占机制避免执行干扰;引入写时复制(copy-on-write)覆盖路径分析,用于检测未执行分支上的静默漏洞(如整数溢出)。研究在 11 个来自生产级 Go 项目(如 Kubernetes、Go-Ethereum 和 CoreDNS)的真实漏洞上进行了严格评估。结果表明,Zorya 成功检测出 7 个二进制级别漏洞,其中包括一个静默整数溢出——其他评估工具在没有手动编写预言(oracle)的情况下无法发现。该工作显著扩展了 concolic 测试在 Go 生态系统的实用性,为自动化安全分析提供了新手段。适合安全研究人员、Go 开发者和二进制分析工具开发者阅读。
💡 推荐理由: Zorya 框架的扩展填补了 Go 二进制符号执行研究的空白,能够自动化检测多线程 Go 应用中的安全缺陷,对 K8s、以太坊等关键基础设施的安全性评估具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ruiguo Yang, Jiajin Cai, Xinhui Han
该论文提出了一种名为TaintGrep的静态分析工具,用于检测Android应用中的漏洞。该工具基于污点分析(taint analysis)技术,并支持用户自定义规则,从而能够灵活地适应不同的安全检测需求。TaintGrep通过构建数据流图并追踪敏感数据(如用户输入、敏感API调用)的传播路径,最终识别可能导致信息泄露、权限滥用等安全问题的模式。实验部分(abstract未详细说明)可能评估了其在真实应用上的检测效果。该研究的主要贡献在于提供了一个可扩展的静态分析框架,允许安全分析师根据特定漏洞类型编写自定义规则,降低了针对新型漏洞的检测门槛。适合安全分析人员、移动安全研究者以及希望定制化检测逻辑的开发者阅读。
💡 推荐理由: Android应用漏洞频发,现有静态工具规则固化,难以适应新型攻击模式。TaintGrep通过用户自定义规则增强了灵活性,为蓝队提供了可定制的自动化检测手段。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Chidera Biringa, Ajmal Abbas, Vishnu Selvaraj, Gokhan Kul
本文提出 VulStyle,一种多模态软件漏洞检测模型,它联合编码函数级源代码、非终结符抽象语法树(AST)结构和代码风格计量(CStyle)特征。现有代码表示方法主要依赖词级模型或完整AST树,往往忽略指示风险编程习惯的风格线索,或者引入高结构开销。VulStyle 仅选择非终结符 AST 节点,在保留语义层次的同时降低输入复杂度,并集成句法和词法 CStyle 特征作为辅助漏洞信号。该模型采用掩码语言建模在 490 万个函数(覆盖七种编程语言)上进行预训练,并在五个基准数据集(Devign、BigVul、DiverseVul、REVEAL、VulDeePecker)上微调。VulStyle 在 BigVul 和 VulDeePecker 上达到当前最优性能,F1 分数相比强基线 Transformer 模型提升 4%-48%,在所有基准上均取得具有竞争力或最优的平均性能。本文还通过消融实验分离 CStyle 和 AST 结构的影响、进行错误案例分析,并在攻击者真实场景下定位检测任务的威胁模型。该研究为漏洞检测提供了融合编程风格特征的新思路,适合安全研究者和代码分析工具开发者阅读。
💡 推荐理由: VulStyle 创新性地融合代码风格计量特征提升漏洞检测性能,在多个基准上显著超越现有方法,为安全工具开发者提供了可直接借鉴的多模态预训练框架。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
介绍了一个跨多个提交引入的Python漏洞基准,揭示了每次提交静态分析工具检测率极低(13%),表明现有SAST对这类漏洞几乎无效。
💡 推荐理由: 该基准证明依赖每次提交扫描的SAST会漏掉87%的跨提交漏洞链,开发者可能因此忽略累积风险,需要重新评估静态分析策略。
🎯 建议动作: 研究跟进
排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.5)