#fuzzing

共收录 121 条相关安全情报。

← 返回所有主题
👥 作者: Juanen Li, Peng Qian, Guanyan Li, Rui Wang, Peixin Wang, Zhiqing Tang, Fuchen Ma, Yuanliang Chen, Lun Zhang

本文提出 EchoFuzz,一个由大语言模型(LLM)引导的智能合约模糊测试框架,旨在解决现有智能合约模糊测试中的两大瓶颈。背景方面:智能合约作为去中心化应用的基石,自主管理着规模达万亿美元级别的数字资产,因而成为攻击者的高价值目标,漏洞检测需求迫切。问题一:现有方法在处理合约状态转换时存在逻辑鸿沟与组合冗余,难以在漏洞检测效率与状态空间探索成本之间取得有效折中,导致关键执行路径被遗漏。问题二:基于规则的序列变异策略存在路径冗余、缺乏合约逻辑引导等缺陷,形成性能瓶颈,使探索难以深入到面向深层漏洞的路径。方法上,作者引入“易受攻击函数调用序列”(VFCS,Vulnerable Function Call Sequences)这一概念——即最小化的、保持行为语义的执行路径,通过关键状态转换暴露缺陷。EchoFuzz 包含两个关键流程:其一为链式引导的 LLM 方法,将静态分析与逻辑理解相结合,为特定合约生成 VFCS 候选,从而消除组合冗余;其二为迭代式模糊测试策略,利用 LLM 结合实时反馈,自适应地将模糊器导向尚未覆盖的分支。实验结果表明,EchoFuzz 优于当前最先进的方法,分支覆盖率提升 29%,检测到的漏洞数量增加 62%;同时在真实合约中发现了 37 个此前未知的漏洞,显示出较强的实用价值。适合智能合约安全研究者、审计工具开发者以及关注 LLM 赋能程序分析方向的工程师阅读。摘要未声明该成果已被在野利用或武器化。

💡 推荐理由: 智能合约承载巨额资产,漏洞一旦被利用损失不可逆。该工作显示 LLM 可有效缓解模糊测试中状态空间爆炸与变异引导不足的问题,为合约审计工具的能力升级提供了可借鉴的技术路线。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zirui Liu, Mengfan Xu, Juan Zhai, Shiqing Ma, Barry Nelson

变异模糊测试(mutation-based fuzzing)是软件安全中广泛使用的漏洞发现技术,但由于其随机性,对它的结果进行严格评估和复现存在困难。现有工作通常通过经验性测量来刻画这种随机性,但缺乏理论上的收敛性与样本复杂度保证,导致评估不可靠。该论文针对上述两个问题进行了深入研究。第一,提出一种鲁棒性评估方法:运行多次独立的模糊测试活动(campaign),在考虑计算量(测试长度)差异后,度量bug触发率的变异情况。作者从理论上证明了,在M次长度为T的独立测试中,有限试验(即M有限)导致的误差以标准M^-1/2速率衰减;而有限测试长度(T有限)引入的误差,在bug触发时间相关性逐阶衰减时具有有界性。这一理论结果首次为模糊测试的统计评估提供了可计算的收敛保障和样本复杂度指导。第二,提出一种名为“splitting”(分裂)的黑盒增强技术:当模糊器触发一个bug时,复制其当前队列状态,并让多个分支从该状态继续运行,从而将更多计算资源导向已发现的薄弱区域。作者证明,无论分裂树具体如何实现,任何分支路径相比单一连续路径都不会减少触发bug事件的原始数量;而且,当那些被更多分支访问的状态在未来更容易触发更多bug时,预期检测效率会获得提升。在一个简化模型中,当模糊器花费在bug区域的时间比例p小于sqrt(2)-1时,splitting能够降低单位计算量的方差。实验部分,作者在Magma基准的40个地真值(ground-truth)单元上进行验证,在计算量匹配的前提下,splitting在38个单元中比基线在相同CPU时间内找到更多真实bug(中位数提升52%,其中38个中34个具有统计显著性),且从未发现少于基线的不同bug。特别地,它使CVE-2019-19926从未被检测(0/20次独立试验)变为稳定检测(20/20次,Fisher精确检验p<10^-4),另有6项检测改进涉及相关CVE。在FuzzBench基准上,splitting在70个对比组中的53个中找到更多独特bug,并在66/70个组中降低了跨campaign的结果变异,中位数变异降低约10倍。所有分裂分支均计入相同计算预算,总开销仅约0.14%。因此,该工作为模糊测试的可信评估与实用增强提供了一套完整的理论与工程方案。

💡 推荐理由: 模糊测试是漏洞发现的关键技术,但其随机性常使结果难以复现和度量。该研究提供了可量化的评估方法和一种近乎零成本的技术改进,帮助安全团队更可靠、高效地发现漏洞,增强内建安全测试的可信度与产出。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Matheus E. Garbelini, Vaibhav Bedi, Sudipta Chattopadhyay 0001, Sumei Sun, Ernest Kurniawan

BrakTooth是新加坡科技设计大学等机构的研究者针对蓝牙经典(BR/EDR)协议栈中Link Manager(LM)层开发的一种定向模糊测试框架。蓝牙无线协议应用广泛,但底层协议栈常由厂商自行实现,复杂度高,导致安全测试覆盖严重不足,尤其是设备固件中的低层处理逻辑。传统模糊测试方法难以触及深层协议状态,且难以同步精准的时序控制。该研究首先通过逆向分析多款主流蓝牙芯片的LM状态机,建立协议状态模型,并利用以软件无线电(SDR)为核心的发射装置,在精确控制时序的同时,生成大量符合蓝牙规范但内容非法的LMP数据报文,从而定向探测目标设备固件中可能存在的内存越界、空指针解引用、逻辑错误等缺陷。该框架在真实硬件上发现了超过20个零日漏洞,涉及多款常见蓝牙SoC和模块,涵盖智能音箱、智能手机、笔记本电脑等各类设备。这些漏洞可导致被攻击设备死机、蓝牙协议栈崩溃,甚至在部分设备上可触发可控的远程代码执行。研究团队将相关漏洞通报给多家CERT和厂商,并协助完成修补工作。其主要贡献在于:提出了一个面向复杂协议栈、可扩展的定向模糊测试方法论;证明了Link Manager层是蓝牙攻击面的薄弱环节;并构建了可复现的实验验证体系。该研究不仅披露了大量实际漏洞,更重要的是向工业界展示了通过系统化协议状态感知、消息校验和定向变异,能够高效挖掘出蓝牙基带及固件中的深层安全缺陷。对于硬件安全、无线协议安全的研究人员,以及蓝牙芯片厂商的固件与IC设计工程师而言,该论文具有重要的参考价值。

💡 推荐理由: 蓝牙协议栈底层实现长期缺乏系统性安全测试,BrakTooth以可复现的方式证明了定向模糊测试能发现大量堆栈损坏与逻辑漏洞,提醒安全团队关注终端设备的蓝牙固件更新与隔离措施。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
INFO
PAPER 2026-09-06

Regression Greybox Fuzzing.

推荐 11.5
Conf: 50%
👥 作者: Xiaogang Zhu 0001, Marcel Böhme

该论文基于对 OSSFuzz 平台生成的所有模糊测试(fuzzing)漏洞报告的实证研究,发现约 77%(23k 个漏洞中的 4/5)是由最近的代码变更引入的回归缺陷(regression bugs)。新项目在初始阶段每天会出现 2-3 个新漏洞报告,但清除存量缺陷后,每周仍有 3-4 个报告,这一恒定速率只能由不断上升的回归引入率来解释——首个漏洞是回归的概率为 20%,而在数百个报告后升至 92%。为此,作者提出回归灰盒模糊测试(Regression Greybox Fuzzing, RGF),将模糊测试资源优先分配给更近期或更频繁变更的代码。由于对每个提交单独进行充分模糊测试不现实,RGF 同时对所有提交进行模糊测试,但赋予出现在更多(更近)提交中的代码更高优先级。论文还观察到大多数代码从未被修改且相对陈旧,因此设计了增强代码兴趣信号的方法,并将能量调度(power schedule)概念扩展到种子的字节级别,利用蚁群优化(Ant Colony Optimization)为更有可能生成有趣输入的字节分配更多能量。作者在 Fuzzbench 平台上进行了大规模可复现实验,涉及 3 个以上 CPU 年的模糊测试运行,并在 OSSFuzz 上的 15 个开源 C 程序中发现了 20 个缺陷,验证了假设与 RGF 的有效性。适合软件安全研究人员、模糊测试工具开发者及负责持续集成/持续交付(CI/CD)的安全工程团队阅读。

💡 推荐理由: 该研究量化了回归缺陷在真实模糊测试中的主导地位,为蓝队将模糊测试资源聚焦于近期代码改动提供了数据支撑和实用方法,可直接指导 CI/CD 中的安全测试投入。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chenlin Wang, Wei Meng 0001

本文针对Web应用程序漏洞修复过程中存在的关键挑战:漏洞定位困难、修复补丁可能引入新问题或修复不完整等。作者提出了一种结合上下文感知的故障定位(Context-Aware Fault Localization)与定向差异模糊测试(Directed Differential Fuzzing)的自动化漏洞修复方法。核心思想是:首先利用上下文信息(如函数调用关系、数据流、控制流以及相关变量定义和使用位置)来精准定位产生漏洞的缺陷代码位置,避免传统方法依赖粗粒度启发式或人工分析的低效与误报。随后,在修复建议生成阶段,采用定向差异模糊测试技术,将原始存在漏洞的程序与候选修复后的程序进行行为差异比较,以验证修复是否真正消除了漏洞,同时确保没有破坏原有功能。该方法旨在提高漏洞修复的准确性与自动化程度,减少人工介入。从标题推断,论文可能通过真实世界Web漏洞案例或基准测试集验证了所提方法的有效性,展示了故障定位的精确性和修复后程序的正确性。适合软件安全、漏洞挖掘与自动化修复方向的研究人员、安全工具开发者及Web应用维护者阅读。需要注意的是,当前仅依据论文标题生成摘要,具体实验细节、数据集和结果需查阅原文进一步确认。

💡 推荐理由: 针对Web漏洞修复自动化这一长期难点,提出结合上下文定位与差异模糊测试的集成方案,有望提升修复准确率与效率,对安全运营中漏洞闭环管理具有实践参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianqiang Wang, Yi Xiang, Meng Wang 0071, Qinying Wang, Ali Abbasi 0002, Thorsten Holz

本文提出 SmuFuzz,一个面向闭源厂商固件中 System Management Mode (SMM) 应用的模糊测试框架,旨在解决现有 SMM 模糊测试缺少完整 UEFI 运行时环境的问题。在 UEFI 标准下,x86 处理器上的 SMM 用于处理关键硬件事件,运行于 Ring -2 特权级,对系统资源拥有近乎无限的访问权限;然而厂商普遍使用内存不安全的语言开发 SMM 应用,导致其容易受到内存破坏漏洞影响并成为攻击者的高价值目标。现有 SMM 模糊测试方法由于没有完整 UEFI 运行时来支撑 SMM 应用的准备、初始化和收尾,应用数据常常未被正确初始化,一旦模糊测试访问未初始化数据,就会引发提前退出或非预期崩溃,导致只能探索到浅层代码并产生大量误报。SmuFuzz 通过部分重托管 SMM 应用,在一个提供完整 UEFI 运行时的定制基础设施上运行,自动补齐依赖与运行时,使目标应用能够正确初始化和正常执行;同时,SmuFuzz 自动推断复杂 SMM 应用的输入语义以实现深度探索。实验表明,与最先进的模糊器相比,SmuFuzz 的唯一基本块覆盖率达到 4.45 倍,同时发现更多漏洞并显著降低了误报率。利用 SmuFuzz,作者在多家主要厂商的固件中识别出 38 个新漏洞,并均已负责任地披露。该工作对 UEFI 固件安全研究、蓝队固件漏洞评估以及 SMM 模糊测试工具选型具有重要参考价值,适合固件安全研究员、漏洞挖掘工程师及固件供应链安全审计人员阅读。

💡 推荐理由: SMM 漏洞影响固件信任根级别,现有模糊测试因缺少完整 UEFI 运行时而效果欠佳。SmuFuzz 通过部分重托管和运行时仿真显著提高覆盖率并降低误报,为固件漏洞挖掘提供了更可靠的手段,有助于蓝队提前发现上游固件风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: Jiarun Dai, Yuan Zhang 0009, Hailong Xu, Haiming Lyu, Zicheng Wu, Xinyu Xing 0001, Min Yang 0002

该论文针对漏洞报告中软件受影响版本信息不完整的问题展开研究。作者指出,即使是由 MITRE/NIST 归档的漏洞报告,也常常缺少某些易受攻击的软件版本信息,导致使用这些未报告版本的用户面临风险。为此,他们提出了一种基于模糊测试(fuzzing)的方法来辅助漏洞评估。该方法首先在软件的参考版本上收集崩溃执行轨迹,然后利用该轨迹指导对 PoC(Proof-of-Concept)输入进行变异,使得目标版本能够沿着与参考版本相似的执行轨迹运行,从而增加目标版本触发漏洞的可能性,证明该漏洞在目标版本上存在。作者将该思想实现为自动化工具 VulScope。通过使用 30 个真实世界 CVE 对 470 个软件版本进行实验,VulScope 在将 PoC 从一个版本迁移到另一个版本时,实现了零误报,漏报率仅为 7.9%。此外,作者还将该方法与 AFL 和 AFLGO 两种代表性模糊测试工具进行了比较,发现在 PoC 迁移任务中 VulScope 优于这两种现有技术。最后,利用 VulScope,他们发现了 330 个被 MITRE/NIST 漏报为易受攻击的软件版本。该研究的主要贡献在于自动化了 PoC 跨版本迁移过程,帮助安全分析人员识别官方漏洞库中遗漏的受影响版本,从而更全面地评估漏洞影响范围。适合漏洞管理、安全运维和软件供应链安全领域的从业者阅读。

💡 推荐理由: 该研究揭示官方漏洞库(MITRE/NIST)版本覆盖不全的现实风险,并提供自动化工具辅助识别漏报版本,有助于蓝队完善资产漏洞排查,堵塞因信息缺失导致的安全盲区。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Alexander Bulekov, Bandan Das, Stefan Hajnoczi, Manuel Egele

Morphuzz 是一篇关于虚拟设备模糊测试的学术论文。研究背景是:QEMU 等模拟器中的虚拟设备(如网卡、磁盘控制器等)直接处理来自客户机的 I/O 请求,攻击面大,一旦存在漏洞可能被恶意客户机利用来逃逸到宿主机。传统模糊测试在构造针对虚拟设备的输入时面临严重困难,因为这类输入需要满足复杂的语义与内部状态约束,例如描述符表、DMA 缓冲区的布局、设备寄存器状态等,直接随机变异字节难以到达深层代码路径。论文提出的核心方法名为 Morphuzz,其基本思想是“弯曲输入空间”(Bending Input Space):不是像传统模糊器那样只对输入字节做变异,而是维护并调整生成输入时所需的“空间”或“结构上下文”,使生成的测试用例能够满足虚拟设备对内存布局和状态机的隐含要求。具体而言,Morphuzz 通过对虚拟设备的状态和内存映射进行建模,在模糊测试循环中动态改写输入数据的地址偏移、长度等元信息,从而引导执行流更深入。论文的主要贡献包括:设计了一种能感知虚拟设备内部结构的输入空间变换机制;实现了原型系统并针对 QEMU 中的若干网卡/存储设备进行了实验;结果表明与现有方案相比,Morphuzz 能显著提高代码覆盖率并发现新的崩溃或错误行为。适合读者:从事系统安全、漏洞挖掘、虚拟化安全研究的工程师和学者,尤其是关注 QEMU/虚拟设备模糊测试的蓝队研究人员。

💡 推荐理由: 虚拟设备逃逸是云安全关键风险,Morphuzz 针对此类目标的模糊测试方法可辅助发现 QEMU 等模拟器中的深层漏洞,帮助防御方在攻击者利用前修补。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingquan Zhao, Zan Wang, Junjie Chen 0003, Ruifeng Fu, Yanzhou Lu, Tianchang Gao, Haojie Ye

这篇论文关注 Java 虚拟机(JVM)的测试方法。JVM 是运行 Java 程序的核心基础设施,其可靠性直接影响大量应用的稳定与安全,因此对 JVM 进行严格测试非常重要。现有 JVM 测试技术中,基于合成(synthesis)的方法被认为是最先进的:它从历史可触发 bug 的测试程序中提取各类“程序成分”(program ingredients),再将这些成分合成为一个新的测试程序,以触发新的缺陷。然而,现有方法直接使用与历史 bug 紧密绑定的原始程序成分,这导致两个问题:一是测试范围受限,难以覆盖更多 JVM 功能;二是生成的测试程序多样性不足,降低发现新 bug 的效率。针对这一局限,论文提出了一种“程序成分抽象与实例化”(Program Ingredients Abstraction and Instantiation)方法。核心思路是:不是直接复制历史 bug 中的具体成分,而是先对程序成分进行抽象,提炼其结构特征和通用模式,然后在不同上下文或变异条件下对抽象后的模板进行实例化,从而生成更具多样性和探索性的测试程序。该方法的预期贡献包括:扩大 JVM 测试中对不同指令、类型、执行路径等特性的覆盖范围;提升合成测试程序的可变性,增加触发未知缺陷的概率;为合成式 JVM 测试建立新的成分表示与生成框架。论文主要面向从事编译器/解释器测试、软件可靠性验证和漏洞挖掘的研究人员,以及 JVM 实现方(如 OpenJDK 社区)的质量保障团队。由于本文是 arXiv 上的研究摘要,未提供实验验证的细节,因此其效果评估需以完整论文为准。

💡 推荐理由: JVM 是 Java 生态的基石,测试质量直接关系到大量应用的稳定与安全。该方法通过抽象-实例化扩展测试程序多样性,可能提升发现 JVM 深层缺陷的效率,对蓝队评估运行时环境安全性有参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.6
Conf: 50%
👥 作者: Haoran Xu, Zhiyuan Jiang, Yongjun Wang, Shuhui Fan, Shenglin Xu, Peidai Xie, Shaojing Fu, Mathias Payer

该论文针对 JavaScript 引擎模糊测试中的突变质量瓶颈,提出了一种基于图结构中间表示(Graph-based IR)的新方法。当前主流 JS 引擎模糊测试工具通常使用抽象语法树(AST)或定制的字节码级中间语言来表示程序,但这些表示在生成语义有效且富有意义的突变时存在局限,导致难以深入发现引擎内部缺陷。论文的核心贡献在于设计一种图结构 IR,将程序的控制流、数据依赖和类型信息显式建模为图,从而扩展突变空间并指导更智能的突变操作。基于该 IR,作者实现了新的模糊测试框架,能够生成更符合语义约束的测试用例,减少无效输入,提高代码覆盖率和缺陷触发概率。实验在多个主流 JS 引擎(如 V8、JavaScriptCore 等)上验证,结果表明该方法的漏洞发现能力和覆盖率优于现有基于 AST 和自定义 IR 的模糊器。该研究为 JS 引擎安全测试提供了新思路,尤其适用于需要深度类型推理和复杂对象操作的场景。适合浏览器引擎开发者、安全研究员及模糊测试工具设计者阅读。

💡 推荐理由: JavaScript 引擎是现代浏览器和运行时安全的核心,模糊测试是发现其漏洞的主要手段。该研究通过改进程序表示,直接提升突变质量,有助于发现更隐蔽的引擎缺陷,对蓝队提升 Web 端安全防御能力具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 8.6
Conf: 50%
👥 作者: Qinying Wang, Florian Hofhammer, Eduard Vlad, Jianqiang Wang, Marcel Busch, Shouling Ji, Mathias Payer

该论文针对固件重宿主(firmware rehosting)技术在测试嵌入式协议栈时难以到达深层应用状态的问题展开研究。作者指出现有重宿主方法通常采用被动近似的外设行为建模,忽视了三方面关键因素:(i) 中断、MMIO 与 DMA 之间的协同调度关系;(ii) 外设内部隐含的状态转换;(iii) 多个外设之间的交互影响。为了克服这些局限,论文提出了反应式外设建模(Reactive Peripheral Modeling, RPM)抽象,将硬件外设建模为具有反应性和状态机的系统,采用事件-条件-动作(ECA)语义捕获外设行为,从而忠实刻画中断、MMIO、DMA 调度、隐式状态转换以及跨外设交互。作者在 Bluezz 系统中实现了 RPM,并针对 BLE 固件重宿主与模糊测试进行验证,在 NimBLE、Zephyr 及 Nordic SoftDevice(闭源商业栈)等代表性 BLE 协议栈上开展实验。结果表明,在 18 个测试目标上,Bluezz 的平均基本块覆盖率是之前最先进重宿主方法(state-of-the-art)的 2.6 倍以上;与既有方法大多局限于广播与扫描逻辑不同,Bluezz 能够可靠地进入已连接(connected)BLE 状态,并发现了 5 个仅在连接建立后才显现的未知漏洞。此外,作者证明 RPM 方法可泛化到运行于不同 MCU 的其他嵌入式固件。该工作的核心贡献在于提出反应式外设建模这一抽象,系统性解决了重宿主中对外设语义建模不完善的问题,提升了固件测试的深度与效率。适合固件安全研究人员、嵌入式系统测试工程师及相关方向学者阅读。

💡 推荐理由: 该研究突破了现有固件重宿主技术只能覆盖早期初始化状态、难以测试深层协议逻辑的瓶颈,通过更忠实的外设建模显著提升代码覆盖率和漏洞发现能力,为嵌入式/BLE 固件安全测试提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Stefan Nagy, Anh Nguyen-Tuong, Jason D. Hiser, Jack W. Davidson, Matthew Hicks

这篇论文针对二进制程序模糊测试(binary-only fuzzing)中的覆盖率反馈质量不佳问题,提出了一种新的编译器级插桩方法,命名为“Breaking Through Binaries”(简称BTB)。传统上,对于没有源代码的二进制程序,模糊测试工具往往依赖动态二进制插桩(DBI)或静态重写来获取覆盖率信息,但这类方法通常带来显著性能开销,且难以捕获编译器优化后的复杂语义(如函数内联、控制流合并等),导致生成的覆盖率反馈不够精确,限制了漏洞发现能力。本文的核心创新在于利用编译器前端的高级中间表示(IR)来解析二进制文件,并重新生成高质量、语义丰富的插桩代码,在保持二进制兼容性的同时,实现接近源码级插桩的覆盖率精度。具体地,作者设计了一个编译器级二进制的插桩框架,能够从二进制中恢复结构信息,并插入针对基本块、边及关键指令(如比较、跳转)的探针,这些探针经过编译器的优化调度,极大减少了运行时开销。实验部分使用了多个真实世界的开源项目(如libpng, libtiff, jq等)以及不同架构(x86-64和ARM64)的二进制,对比了最先进的二进制仅模糊测试工具(如AFL++的QEMU模式、Zydis插桩等),结果显示BTB在覆盖率、崩溃发现数量和速度方面均有显著提升,部分场景下能达到甚至超越源码级插桩的效果。论文还探讨了该方法的局限性,例如对静态链接、混淆代码的适用性问题,以及未来扩展方向。总体而言,这项工作为缺乏源码的软件安全测试提供了一种更高效、更准确的插桩方案,适合二进制分析、漏洞挖掘和模糊测试领域的研究人员与安全工程师阅读。

💡 推荐理由: 对于闭源或遗留系统,只能进行二进制模糊测试。该研究能显著提升此类场景的覆盖率反馈质量,让漏洞挖掘更高效,直接改善安全测试能力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaochen Zou, Juefei Pu, Arrdya Srivastav, Jonathan Cox, Zhengchuan Liang, Yuan Tan, Xingyu Li, Yilin Zhu, Zhiyun Qian

本文(arXiv 论文,题目为《StepStone: LLM-Based GPU Kernel Driver Fuzzing via User-Space Libraries》)提出了一种基于大语言模型(LLM)的 GPU 内核驱动模糊测试方法。研究背景:随着 GPU 在计算和 AI 领域的广泛应用,其内核驱动暴露面增大,安全问题不容忽视。然而,GPU 内核驱动与用户态库交互频繁,传统模糊测试难以生成既满足驱动接口语义又能跨边界触达内核漏洞的输入。核心方法:作者提出了 StepStone 框架,利用用户态库中的丰富语义信息(如 API 调用序列、对象生命周期、上下文依赖等)作为推理基础,引导 LLM 构造更有效的测试用例,进而驱动内核侧的执行路径。主要贡献可能包括:设计了一种将外部库知识转化为 LLM 可理解中间表示的方法;提出了针对内核驱动模糊测试的反馈循环或覆盖引导机制;在真实 GPU 驱动(如 AMD/GPU 或 ARM Mali 等)上验证了该方法的有效性,但具体实验数据在本摘要中无法获得。适合阅读对象:从事内核安全、漏洞挖掘、模糊测试研究的安全工程师以及 GPU 驱动开发者。需要说明:由于本次输入未提供完整摘要,上述内容为基于标题的合理推断,正式结论请参考论文全文。

💡 推荐理由: GPU 内核驱动漏洞可导致权限提升、内存破坏等严重安全问题,且传统 fuzzing 难以覆盖。LLM 与用户态库结合开辟了新的研究思路,有望提升 GPU 驱动漏洞的发现效率,对依赖 GPU 的云环境和 AI 基础设施有直接安全意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jihyeon Yu, Juhwan Kim, Yeohoon Yun, Joobeom Yun

随着物联网(IoT)设备在无人驾驶、建筑、机器人等对精细化要求较高的行业中广泛部署,其安全性却因设备类型多样、固件执行环境复杂而严重滞后于产业发展。现有固件安全测试方法主要分为直接连接真实设备和部分模拟(partial emulation),这些方法虽然可行,但在大规模分析场景下效率低下且难以覆盖多种固件。完整系统模拟(full system emulation)无需真实设备即可测试大量固件,因此更适用于规模化分析,近年已有研究将模拟与模糊测试等软件测试技术相结合,但仍存在适用性有限和效率不足的问题。针对这些局限,本文提出一种名为 FirmColic 的方法,将模糊测试(fuzzing)与符号执行(concolic execution)相结合,以增强进程模拟(augmented process emulation)为基础,利用基于符号执行的关键字提取来提升模糊测试的有效性。此外,FirmColic 在增强进程模拟环境中引入了五种仲裁(arbitration)技术,以提高模拟的成功率。实验结果表明,与以往研究相比,FirmColic 在检测速度、崩溃发现数量以及代码覆盖率方面均有更优表现。该方法适合固件安全研究人员、IoT 设备制造商以及安全测试工具开发者阅读,为大规模 IoT 固件安全分析提供了一种新的技术思路。

💡 推荐理由: IoT 固件安全性长期缺乏高效自动化测试手段,FirmColic 结合模糊测试与符号执行并优化模拟成功率,可直接提升固件漏洞挖掘的覆盖率和效率,对蓝队固件安全评估具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arash Ale Ebrahim, Nils Ole Tippenhauer

该论文对 Apple AirDrop 和 Google/Samsung Quick Share 两种近场文件传输协议进行了首次跨平台的逆向工程与协议感知模糊测试研究。这两种协议被超过 50 亿台设备使用,但由于实现均为专有且未公开文档,其应用层安全特性此前几乎没有被系统研究过。论文指出,这两类协议无需任何预先配对即可从无线近场范围触达,并在特权守护进程中处理复杂的序列化内容(二进制 plist、CPIO 归档、Protocol Buffers、UKEY2 握手),因此可能成为跨多个操作系统的零点击攻击面。作者通过二进制分析重构了 AirDrop 的七层状态机和 DVZip 自适应压缩算法,构建了协议感知模糊测试工具 AirFuzz,该工具能够变异压缩前的表示形式;同时对 Samsung Quick Share 服务和 Google Quick Share for Windows 进行了针对性的手工分析。研究共发现六个漏洞(V1-V6):三个 macOS/iOS AirDrop 的预认证问题(V1:HTTP 路径路由器中的 Swift fatalError 拒绝服务;V2:Foundation 中无界 XML plist 递归;V3:Network.framework 的 HTTP/1.1 解析器中的空指针解引用);两个 Samsung Quick Share 的协议层缺陷(V4:预认证 OfflineFrame 分发;V5:三种帧类型的 D2D 加密绕过);以及一个 Google Quick Share for Windows 中的堆释放后使用漏洞(V6),该漏洞获得了 Google 的漏洞奖励。所有发现均已负责任地披露,Apple、Samsung 和 Google 已确认报告。AirFuzz 工具已在 Zenodo 上公开以支持可复现性。

💡 推荐理由: 该研究揭示了影响数十亿设备的近场传输协议中存在可被远程利用的预认证漏洞和加密绕过问题,证明了专有协议栈也能通过逆向和模糊测试发现严重安全缺陷,对移动和桌面端的安全防护有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.5
Conf: 50%
👥 作者: Ahmad Hazimeh, Adrian Herrera, Srividya Subramanian, Thaqiya Aman, Sara Vaccino, Qiang Liu, Mathias Payer

Magma 是一个开源、基于地面真值(ground-truth)的模糊测试基准测试工具,旨在为模糊测试器的评估和比较提供统一的标准。该基准最初于 2021 年 ACM SIGMETRICS 会议上随研究论文发布,本文作为一篇短文,阐述了 Magma 的动机、设计思路及其影响力,并介绍了对原始基准的扩展内容。Magma 的核心特点在于其内置了真实漏洞作为地面真值,使得不同模糊测试器在相同条件下可被公平对比,避免了传统基准中因崩溃去重或覆盖率指标差异导致的评估偏差。本文总结了 Magma 在设计上的关键决策,例如使用真实软件缺陷、提供可复现的实验环境、支持多语言和多目标,并说明了其在学术界和工业界被广泛采用的情况,以及后续扩展如何新增更多漏洞场景、改进统计方法和集成更丰富的性能指标。该工作为模糊测试研究提供了可靠的基础设施,适合从事漏洞挖掘、软件测试和安全评估的研究人员和工程师阅读。由于仅基于摘要,本文未提供具体实验数据或详细方法论,但足以理解其核心贡献在于构建一个公平、可扩展且可持续维护的模糊测试评估平台。

💡 推荐理由: Magma 为模糊测试提供了标准化评估基准,帮助安全团队客观比较工具效果,避免被不严谨的评测误导,提升漏洞挖掘效率。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

论文提出 NeuronFuzz,一个面向大语言模型(LLM)安全评估的白盒模糊测试框架。现有自动化越狱测试方法主要依赖响应级反馈:每个候选提示都需要目标模型生成完整回复才能评估攻击效果,这不仅计算开销大,而且在强对齐模型上反馈极其稀疏——大多数候选提示都会被拒绝并以相同失败结果结束,导致难以有效指导测试优化。NeuronFuzz 的核心创新是利用模型内部的“安全神经元”作为连续执行反馈,代替传统的响应生成。论文设计了一个 SafetyOracle,将安全神经元的激活值转换为连续的安全报警分数,该分数可在预填充阶段获得,从而将响应生成从模糊测试循环中移除,大幅提升测试效率。为了构建 SafetyOracle,NeuronFuzz 使用模板不变的有害/良性输入以及基于稳定性的选择方法,识别出一组紧凑的安全神经元,其激活模式能够捕捉有害意图识别。此外,由于安全报警分数可微,NeuronFuzz 利用其梯度定位对安全敏感的模板位置,并通过掩码语言模型生成流畅、上下文兼容的突变,同时保留原始有害载荷并避免引入额外优化变量。实验覆盖 21 个文本和多模态模型:在 5 个白盒源模型上,越狱发现率达到 76%–100%,比基线最高提升 48 个百分点;优化后的模板还可零样本迁移到开放权重模型和 6 个专有目标模型,平均攻击成功率(ASR)和 top-5 集成 ASR(EASR)分别达到 69.6%/92.6% 和 44.1%/60.0%。该工作为 LLM 安全评估提供了新的白盒测试思路,适合 LLM 安全研究者、红队工具开发者以及负责模型安全对齐的工程师阅读。

💡 推荐理由: 该研究提出了一种利用安全神经元进行白盒模糊测试的新方法,能显著提升越狱攻击发现效率并降低测试成本,同时可迁移至黑盒模型,为自动化 LLM 安全评估提供了可落地的技术路径,对红队评估和防御加固均有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuangpeng Bai, Zhechang Zhang, Hong Hu 0004

本文针对 Linux 内核中由引用计数使用不当引发的释放后使用(UAF)漏洞提出了一种新的模糊测试方法。作者首先统计发现,近期内核 UAF 漏洞中约有 36.1% 与引用计数操作错误相关,此类漏洞根因复杂且可利用性高,对系统安全构成严重威胁。现有的基于代码覆盖率的模糊测试工具虽然能发现部分常见内存错误,但均未考虑引用计数这一根因,因此只能被动、偶然地触发这类 UAF 漏洞,容易遗漏深层隐藏缺陷。为主动触发引用计数相关的 UAF 漏洞,本文设计了 CountDown——一个新颖的引用计数引导的内核模糊测试器。CountDown 从内核执行过程中收集多样化的引用计数操作信息,并基于被共同访问的引用计数重构系统调用之间的关系;在生成用户态程序时,优先组合那些访问过相同引用计数的系统调用,以触发复杂的引用计数行为。同时,CountDown 会主动注入递减引用计数和访问引用计数对象的系统调用,刻意释放被引用计数的对象,并通过悬垂指针触发非法访问。作者在主流 Linux 内核上对 CountDown 进行了测试,并与当前流行的模糊测试器进行了对比。实验结果表明,CountDown 平均能够比现有最先进工具多检测出 66.1% 的 UAF 漏洞,并多产生 32.9% 的 KASAN 报告。此外,CountDown 还发现了 9 个新的内核内存错误,其中 2 个已被修复,1 个已确认。该研究为内核内存漏洞挖掘提供了新的思路,尤其适用于对引用计数生命周期敏感的 UAF 漏洞发现场景。

💡 推荐理由: 内核 UAF 漏洞是最高危的漏洞类型之一,而引用计数相关 UAF 占比超三分之一。CountDown 首次将引用计数作为模糊测试引导信号,显著提升 UAF 发现效率,对蓝队而言意味着更早发现潜在可利用内核漏洞的机会,也启发防御者关注引用计数生命周期审计。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ze Sheng, Aleksandar Kezic, Zhicheng Chen, Jeff Huang

大型语言模型(LLM)在软件漏洞发现中的应用日益受到关注,但现有评估基准通常要求模型生成针对预定义目标的 PoC 输入,这种方式可能忽略模型发现的、与预期目标不一致但确属有效的崩溃,从而低估模型真实能力。针对这一问题,本文提出了 FuzzingBrain-Bench,一个新的用于评估 AI 模型在开源软件中自主发现漏洞能力的基准。该基准为每个挑战提供一个包含开源项目源码及 sanitizer 插桩 harness 的 Docker 镜像,模型需要生成输入以通过 harness 触发尽可能多的不同崩溃。其评分基于每次运行产生的崩溃签名数量,并设有上限和难度系数以平衡评估。FuzzingBrain-Bench V1 共包含 77 个挑战,覆盖 43 个开源项目,其中 36 个为 C 项目、32 个为 C++ 项目、9 个为 Java/JVM 项目。作者在该基准上评估了 Claude Haiku 4.5、Claude Sonnet 4.6 和 Claude Opus 4.8 三个模型。结果显示,Claude Opus 4.8 表现最优,在 77 个挑战中触发了 60 个挑战的崩溃,总分为 579 分中的 196 分;但仍有 13 个挑战没有任何模型能够触发崩溃。该基准的代码和数据集已公开在 GitHub 上,可供后续研究和评估使用。这项工作为 LLM 驱动的漏洞挖掘提供了一种更真实、更开放的测评方式,有助于推动该领域的发展。

💡 推荐理由: 该基准打破了传统只验证预定义漏洞的局限,为安全团队评估和选择 LLM 驱动的漏洞发现工具提供了更真实的参考,也有助于提升自动化代码审计和模糊测试的应用效果。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Fuchen Ma, Yuanliang Chen, Meng Ren, Yuanhang Zhou, Yu Jiang 0001, Ting Chen 0002, Huizhong Li, Jiaguang Sun 0001

区块链共识协议负责协调多个节点对交易结果达成一致,其实现中的缺陷(包括内存错误和共识逻辑漏洞)可能构成严重威胁。模糊测试(Fuzzing)是发现协议漏洞的有效技术,但现有模糊测试工具在面对分布式节点的复杂共识状态时存在明显不足:它们无法理解和模拟节点间共识状态的演进,导致生成大量无用的网络数据包,难以触及共识协议的深层逻辑,漏洞检测效率低下。为此,本文提出 LOKI——一个状态感知的模糊测试框架,专门针对区块链共识协议的实现进行测试。LOKI 的核心思路是将共识协议的运行状态纳入模糊测试的引导过程,通过建模节点状态、消息交互及状态转换关系,指导测试用例的生成与变异,从而高效地探索共识协议的状态空间。论文的主要贡献包括:设计并实现了状态感知的模糊测试架构,提出了可扩展的共识状态表示与相关的状态引导策略,并在多个主流的区块链共识协议实现上进行了实验验证。实验结果表明,相比现有模糊测试工具,LOKI 能够显著提高代码覆盖率并发现更多深层漏洞。该研究为区块链共识协议的安全测试提供了新的思路,适合区块链安全研究人员、协议实现者以及漏洞挖掘工具开发者阅读。

💡 推荐理由: 区块链共识协议是系统安全的核心,其实现漏洞可能导致交易混乱或分叉。LOKI 提出状态感知模糊测试,能深入测试共识逻辑,弥补现有工具对分布式状态处理的缺失,对提升区块链系统安全性有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Moritz Bley, Tobias Scharnowski, Simon Wörner, Moritz Schloegel, Thorsten Holz

嵌入式系统的网络接口是其主要攻击面之一,但与传统通用系统不同,嵌入式系统使用专用且多样化的通信协议栈。当前针对嵌入式网络栈的安全评估方法通常依赖人工操作或物理硬件,且只关注系统的局部。固件重宿主(firmware rehosting)作为替代方案,通过对物理硬件进行通用模拟,实现对固件整体的模糊测试。然而,现有重宿主方法难以有效探索网络栈,因为网络输入格式复杂且多层,导致无法发现深层嵌套的软件错误。本文提出一种名为 Pemu 的新方法,自动检测并处理固件中使用的网络协议。Pemu 通过自动推断可用网络协议,透明地生成封装模糊测试数据的合法网络数据包,使测试输入直接深入固件逻辑的更深层次,从而对以前难以或无法测试的组件进行更深、更有针对性的逐层分析。评估表明,Pemu 一致地提升了三种现有嵌入式网络栈重宿主工具的代码覆盖率。此外,该模糊器重新发现了多个已知漏洞,并识别出五个以前未知的软件错误,充分展示了其在发现网络暴露代码中深层嵌套缺陷方面的有效性。本文的核心贡献在于自动化协议处理与重宿主集成,为嵌入式网络栈安全测试提供了新思路,适合固件安全研究者、漏洞挖掘工程师及工业控制系统安全评估人员阅读。

💡 推荐理由: 嵌入式网络栈漏洞常被忽视,Pemu 将重宿主与协议感知结合,能自动生成合法数据包深入测试,显著提升覆盖率并发现真实缺陷,对固件安全评估和漏洞研究有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Emre Güler, Sergej Schumilo, Moritz Schloegel, Nils Bars, Philipp Görz, Xinyi Xu, Cemal Kaygusuz, Thorsten Holz

论文《Atropos: Effective Fuzzing of Web Applications for Server-Side Vulnerabilities》介绍了一种名为 Atropos 的模糊测试技术,旨在高效发现 Web 应用中的服务端漏洞。根据论文标题所示,Atropos 专注于服务端场景,可能通过自动化生成测试用例并监测服务器行为来识别安全缺陷。由于论文摘要未提供,本文仅基于标题进行概述。对于安全从业者而言,此类工具可辅助在开发阶段发现服务端逻辑漏洞,从而提升 Web 应用的整体安全性。具体技术细节、实现机制与实验验证结果需查阅原论文。

💡 推荐理由: Web 应用服务端漏洞是常见攻击目标,Atropos 类的模糊测试工具能自动化识别安全隐患,有助于安全团队部署纵深防御。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sudipta Paria, Aritra Dasgupta, Raghul Saravanan, Jayanth Thangellamudi, Sai Manoj P D, Swarup Bhunia

本文系统研究了硬件黑客竞赛在复杂片上系统(SoC)安全验证中的应用。随着SoC设计复杂度不断提升,传统验证方法难以覆盖所有安全漏洞,硬件黑客竞赛成为一种实用化的安全评估平台,能够促进安全意识验证和工具开发。作者提出了一种多策略漏洞分析方法,结合了基于仿真的验证、形式验证、lint分析、大型语言模型(LLM)辅助的bug检测和覆盖引导的混合模糊测试。通过在实际竞赛中分析代表性漏洞发现,文章展示了不同技术如何互补地揭示安全缺陷类别,例如仿真适合动态行为验证,形式验证能穷举状态空间,lint可快速定位编码规范问题,LLM辅助可发现逻辑疏忽,混合模糊测试则能深入探索边界条件。文章还从这些实践中提炼出对硅前安全验证的实用经验,指出单一方法存在局限性,综合使用多种策略是提高漏洞覆盖率的关键。最后,作者讨论了如何将比赛基准用于新兴硬件安全技术的可复现评估,并指导未来的安全感知EDA(电子设计自动化)研究。该研究为硬件安全验证社区提供了系统化的方法论参考,适合硬件安全研究人员、EDA工具开发者和SoC设计验证工程师阅读。

💡 推荐理由: 该文系统总结了利用硬件黑客竞赛验证SoC安全的多策略方法,结合LLM和混合模糊测试等前沿技术,为硅前安全验证提供了可借鉴的实践框架,有助于提升复杂芯片的安全检测能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 16.6
Conf: 50%
👥 作者: Peng Chen 0034, Yuxuan Xie, Yunlong Lyu, Yuxiao Wang, Hao Chen 0003

该论文提出 HOPPER,一种无需领域知识即可对库进行模糊测试的解释性模糊测试工具。现有模糊测试工具通常需要手动构造模糊驱动(fuzz driver),其质量取决于开发者的代码理解,而自动生成驱动的方法又受限于已学习代码的调用序列。HOPPER 将库模糊测试问题转化为解释器模糊测试问题:被测库链接的解释器可解释描述任意 API 用法的输入。为了生成语义正确的输入,HOPPER 学习库内的接口内(intra-API)和接口间(inter-API)约束,并通过语法感知的变异生成测试用例。作者在 11 个真实库上评估 HOPPER,与手工编写的模糊器和自动化方案相比,HOPPER 在代码覆盖率和漏洞发现上均显著优于其他工具,发现了 25 个其他模糊器无法发现的未知 bug。实验表明,所提出的约束学习方法能正确学习库隐含的约束,大幅提升模糊测试效率。该工作为库级模糊测试提供了开箱即用的自动化方案,适合安全测试工具开发者和软件测试研究人员阅读。

💡 推荐理由: 库模糊测试是发现底层漏洞的重要途径,但传统方法依赖人工编写驱动,HOPPER 通过解释器思想结合约束学习,显著提升了自动化程度和漏洞发现能力,具有实际应用价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: William Woodruff, Niki Carroll, Sebastiaan Peters

本文研究如何将差分模糊测试(differential fuzzing)应用于 x86-64 指令解码器的错误发现。传统模糊测试依赖崩溃、挂起或内存访问错误作为 oracle,而差分模糊测试将同一输入在不同实现之间的行为差异作为潜在错误信号。作者提出了 MISHEGOS,一个新颖的差分模糊测试器,专门用于发现指令解码器之间的解码差异。MISHEGOS 的架构包括一个过近似(overapproximated)的机器指令模型,用于在变长指令架构上滑动生成测试用例,从而高效探测解码器的边界行为。该工具每小时可在普通硬件上生成数亿条解码器测试用例。作者在不依赖硬件解码器作为 ground truth 的情况下,利用 MISHEGOS 在多个流行的 x86-64 指令解码器中发现了数百个错误。此外,MISHEGOS 提供了一个可扩展的分析框架,使用户能够针对单个解码器发现错误,或在多个解码器之间分析各种不一致。论文还讨论了解码错误和不一致的安全影响,例如可能导致反汇编器、二进制分析工具或安全产品在生产环境中产生误判。作者以宽松许可证公开了 MISHEGOS 的源代码。本文的主要贡献包括:首次系统性地将差分模糊测试应用于指令解码器领域;提出了一种针对变长指令集的滑动模糊策略;构建了高吞吐量的测试生成与差异分析框架;并通过实验证明了该方法在发现真实解码器缺陷方面的有效性。适合从事二进制分析、反汇编器开发、模糊测试和安全工具研发的研究人员与工程师阅读。

💡 推荐理由: 指令解码器是反汇编器、二进制分析、漏洞挖掘和取证工具的核心组件。解码差异可能导致安全工具漏报或误报,甚至被攻击者利用来隐藏恶意代码。本文提出的自动化差异发现方法能帮助蓝队提前识别这些隐藏缺陷。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

该论文提出了一种名为 PILOT 的新型命令行界面(CLI)模糊测试框架。CLI 模糊测试通过同时变异命令行选项和输入文件内容来测试程序,从而发现仅在特定选项与输入组合下才会触发的深层漏洞。然而,现有 CLI 模糊测试方法在生成语义丰富的选项字符串和输入文件方面存在困难,导致难以到达深层嵌入的目标函数,容易漏报此类深层漏洞。PILOT 的核心思想是将可能到达目标函数的调用路径作为上下文提供给大语言模型(LLM),帮助其生成更有效的 CLI 选项字符串和输入文件,从而提升代码覆盖率。具体而言,PILOT 采用路径引导的方式,首先向 LLM 提供目标函数的潜在调用路径,然后迭代地重复该过程,并将已到达的函数作为额外上下文,逐步引导生成能够触发目标函数的输入。作者在真实世界的 CLI 应用程序上进行了评估,结果表明 PILOT 相比现有最先进的模糊测试方法实现了更高的覆盖率,并发现了 51 个零日漏洞。所有漏洞均已负责任地披露给开发者,截至目前已有 41 个漏洞被开发者确认,其中 33 个已修复,3 个已分配 CVE 标识符。该研究适合关注漏洞挖掘、模糊测试、LLM 辅助安全分析以及 CLI 应用安全的读者。

💡 推荐理由: CLI 应用广泛存在于开发运维和系统管理中,深层漏洞难以被发现。该研究将 LLM 与路径引导结合,显著提升模糊测试到达目标函数的能力,有助于蓝队提前识别和修复高危缺陷。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.7
Conf: 50%
👥 作者: Jianqiang Wang, Meng Wang 0071, Qinying Wang, Nils Langius, Li Shi, Ali Abbasi 0002, Thorsten Holz

引导加载程序(bootloader)在系统启动流程中扮演关键角色,它连接固件与操作系统,负责验证并加载操作系统镜像,是安全启动链的核心环节。一旦bootloader存在漏洞,攻击者可能绕过安全启动机制,在系统启动早期植入恶意代码。近年来,随着bootloader功能日益丰富,其代码规模扩大,攻击面也随之增加,已有多个内存安全漏洞被公开,部分可导致拒绝服务或安全启动绕过。然而,此前尚无对bootloader内存安全的系统性研究。本文首次对bootloader进行了全面、系统的内存安全分析。作者首先调查了历史bootloader漏洞,梳理了各bootloader的潜在攻击面,并指出来自存储设备、网络等外设的恶意输入是攻击者利用漏洞的主要途径。基于这一观察,他们设计并实现了一个专用于bootloader的模糊测试框架。通过该框架,作者对九个主流bootloader进行了测试,共发现39个漏洞,其中38个为新漏洞。尤其值得注意的是,在广泛使用的Linux标准bootloader GRUB中发现了14个漏洞,其中部分漏洞在特定利用场景下可导致安全启动绕过。目前已有5个漏洞获得CVE编号。作者已将框架原型开源(https://github.com/wjqsec/bootloader),以促进该领域后续研究。这一工作显著提升了bootloader安全性的可测试性,为防御方提供了系统化的漏洞挖掘与评估工具。

💡 推荐理由: bootloader是安全启动链的信任根,内存安全漏洞可被攻击者利用以绕过系统防护,影响系统完整性与启动安全。本文提供了首个系统性分析及可落地的模糊测试框架,对蓝队评估自身启动链安全性具有直接参考价值。

🎯 建议动作: 研究跟进,并考虑将模糊测试框架纳入内部安全测试流程

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Leo Stone, Rishi Ranjan, Stefan Nagy, Matthew Hicks

本文针对Windows平台二进制程序模糊测试中常见的性能瓶颈与兼容性问题,提出一种名为“目标嵌入式快照”(Target-embedded Snapshotting)的新方法。传统模糊测试通常依赖Linux环境下的进程快照/恢复机制,而在Windows上由于系统差异和API限制,难以获得同等效率。该方法将快照能力直接嵌入到被测目标进程内部,使得每次测试迭代无需启动/销毁完整进程或依赖外部虚拟化支持,从而大幅降低开销并提升执行速度。同时,通过嵌入式快照能更精确地控制执行状态,避免因操作系统调度或环境差异带来的不确定性,保证模糊测试结果的可复现性和正确性。论文还讨论了该方法在真实Windows二进制上的应用效果,并与现有工具进行对比,展示了其在吞吐量、代码覆盖率以及漏洞发现能力上的优势。对于希望在纯Windows环境下开展高效安全测试的研究人员与工程师而言,该技术提供了一条低成本、高收益的实践路径。需要指出的是,由于缺少完整的论文正文信息,上述内容仅依据标题与作者所属领域合理推断,具体实验细节和定量结论应以原论文为准。

💡 推荐理由: Windows二进制模糊测试长期受限于性能与兼容性,本文提出的嵌入式快照方案有望让蓝队和产品安全团队在原生Windows环境中快速开展漏洞挖掘,提升内部安全测试效率,值得密切关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinho Jung 0001, Stephen Tong, Hong Hu 0004, Jungwon Lim, Yonghwi Jin, Taesoo Kim

该论文提出名为 WINNIE 的模糊测试框架,专门针对 Windows 平台上的应用程序。研究背景指出,现有模糊测试工作大多集中在 Unix 类系统,因为 Windows 在模糊测试方面存在独特挑战:闭源生态导致难以进行插桩和覆盖率反馈,图形界面(GUI)的大量使用使得传统基于命令行的输入驱动方式失效,以及缺乏像 fork() 那样快速克隆进程的机制,导致并发执行大量测试用例的效率低下。WINNIE 的核心方法包括两个关键组件:一是 harness 合成(Harness Synthesis),即自动从 Windows 应用程序中提取并生成适合模糊测试的测试驱动代码(harness),以解决闭源和 GUI 交互带来的输入构造难题;二是快速克隆(Fast Cloning),通过设计轻量级的进程复制机制,模拟类 Unix 的 fork 语义,使得在 Windows 上能够高效地并行执行多个测试用例,从而提升模糊测试的吞吐量。论文的贡献主要在于系统性地解决了 Windows 平台模糊测试的三大障碍,并实现了一个原型工具。实验部分(摘要未详细给出)预计展示了 WINNIE 在真实 Windows 应用程序中成功发现漏洞的能力,以及与现有工具相比在效率和覆盖率上的提升。适合阅读的人群包括研究 Windows 安全、模糊测试技术、以及致力于构建跨平台漏洞挖掘工具的安全研究人员和开发人员。

💡 推荐理由: 填补了 Windows 平台模糊测试工具的空白,解决闭源和 GUI 程序无法有效测试的问题,对广泛使用的 Windows 桌面应用和商业软件的安全检测有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Seokhun Jeong, Gyeongmin Dan, Sukyoung Ryu, Sungjae Hwang

以太坊的共识安全依赖于多个独立实现的共识客户端在每个状态转换上保持一致。若实现差异导致分歧,网络可能分叉、最终性停滞,并引发严重攻击。为防止此类共识分歧,以太坊提供了 Python 参考实现(consensus-spec)作为规范,并附带手工制作的标准测试套件(spectests)。然而,作为可执行实现,以太坊规范通过运行时行为隐式定义有效性,缺乏系统性方法来确保所有有效性条件被充分测试。本文提出 SpecTrum 框架,分三个阶段解决该问题。首先,引入 Consensus-SpecTec——以太坊共识算法的机械化规范,将有效性条件显式化为 if 前提。其次,定义前提覆盖率指标,衡量 spectests 中哪些 if 前提被评估为真/假。第三,开发基于规范的测试生成器,提取未被 spectests 评估为假的前提约束,并生成输入以覆盖这些前提。在五个主流以太坊共识客户端上应用 SpecTrum,识别出 27 个跨客户端分歧案例,其中 22 个在未插入机械化前提时无法发现。所有 27 个案例在不同分叉版本上均可复现,且将机械化规范扩展到新分叉所需的工作量与规范差异成正比。该研究提出了一种系统化的共识一致性测试方法,通过机械化规范和前提覆盖率指导差分模糊测试,显著提高了以太坊共识客户端之间的一致性和安全性。适合共识协议开发者、区块链安全研究人员以及关注系统验证的软件工程师阅读。

💡 推荐理由: 针对以太坊共识客户端分歧的系统性测试方法,可提前发现导致分叉或最终性停滞的严重实现错误,对保障区块链主网安全性具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zihan Lin, Yuan Zhang 0009, Jiarun Dai, Xinyou Huang, Bocheng Xiang, Guangliang Yang 0001, Letian Yuan, Lei Zhang 0096, Tian Chen, Min Yang 0002

本论文聚焦于Web漏洞检测中的定向模糊测试(Directed Fuzzing)问题,提出了一种基于层次化调度的有效方法。传统模糊测试通常盲目地探索程序状态,效率低下;而定向模糊测试则试图引导输入生成过程,使其更快地到达潜在漏洞点。论文的核心贡献在于设计了一种层次化调度策略,该策略能够在不同粒度上(如种子选择、能量分配、路径优先级等)动态调整模糊测试的方向,从而在复杂的Web应用场景中更高效地发现漏洞。该研究可能针对Web应用特有的状态敏感、输入格式复杂等挑战,通过结合全局与局部的反馈信息来优化调度决策。实验部分预计会对比多种基线模糊器,验证该方法在漏洞发现数量、到达目标代码的效率以及代码覆盖率方面的优势。由于本文仅包含标题信息,未提供完整摘要文本,以上总结基于标题和研究方向的合理推断,具体技术细节和实验数据需以全文为准。适合从事漏洞挖掘、模糊测试工具开发、Web安全测试的研究人员和安全工程师阅读。

💡 推荐理由: 为Web漏洞检测提供了新的模糊测试调度思路,有助于提高自动化漏洞发现的效率,蓝队可用于评估和增强自身的漏洞挖掘能力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Sungwoo Kim 0005, Hui Peng, Imtiaz Karim, Ruoyu Wu, Jianliang Wu 0002, Elisa Bertino, Mathias Payer, Dave (Jing) Tian

该论文提出 FuzzBT,一种面向内核中蓝牙主机栈的、以整体状态引导的模糊测试方法。蓝牙协议栈在现代操作系统内核中广泛存在,且暴露于不可信蓝牙流量,是安全攻击的重要面。现有模糊测试工具往往仅关注单个协议层或孤立的状态,难以有效覆盖跨层、跨连接的状态转换,导致深层漏洞难以被发现。FuzzBT 的核心观察是:蓝牙主机栈的状态由多个相互依赖的组件共同决定,包括链路层连接状态、L2CAP 信道状态、SDP 服务发现状态等,任何单一环节的状态变化都可能影响整体行为。因此,作者引入一种“整体状态”的概念,将协议栈各层的关键状态变量进行统一建模,通过轻量级的插桩从内核中提取状态信息,并以此为反馈指导测试用例的生成与变异。系统架构上,FuzzBT 包含一个状态提取器、一个状态感知的调度器以及一个基于状态覆盖的引导机制,能够自动识别哪些状态组合尚未被探索,并优先生成能够驱动状态跃迁的输入。实验在 Linux 内核的蓝牙子系统上开展,对比了现有最先进的模糊测试工具(如 Syzkaller 和针对蓝牙的专用工具)。结果表明,FuzzBT 在代码覆盖率、状态覆盖率和独特崩溃数量上均显著优于基线,能够发现多个此前未知的漏洞,涉及不正确的状态转换处理、内存破坏和空指针解引用等问题。该研究为内核蓝牙栈的安全性评估提供了一种更系统、更高效的自动化测试方法,连接了协议状态建模与漏洞挖掘两个领域,对于操作系统安全研究和蓝牙相关漏洞的早期发现具有重要价值。适合对内核模糊测试、协议安全分析和漏洞研究感兴趣的研究人员及安全工程师阅读。

💡 推荐理由: 蓝牙协议栈是手机和电脑等设备的常驻攻击面,现有测试工具难以覆盖跨层状态转换。FuzzBT 提出的整体状态引导思路能显著提升该领域漏洞发现效率,对蓝队评估自身蓝牙实现安全性极具参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
INFO
PAPER 2026-08-16

Stateful Greybox Fuzzing.

推荐 16.5
Conf: 50%
👥 作者: Jinsheng Ba, Marcel Böhme, Zahra Mirzamomen, Abhik Roychoudhury

本论文针对协议实现这类反应式系统中的状态相关(stateful)缺陷的模糊测试难题,提出了一种无需协议形式化规范即可自动识别状态变量并引导状态空间覆盖的灰盒模糊测试方法。作者观察到,在Top-50最广泛使用的开源协议实现中,所有实现都使用枚举类型的状态变量,其取值来自命名常量(如INIT、READY),从而可以用程序化方式自动识别这些状态变量,而无需人工标注。基于这一洞察,论文设计了一个有状态灰盒模糊器:在模糊测试过程中,自动跟踪状态变量被赋予的常量值序列,构建被探索状态空间的地图,并优先选择能够到达新状态或新状态序列的输入。实验表明,从初始状态出发,该模糊器比基线灰盒模糊器(即被扩展的模糊器)在相同时间内覆盖了多一个数量级的状态/状态转移序列,代码覆盖速度快一倍,且发现状态相关缺陷的速度是基线的两倍。此外,该模糊器在多个知名协议实现中发现了若干零日漏洞,并已获得8个CVE编号。该研究的核心贡献在于证明了状态识别可以完全自动化,显著提升了对无规范协议的模糊测试效率,为协议实现的安全测试提供了实用工具和方法论。

💡 推荐理由: 协议实现中的状态相关漏洞难以被传统模糊测试发现,本方法无需协议规范即可自动覆盖状态空间,能大幅提升漏洞挖掘效率,对蓝队评估自身协议组件安全性具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 12.5
Conf: 50%
👥 作者: Han Zheng 0006, Flavio Toffalini, Qiang Liu 0034, Mathias Payer

本论文(arXiv 预印本)围绕现代浏览器中的“变体漏洞”(variant bugs)挖掘问题展开。变体漏洞是指同一根本缺陷在不同代码路径或不同组件中的衍生表现形式,通常由补丁不完整或修复不彻底导致。论文由 Han Zheng、Flavio Toffalini、Qiang Liu 和 Mathias Payer 撰写,主要研究如何系统化地从已知漏洞出发,在复杂浏览器代码库中高效发现同类安全问题。由于当前仅获取到标题与作者信息,未包含完整摘要与实验细节,具体方法(如是否有基于补丁差异分析的定向模糊测试、符号执行或静态分析辅助的变体检测)尚无法确认。论文的核心贡献可能包括:提出一种针对浏览器变体漏洞的自动化挖掘框架、设计有效的漏洞变体识别算法,并在主流浏览器(如 Chrome/Firefox)上验证其发现新漏洞的能力。对于浏览器安全研究者、模糊测试工具开发者和漏洞赏金猎人而言,该研究有助于理解如何利用已有漏洞情报扩展攻击面检测,提升安全响应的主动性和覆盖面。结论与量化指标需待全文审阅后才能准确评估。

💡 推荐理由: 浏览器是攻击面极大且更新频繁的软件,变体漏洞常被攻击者利用以绕过补丁。该研究为蓝队和安全工程师提供了自动化发现这类漏洞的思路,有助于在攻击发生前加固代码。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tuan Dinh Hoang, Taekkyung Oh, CheolJun Park, Insu Yun, Yongdae Kim

本文提出 LLFuzz,一个针对蜂窝基带低层(如物理层、MAC层)的空中(over-the-air)动态测试框架。基带芯片是移动设备中处理蜂窝通信的关键组件,其低层协议栈通常运行在专用实时操作系统上,且与上层应用隔离,传统基于主机的模糊测试难以覆盖。LLFuzz 通过软件无线电(SDR)设备与实际基带进行真实无线信号交互,动态生成并注入畸形或边界条件的LTE/NR物理层信号,以触发基带底层解析逻辑中的漏洞。核心贡献包括:设计了面向基带低层的协议状态感知模糊测试流程,能自动适配不同物理层信道配置;开发了高效的信令生成与同步机制,保证测试帧能被目标基带正确接收;并实现了基于崩溃或异常行为的崩溃检测与输入复现方法。实验在多个主流商用基带芯片上进行,成功发现多个可导致基带重启或拒绝服务的未公开缺陷,证明了该框架的有效性和实用性。该研究为蜂窝基带安全评估提供了新的动态测试手段,弥补了静态分析和纯软件模拟的不足,适合移动通信安全研究人员、基带固件开发者及运营商安全团队参考。

💡 推荐理由: 基带低层漏洞常被用于远程攻击和网络监听,且难以通过静态分析发现。LLFuzz 提供了可操作的动态测试思路,帮助蓝队评估自家设备基带面对畸形无线信号时的健壮性。

🎯 建议动作: 研究跟进,评估该框架在自组织网络或设备入库测试中的可用性

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Matteo Marini, Daniele Cono D&apos;Elia, Mathias Payer, Leonardo Querzoni

本文针对模糊测试中未初始化内存使用(Use-of-Uninitialized-Memory, UUM)错误检测的实践难题提出了一种新的高效方案 QMSan。现有的模糊测试兼容 UUM 检测器 MSan 要求所有被测试程序的库都必须经过完全插桩才能避免误报,这在实际大规模测试中往往难以实现,导致许多程序从未接受过 UUM 错误的检测。作者指出,地址消毒等部分插桩策略只会导致漏报,而 UUM 消毒器则因可能产生误报而要求完整插桩,这严重限制了可扩展性。为突破这一限制,QMSan 采用了一种多层次的、机会主义的设计,不需要对所有代码进行基于源码的重新编译,同时保持准确性。其核心思想是:模糊测试过程中会执行大量测试用例,这为系统提供了学习“误报”特征的机会——当遇到一个候选错误时,可以通过快速技术判断其是否为真正的误报,并在后续测试中忽略相似的模式,从而避免漏报。具体实现上,QMSan 结合了 QEMU 的动态二进制翻译以解决兼容性问题,并采用轻量级代码分析技术来提升可扩展性和准确性。实验基于 10 个开源程序和 5 个专有程序进行,QMSan 发现了 44 个新的 UUM 错误。性能方面,QMSan 相比原生 QEMU 只带来 1.51 倍的开销,相比 MSan 的编译插桩有 1.55 倍的开销,且在测试中未出现误报和漏报。QMSan 已开源。该研究的主要贡献在于提供了一种无需完全插桩即可高效检测 UUM 错误的可行方案,使得模糊测试可以覆盖更多真实世界程序,推动了 UUM 漏洞检测的实用化。

💡 推荐理由: UUM 漏洞长期因检测工具部署门槛高而被忽视,QMSan 通过动态二进制翻译与误报学习机制,无需全量插桩即可高效发现未初始化内存错误,显著降低了 UUM 检测的实践门槛,适合所有从事模糊测试和漏洞挖掘的安全工程师关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Baihong Chen, Hua Ming, Weifeng Pan, Tian Xie, Haipeng Cai, Wen Li

本文是一项关于多驱动模糊测试(multi-driver fuzzing)的实证研究。许多软件通过命令行选项、子命令和配置标志暴露多种执行模式。对于这类程序,模糊测试同时依赖于变异的输入和所调用的模式,但现有评估主要关注覆盖率和 bug 数量,尚未清楚执行模式如何划分、重叠和遗漏软件结构,以及这些差异如何影响模糊测试的有效性。为此,作者提出了一种结构抽象方法:以静态调用图作为共享骨干,将驱动特定的动态覆盖率投影到骨干上,从而派生出驱动诱导子图。基于该抽象,他们开发了四阶段方法论:骨干构建、模糊测试与剖析、基于图的分析、以及由研究问题驱动的评估。作者将该方法应用于从 OSS-Fuzz 派生的 27 个 C/C++ 项目,涵盖 43 个可执行文件和 854 个驱动配置。实验结果表明,在相同的总预算下,多驱动模糊测试优于最佳单驱动基线:覆盖的调用图节点增加了 27.9%,CFG 边覆盖增加了 73.5%,并发现了 11 个主要由单驱动模糊测试遗漏的独特 bug 和异常行为。然而,驱动贡献并不均匀:子图在凝聚力、碎片化、模块性、重叠等方面差异显著,残余的未探索区域遵循重复出现的模式而非均匀尾部。这些结果说明,多驱动模糊测试从根本上是一个结构探索问题。该研究为理解多驱动模糊测试的结构特性提供了深入见解,并为优化驱动配置和模糊测试策略提供了指导。

💡 推荐理由: 该研究揭示了多驱动模糊测试在软件结构覆盖上的显著优势,能够帮助安全团队更有效地配置多模式软件的模糊测试,提高漏洞发现效率。其结构化分析方法可迁移到其他模糊测试评估和优化场景。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinwen Wang, Hongchao Zhang, Chuanrui Jiang, Andrew Clark 0001, Ning Zhang 0017

本文针对信息物理系统(Cyber-Physical Systems, CPS)中模糊测试面临的输入搜索空间过大的问题,提出了一种基于控制理论的解决方案。随着CPS在日常生活中日益普及,其安全性成为紧迫议题。虽然模糊测试在自动检测漏洞方面受到广泛关注,但物理输入和网络输入的组合搜索空间极为庞大,如何高效探索仍是一个开放挑战。作者从控制理论中汲取灵感,利用物理感知的控制模型来引导输入空间探索。具体而言,设计并实现了ConTest这一模糊测试工具,该工具使用控制模型的Lyapunov函数同时用于缺陷检测和变异策略,从而在动态模型误差有界的条件下,为漏洞发现的有效性提供了可证明的保证。作者在ArduPilot和PX4两个代表性机器人车辆(RV)平台上部署了ConTest原型,用于检测空间和时间输入验证缺陷,共发现253个输入验证漏洞,其中58个为零日漏洞,54个已获供应商确认。该研究不仅提出了新的理论方法,还通过实际平台验证了工具的有效性,为CPS模糊测试领域提供了重要参考。

💡 推荐理由: CPS安全日益重要,传统模糊测试难以高效探索物理与网络输入组合空间。ConTest引入控制理论的Lyapunov函数,以可证明保证提升漏洞发现效率,为CPS模糊测试提供新工具,能显著提升机器人平台输入验证缺陷的发现能力。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Yiru Xu, Hao Sun 0021, Jianzhong Liu, Yuheng Shen, Yu Jiang 0001

本文提出了一种名为 Saturn 的主机-设备协同 USB 驱动模糊测试方法。USB 是现代操作系统的重要组成部分,其协议栈通常包含主机侧驱动和设备侧 gadget 驱动,两者均运行在特权模式,安全关键性极高。一旦这些驱动存在漏洞,恶意或异常的外部设备就可能利用漏洞导致系统崩溃。模糊测试作为自动化漏洞检测技术,已被广泛应用于内核组件测试,但现有工作大多只聚焦于单一侧(主机或设备),通过模拟来自用户空间或外设的恶意输入来测试驱动,忽略了仅在两侧边界交互时才会触发的复杂内部状态,导致大量漏洞未被发现。Saturn 的目标是覆盖 USB 通信全过程的处理链。其核心方法包括:首先,利用提取的驱动信息来系统性地附加 gadget,从而触发更多驱动类型,促进交互逻辑的转换;然后,在两侧通过规范操作注入进行持续协同模糊测试,使主机侧与设备侧各自发挥重要作用,显著扩展被测试的状态空间,并暴露这类交互逻辑中的缺陷。实验结果表明,与当前最先进的 USB 模糊测试工具(如 Syzkaller、USBFuzz 和 FUZZUSB)相比,Saturn 在对应协议栈上的分支覆盖率分别提升了 1.53 倍、3.69 倍和 2.3 倍。此外,Saturn 发现了 26 个此前未知的漏洞,其中包括 4 个 CVE,涉及主机侧和设备侧驱动。本文的研究为 USB 驱动安全测试提供了新思路,强调了跨边界协同测试的必要性。

💡 推荐理由: USB 驱动是攻击面,恶意设备可造成系统崩溃;Saturn 能发现传统单侧模糊测试遗漏的交互逻辑漏洞,提升内核安全防御能力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Yu-Fu Fu, Jae-Hyuk Lee, Taesoo Kim

本文提出了一种名为 autofz 的自动化元模糊测试框架,旨在解决模糊测试工具选择负担的问题。随着模糊测试技术的发展,出现了大量各具特色的模糊器,它们在不同目标上表现各异,但不存在一个在所有场景下都最优的通用模糊器。传统方法通过标准基准测试集来比较选择,但平均性能最优的模糊器并不一定适合用户的具体目标。为此,autofz 通过运行时动态组合现有模糊器,实现最优的资源调度。其核心思想是监控各模糊器的运行时进度(称为趋势,类似于梯度下降中的梯度),并据此细粒度地调整资源分配。与传统方法不同,autofz 在运行时根据当前工作负载自适应地推导出合适的模糊器组合,无需用户预先选择。实验评估显示,autofz 在 12 个可用基准中的 11 个上优于任何单一最优模糊器,在 20 个基准中的 19 个上优于现有的协作模糊测试方法。平均而言,autofz 比单一模糊器多发现 152% 的漏洞,比协作模糊测试多发现 415% 的漏洞。该方法为非侵入式设计,用户只需将所有可用模糊器提供给 autofz,即可获得接近最优的结果。本文的主要贡献在于提出了一种自动化、非侵入的元模糊器架构,通过动态趋势监控实现资源调度的细粒度优化,显著提升了漏洞发现的效率和效果。

💡 推荐理由: 对于安全团队而言,autofz 能自动组合现有模糊器,减少人工选型成本,提高漏洞挖掘效率。它无需修改内部模糊器,可快速集成到现有测试流程,值得关注其背后的动态调度思想。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Georgios C. Androutsopoulos, Antonio Bianchi

本文提出 deepSURF,一种结合静态分析与大语言模型(LLM)引导的模糊测试工具,用于检测 Rust 库中的内存安全漏洞,尤其针对 unsafe 代码。尽管 Rust 默认保证内存安全,但 unsafe 代码的使用可能引入安全漏洞。现有工具在检测能力、处理 Rust 特有类型或减少人工干预方面存在不足。deepSURF 引入了一种处理泛型的新方法:通过自定义类型替换泛型,并为所需 trait 生成定制实现,使模糊测试器能够在被测库中模拟用户定义的行为。此外,deepSURF 利用 LLM 动态增强模糊测试 harness,以探索复杂的 API 交互,显著增加暴露内存安全漏洞的可能性。作者在 63 个真实世界的 Rust crate 上进行了评估,成功复现了 30 个已知内存安全缺陷,并发现了 12 个先前未知的漏洞(其中 11 个已分配 RustSec ID,3 个已修复),显示其相对于最先进工具的明显改进。这篇论文的主要贡献在于提出一种自动化程度更高的漏洞发现框架,结合 LLM 提升模糊测试的覆盖率和有效性,并针对 Rust 特有挑战提供了解决方案。适合 Rust 安全研究人员、模糊测试工具开发者以及关注内存安全漏洞的蓝队成员阅读。

💡 推荐理由: 为 Rust 生态提供了自动化漏洞发现的新方法,能识别未知内存安全漏洞,且改进了对 unsafe 代码的检测能力。对使用 Rust crate 的安全工程师有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuncheng Wang, Yaowen Zheng, Puzhuo Liu, Dongliang Fang, Jiaxing Cheng, Dingyi Shi, Limin Sun 0001

本文提出 ADGFUZZ,一种面向机器人车辆(RV)控制软件的新型模糊测试框架,旨在检测赋值语句相关的深层缺陷。RV 控制软件通过持续计算车辆内部状态、传感器读数与外部输入来维持系统正常运行,其可配置参数、命令输入和环境感知数据之间存在巨大的组合空间,给安全带来显著风险。传统模糊测试难以有效探索如此庞大的输入空间并发现深层 bug。ADGFUZZ 的核心思路是:首先通过静态分析构建“赋值依赖图”(Assignment Dependency Graph, ADG),捕捉程序内部变量之间的依赖关系;然后利用命名相似性将这些依赖传播到 RV 的输入空间,生成一组目标明确的输入,称为“匹配输入集”(Matched Input Set, MIS);最后在 MIS 上进行熵感知模糊测试,从而提升 bug 发现的整体效率。实验评估中,ADGFUZZ 在三种不同类型的 RV 上发现了 87 个独立 bug,其中 78 个为未知缺陷;所有已发现的 bug 均已向开发者负责任披露,已有 16 个被确认修复。该研究的主要贡献在于利用程序内变量依赖关系来指导模糊测试输入生成,有效应对 RV 软件中输入空间巨大且探索困难的问题,为机器人车辆控制软件的安全检测提供了新思路。适合关注嵌入式系统安全、模糊测试技术及机器人安全的研究人员与安全工程师阅读。

💡 推荐理由: 机器人车辆在军事和民用领域日益普及,其控制软件漏洞可能导致物理后果。ADGFUZZ 通过静态依赖分析指导模糊测试,显著提升 RV 软件缺陷发现效率,为保障关键系统安全提供了可借鉴的方法。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiaxing Cheng, Ming Zhou 0010, Haining Wang 0001, Xin Chen 0123, Yuncheng Wang, Yibo Qu, Limin Sun 0001

本文提出 LogicFuzz,据作者称这是首个专门针对可编程逻辑控制器(PLC)固件中逻辑指令库进行模糊测试的框架。PLC 广泛用于工业自动化,其逻辑指令库由供应商提供并编译进设备固件,若存在安全缺陷,可能被物理控制程序、网络服务或运行时子系统利用,导致权限绕过、内存破坏或数据泄露。现有模糊测试方法多关注协议或通用固件,难以有效覆盖 PLC 指令的语义依赖和触发条件。LogicFuzz 的核心创新在于构建语义依赖图(SDG),该图同时刻画 PLC 指令的操作语义和指令间依赖关系。结合使能信号(enable-signal)机制,LogicFuzz 能够自动合成针对特定指令的种子程序,显著减少人工构造测试用例的工作量,并支持在真实 PLC 硬件上进行可控、可重置的模糊测试。为了发现由控制流触发(即调用模式)的缺陷,LogicFuzz 通过变异 SDG 来多样化指令调用上下文;为了暴露由数据触发的故障,则在有效语义约束下进行覆盖率引导的参数变异。此外,LogicFuzz 集成了多源 oracle,通过监控运行时日志、状态 LED 和通信状态来检测模糊测试过程中指令级别的异常。作者在来自三家主要厂商的六台生产型 PLC 上进行了评估,共发现 19 个指令级缺陷,其中包含 4 个先前未知的漏洞。该研究对 PLC 安全测试、工业控制系统安全研究以及固件漏洞挖掘具有参考价值。适合关注 ICS/SCADA 安全、模糊测试方法、PLC 固件分析的读者阅读。

💡 推荐理由: PLC 是工业控制系统的核心组件,其固件指令库漏洞可能造成物理后果。LogicFuzz 首次将语义感知的 LLM 驱动模糊测试引入 PLC 逻辑指令领域,发现了真实设备中的未知漏洞,为防御者提供了针对 PLC 固件的主动安全测试思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.6
Conf: 50%
👥 作者: Hyungsub Kim, Muslum Ozgur Ozmen, Antonio Bianchi, Z. Berkay Celik, Dongyan Xu

该论文介绍了一种面向机器人的模糊测试框架 PGFUZZ(Policy-Guided Fuzzing)。研究背景在于,机器人车辆(如无人地面车辆、无人机等)依赖传感器和控制策略进行自主决策,而策略中存在的逻辑漏洞可能被攻击者利用。现有模糊测试方法主要关注内存破坏或输入校验问题,难以有效发现策略层面的缺陷。论文提出以策略为导向的模糊测试方法,通过分析机器人控制策略的决策路径,将策略条件作为引导信息,生成能触发异常行为的物理世界输入序列。框架模拟环境中的障碍物、传感器噪声等因素,并利用策略覆盖度指标来指导变异。实验在多种机器人平台(包括地面车辆和无人机)上进行,验证了 PGFUZZ 能够发现导致车辆违反安全策略(如碰撞、侧翻、非法激活防失速系统等)的输入序列。论文的主要贡献在于设计了一种可扩展的策略表示机制,并实现了从策略到模糊测试目标的自动转换,从而帮助安全工程师测试机器人策略的鲁棒性。该研究适合机器人安全、自动化测试和嵌入式系统安全方向的研究人员阅读。

💡 推荐理由: 机器人车辆的安全策略直接影响物理行为,漏洞可能导致碰撞或失控。本文首次系统性地将策略逻辑纳入模糊测试输入生成,为蓝队评估机器人系统安全性提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Suyue Guo, Stijn Pletinckx, Tianle Yu, Yigitcan Kaya, Saad Ullah, Wenbo Guo, Christopher Kruegel, Giovanni Vigna

该论文提出 PDFuzzer,一种面向 PDF 阅读器中 JavaScript 引擎的新型模糊测试工具。现有 PDF 模糊测试器(如 TypeOracle、Favocado、Cooper)主要依赖简单测试用例,仅涉及单个 API 调用,导致代码覆盖率有限,容易遗漏需要多个 API 调用按特定顺序组合才能触发的漏洞。PDFuzzer 的核心思路是利用大语言模型(LLM)从 JavaScript API 手册与执行轨迹中提取规范,自动构建上下文无关文法并推断 API 调用之间的关系,再借助约束求解器生成具体且语义正确的 API 调用序列,从而驱动模糊测试。实验在 Adobe Acrobat Reader、Foxit PDF Reader 和 PDF-XChange Editor 三款主流 PDF 阅读器上进行,与现有最先进的 PDF 模糊器和基于 LLM 的模糊器(Fuzz4All、naive LLM)对比,覆盖率最高提升 48%,并发现 31 个零日漏洞,影响从信息泄露到任意代码执行。消融实验验证了各组件(尤其 LLM)的必要性,LLM 在流水线各阶段的准确率达到 93-98%。所有漏洞均已通过协调披露流程上报厂商并获致谢赏金。该研究证明 LLM 能够自动理解复杂 API 规范并指导模糊测试,显著提升对真实世界 PDF 引擎的漏洞发现效率,为后续智能模糊测试研究提供了新思路。

💡 推荐理由: 利用 LLM 自动生成复杂 API 调用序列的模糊测试思路显著提升 PDF 引擎覆盖率并发现真实零日漏洞,对软件安全测试具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dongyeon Yu, Jiun Min, Yewan Na, Mijung Kim, Taegyu Kim, Yuseok Jeon

Rust作为一种系统编程语言,以其强内存安全性和低性能开销而闻名。通过所有权、借用等严格安全策略,Rust编译器能够保证大部分代码的内存安全。然而,在unsafe代码块中,这些安全策略并未完全启用,导致内存错误仍可能发生。尽管这类unsafe代码通常仅占整个代码库的一小部分(例如10%),但现有模糊测试工具往往对整个程序进行测试,包括已经由编译器保证安全的safe Rust代码,从而浪费了大量模糊测试资源。针对这一问题,本文提出了RustGo,一种新型的面向Rust的定向灰盒模糊测试工具。RustGo能够高效且公平地聚焦于可能包含内存错误的代码区域。其核心方法包括:利用Rust特定的静态分析自动识别潜在的内存错误目标,并精准地剪枝与每个目标无关的路径;针对每个识别出的目标,采用独立状态维护和动态剪枝策略,以实现平衡且聚焦的模糊测试。研究者在多个真实世界的Rust应用上进行了评估,结果表明RustGo平均剪枝了78.49%的无关路径,到达目标的速度比现有模糊器快2.09至5.08倍,并成功发现了13个未知错误(其中6个被分配了RUSTSEC ID,1个被分配了CVE ID)。这项工作显著提升了Rust unsafe代码安全检测的效率和效果。

💡 推荐理由: Rust的安全性依赖于unsafe代码的正确性,但现有模糊测试浪费资源。RustGo通过定向聚焦和剪枝技术,大幅提升对unsafe代码的内存错误发现效率,实证发现多个未知漏洞(含CVE)。对于依赖Rust构建安全关键系统的团队,该工具提供了一种高效的持续安全验证手段,值得关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dimitri Kokkonis, Michaël Marcozzi, Stefano Zacchiroli

该论文针对开源软件供应链中代码级后门注入的威胁提出了一种自动化检测方法 Lily。代码级后门是一种隐蔽的代码改动,通过秘密触发器授予隐藏权限,难以被发现。此前针对广泛使用项目的后门注入尝试(如恶意提交、被篡改的发布包、受污染的第三方依赖)往往仅靠运气和人工审查才被阻止。现有持续集成(CI)流水线无法检测此类攻击,而下游二进制分析工具则需要大量人工分析。Lily 将后门检测机制集成到两个环节:一是 CI 流水线,用于在代码提交阶段阻断恶意提交;二是发布审查流程,用于防止被篡改的发布包或受损依赖进入大型生态系统(如 Linux 发行版)。Lily 有两个核心贡献:第一,它增强了兼容 CI 的模糊测试(fuzzing),能够基于历史和当前软件执行来检测可疑行为的触发器,从而在 CI 和更新验证流程中实现快速且精确的后门检测;第二,它将代码变更分析与模糊测试数据相结合,即使发布更新涉及数百万行代码改动,也能精确地将维护者定位到暴露后门的代码区域。论文还概述了攻击者可能规避 Lily 的五种策略,并评估了相应的防御措施。作者在数百个良性提交/发布和带后门提交/发布的实验表明,Lily 能以较低的误报率实现高检测精度,可靠地识别恶意代码,抵抗对抗性尝试,并且能够阻止真实世界中的后门事件。

💡 推荐理由: 该研究直接回应了软件供应链中后门注入的严峻挑战,提出可集成到 CI 和发布流程的自动化检测方案,能够提升蓝队和开源维护者对恶意提交、篡改发布包和受损依赖的防御能力,具有实际部署价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Lingjing Yu, Jingli Hao, Jun Ma, Yong Sun, Yijun Zhao, Bo Luo

该论文首次系统性地研究了卫星调制解调器的安全性问题。卫星调制解调器是卫星通信网络中的关键组件,尤其是在传统透明中继卫星系统中,它决定了整个通信体制。然而,与通常更孤立、保护更好的卫星本身不同,卫星调制解调器可被攻击者接触且容易遭受低成本攻击,可能成为卫星通信安全链中的薄弱环节。作者首先对商用现货卫星调制解调器进行了物理拆解,系统检查了硬件和软件模块,并对暴露在互联网上的卫星调制解调器进行了测量研究。他们在三个攻击面——卫星通信接口、地面网络接口和硬件——上识别出16个安全漏洞。进一步地,他们引入了AirSecAnalyzer,一种针对调制解调器卫星通信接口的自动化安全分析器/模糊测试器。通过对9个真实卫星调制解调器的全面分析和大量实验,他们报告了利用这些已识别漏洞的18种新型攻击。研究成果为未来卫星调制解调器及卫星通信网络的安全性研究奠定了有价值的 foundation。

💡 推荐理由: 卫星调制解调器是卫星通信的关键环节,但其安全性长期被忽视。该研究首次揭示其脆弱性,对卫星通信安全防御具有奠基性意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yutong Zhou, Fan Yang, Zirui Song, Ke Zhang 0039, Jiongyi Chen, Kehuan Zhang

本文提出 LiftFuzz,一个用于验证二进制提升器正确性的新型框架。二进制提升器将二进制代码翻译为中间表示(IR),广泛应用于逆向工程、二进制安全分析等场景,但其开发过程复杂且易出错。现有验证方法主要关注单条指令的正确性,忽略了指令间的交互,导致难以发现复杂缺陷。LiftFuzz 首次将指令上下文感知的模糊测试引入二进制提升器验证领域。其核心思想是利用汇编语言模型(基于 GPT 架构)学习指令序列的上下文依赖关系,并据此生成多样化的测试用例。具体而言,该模型以连续指令块为输入,预测可能的后续指令序列,从而构造包含指令间交互的代码片段。LiftFuzz 将这些代码片段编译成可执行程序,并在多个目标架构(如 x86-64、ARM64)上运行,比较不同提升器输出的 IR 语义等价性。实验表明,LiftFuzz 在测试效率上显著优于基线方法(仅需基线 1/1000 的测试用例),并在主流提升器中发现了 26 个不一致性缺陷,其中包含一类此前未被报道的缺陷类型(如因寄存器别名处理不当导致的语义错误)。这些缺陷可能导致二进制分析工具产生误判,影响安全应用的可靠性。本文的贡献包括提出了上下文感知的模糊测试框架、首次将语言模型用于测试用例生成,以及实际发现并分类了提升器中的一致性缺陷。适合对二进制分析、软件测试、AI 辅助安全工具开发感兴趣的读者。

💡 推荐理由: 二进制提升器是逆向工程和二进制安全的基础工具,其错误会传导到依赖它的所有上层应用。LiftFuzz 用更少的测试用例发现更多隐藏缺陷,为提升器质量保障提供了新范式,有助于增强整个软件供应链的安全性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Anish Paranjpe, Gang Tan

解析(parsing)在软件项目中无处不在,从小型命令行工具到高安全性的网络客户端,再到大型编译器,都离不开解析器。然而,解析库的实现缺陷可能导致生成不正确的解析器,进而被恶意输入利用,引发系统崩溃或安全漏洞。本文提出了一种轻量级的验证框架Bohemia,旨在帮助解析库开发者将其作为集成测试的工具箱中的一员。该框架基于 Equivalence Modulo Inputs (EMI) 的概念,通过变异输入语法来对解析库进行压力测试。作者在多个采用不同解析算法的解析库上评估了Bohemia,发现了若干缺陷,其中一些已被开发者确认并修复。论文详细阐述了Bohemia的设计原理、实现方式以及实验结果,展示了其在提升解析库鲁棒性方面的潜力。读者可以从中了解一种基于语法变异的解析库测试方法,以及如何利用EMI技术挖掘潜在的解析器缺陷。

💡 推荐理由: 解析库的bug可能导致拒绝服务或远程代码执行,影响大量依赖解析的软件。Bohemia提供了一种自动化的轻量级验证手段,有助于在开发阶段发现并修复这类隐患,提升软件供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.6
Conf: 50%
👥 作者: Gelei Deng, Zhiyi Zhang 0005, Yuekang Li, Yi Liu 0069, Tianwei Zhang 0004, Yang Liu 0003, Guo Yu, Dongjin Wang

本文提出 NAUTILUS,一种自动化检测 RESTful API 漏洞的系统。RESTful API 在现代微服务架构中广泛使用,但其安全测试面临状态依赖、参数组合爆炸等挑战。NAUTILUS 通过解析 API 规范(如 OpenAPI)构建状态机模型,并基于符号执行和模糊测试生成有效测试用例。系统覆盖常见漏洞类型,包括 SQL 注入、路径遍历、参数篡改等。在 GitHub 上的多个真实 API 以及人工构造的基准测试中,NAUTILUS 相比于现有工具(如 RESTler、EvoMaster)发现更多漏洞,且误报率更低。实验证明其能够有效处理复杂状态依赖和深层路径探索。该研究为自动化 API 安全测试提供了新的思路,适合安全工程师和开发者在 CI/CD 流程中集成。

💡 推荐理由: REST API 是现代应用的核心攻击面,手动测试效率低且容易遗漏。NAUTILUS 提供自动化方案,能显著提升漏洞发现效率,降低人工成本。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zheyu Ma, Qiang Liu 0034, Zheming Li, Tingting Yin, Wende Tan, Chao Zhang 0008, Mathias Payer

虚拟设备是hypervisor的重要攻击面,其漏洞可能导致虚拟机逃逸甚至宿主机被攻破。现有模糊测试工具对虚拟设备的fuzzing效率有限,因为它们普遍缺乏对虚拟设备复杂行为的理解。本文提出Truman,一种新颖的通用模糊测试引擎,能够自动从开源操作系统驱动程序中推断依赖关系,构建设备行为模型(DBM),用于指导虚拟设备的模糊测试,无论目标虚拟设备是开源还是闭源。DBM包含消息间依赖、消息内依赖以及细粒度的状态依赖。基于DBM,Truman生成和变异满足依赖关系的高质量种子。在最新版本的hypervisor上评估原型,Truman在19/29个QEMU设备上覆盖率超越现有最先进的fuzzer,在virtio设备上相对Morphuzz获得34%的覆盖率提升。此外,Truman在QEMU、VirtualBox、VMware Workstation Pro和Parallels中发现了54个新bug,其中6个已分配CVE。本文方法适用于hypervisor安全研究人员和模糊测试工具开发者。

💡 推荐理由: 虚拟设备漏洞威胁云基础设施安全,Truman通过自动化模型构建提升fuzzing效率,可系统化发现潜在漏洞,对hypervisor安全性有实际提升。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianjia Yu, Zhengyu Liu, Ziyang Li, Yu Sun, Yinzhi Cao

Electron是一个广泛用于构建跨平台桌面应用的框架,它基于Web技术,由多个不同权限等级的进程组成,进程间通过消息传递通信。当进程间消息携带攻击者控制的输入时,这些输入可能在进程间传播并最终到达特权API(如命令执行),这种消息传播行为被定义为消息传播漏洞(MPVs)。利用MPV通常需要多步操作,例如先通过消息传递在某个进程中实现任意代码执行,然后利用该进程构造另一条消息在另一个进程中进行命令注入。现有工作主要关注Electron的不安全配置和恶意DOM内容,无法检测或利用需要通过复杂跨进程消息传递触发的漏洞。本文提出Proton,一个用于检测MPV的分段定向模糊测试框架。核心思想是将端到端模糊测试沿着消息传递边界分解为每个进程的分段,每个分段的目标要么是到达当前进程中的sink点,要么是将payload传播到下一个进程以探索另一进程。在后一种情况下,消息种子化下一个分段的语料库。最后,Proton合成每个进程的崩溃输入以验证端到端利用。作者在589个真实Electron应用上评估Proton,发现了23个零日MPV,其中22个导致OS命令执行,涉及GitHub stars超过50k的项目。所有发现已负责任披露,已获得13个确认、11个修复、11个CVE以及来自Vercel的漏洞赏金。

💡 推荐理由: Electron应用广泛,其多进程架构中的消息传播漏洞风险高。Proton首次系统性地检测此类漏洞,并发现大量真实零日漏洞,对保障桌面应用安全具有重要实践意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 16.5
Conf: 50%
👥 作者: Chenyang Lyu, Shouling Ji, Xuhong Zhang 0002, Hong Liang, Binbin Zhao, Kangjie Lu, Raheem Beyah

基于突变的模糊测试是发现软件漏洞的主流方法之一,但传统突变过程的高随机性导致效率低下。近年来,覆盖引导的模糊测试通过采用自适应突变策略或集成约束求解技术,在一定程度上提升了对触发独特路径和崩溃的测试用例的探索能力。然而,现有方法普遍缺乏对模糊测试历史中关键突变策略的细粒度重用,即未能有效利用不同模糊测试试验之间的历史信息。本文发现,历史测试用例中包含了导致发现独特路径和崩溃的突变策略的丰富知识,这些突变策略中隐式携带的部分路径约束解可以被重用,以加速发现具有相似部分路径约束的新路径和崩溃。基于这一发现,作者提出了一种历史驱动的突变方法(EMS),通过分析历史突变策略并重用其中的部分路径约束解,指导后续测试用例的生成,从而提升覆盖引导模糊测试的效率。实验结果表明,EMS在多个真实程序上能够显著提高代码覆盖率和漏洞发现速度。该研究为模糊测试领域提供了一种新的历史利用视角,适合安全研究者和模糊测试工具开发者阅读。

💡 推荐理由: 该研究提出了一种利用模糊测试历史信息提升漏洞发现效率的新方法,有助于安全团队更快地发现软件漏洞,降低人工分析成本。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Youkun Shi, Yuan Zhang 0009, Tianhao Bai, Feng Xue, Jiarun Dai, Fengyu Liu, Lei Zhang 0096, Xiapu Luo, Min Yang 0002

本文提出了一种名为XSSky的新型XSS漏洞检测方法,其核心思想是局部路径持久化模糊测试(Local Path-Persistent Fuzzing)。传统的XSS检测技术通常依赖于静态分析或通用模糊测试,但在覆盖率、效率以及误报率方面存在局限。XSSky通过记录和重用程序执行过程中的局部路径信息,实现更智能的测试用例生成,从而更有效地触发和识别跨站脚本漏洞。该方法首先对目标Web应用进行轻量级预分析,提取可能受XSS影响的代码路径;然后在模糊测试阶段,针对这些局部路径生成并变异payload,并确保持久化地执行关键路径上的测试。实验结果显示,XSSky在多个开源和真实世界Web应用中检测到了大量新漏洞,相比现有工具(如AFL、Domato等)在漏洞发现数量、代码覆盖率以及时间效率上均有显著提升。该研究为自动化XSS检测提供了新的思路,尤其适用于复杂前端框架构建的单页应用。

💡 推荐理由: XSS仍是Web安全中最普遍且危害最大的漏洞之一,本文提出的基于局部路径持久化模糊测试的方法能显著提升检测效率与覆盖率,对自动漏洞挖掘和防御有重要实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 16.5
Conf: 50%
👥 作者: Fabian Fleischer 0001, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

该论文提出了一个名为 GONDAR 的 sink 中心化模糊测试框架,用于在 Java 应用程序中系统性地发现安全漏洞。现有的模糊测试工具往往忽略了安全敏感 API(sink)所携带的漏洞特定知识,例如到达 sink 的程序约束和触发漏洞的利用条件。GONDAR 首先通过 CWE 特定扫描结合 LLM 辅助的静态过滤来识别可达且可利用的 sink 调用点。然后,它部署两个专门智能体:探索智能体通过迭代求解路径约束生成输入以到达目标调用点,利用智能体通过推理并满足漏洞触发条件来合成利用验证代码。这两个智能体与覆盖引导的模糊测试器协同工作,持续交换种子和运行时反馈。在真实 Java 基准测试中,GONDAR 发现的漏洞数量是当前最先进的 Java 模糊测试器 Jazzer 的四倍。此外,早期版本的 GONDAR 助力 Team Atlanta 在 DARPA AI Cyber Challenge 中获得第一名,并且已集成到 Linux 基金会 OpenSSF 的沙箱项目 OSS-CRS 中,用于分析开源 Java 项目,目前已发现一个零日漏洞。

💡 推荐理由: 该研究提出了一种将 LLM 与模糊测试深度融合的新范式,显著提升了 Java 漏洞发现效率,并已在实战中验证其有效性(发现零日漏洞)。对安全研究者和工具开发者具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sergej Dechand, Tobias Wienand, Fabian Meumertzheim, Peter Samarin, Simon Resch, Khaled Yakdan, Thorsten Holz, Flavio Toffalini

本文介绍了Jazzer,一种针对Java生态系统的覆盖率引导的模糊测试工具,专门用于发现语义漏洞。与传统的仅关注内存安全错误的模糊测试不同,Jazzer通过结合覆盖率反馈和语义分析,能够检测更高级别的逻辑缺陷,例如不正确的状态转换、业务逻辑错误以及违反隐式假设的漏洞。该方法利用Java的字节码插桩技术收集覆盖率信息,并集成了自定义的种子生成和突变策略,以提高对复杂语义漏洞的发现效率。实验在多个流行Java库(如Apache Commons、Google Guava等)上进行,结果表明Jazzer成功发现了多个先前未知的语义漏洞,且误报率较低。该工作填补了Java生态系统中高级漏洞模糊测试的空白,为安全测试人员提供了新的有效工具。

💡 推荐理由: 语义漏洞在Java应用中普遍且难以通过传统方法检测,Jazzer提供了一种自动化发现手段,能显著提升Java软件供应链的安全性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Justin Applegate, Andreas Kellas

Python原生的序列化协议pickle虽然功能强大,但存在已知的安全风险,尤其是在传输不可信数据或保存机器学习模型时。为了缓解风险,开发者通常会在反序列化时限制导入的模块,或使用静态和动态分析工具检测恶意负载。然而,这些方法依赖于对Pickle虚拟机(PVM)操作码的准确解释,而Python的三种原生PVM实现(pickle、cPickle、_pickle等)之间存在行为差异,可能导致误判或漏检。为了高效、可扩展地发现这些差异,本文提出了PickleFuzzer,一种基于生成的定制化模糊测试工具。PickleFuzzer根据自定义语法生成pickle对象,然后分别传递给不同实现,通过比较异常抛出和关键内部状态的变化来检测不一致性。它不需要规范的预言机,而是通过差分测试比较执行行为。实验发现了14个新的不一致性,其中4个是严重的安全缺陷,可绕过Hugging Face等模型托管平台使用的安全扫描工具。作者已向Python软件基金会报告了所有发现,并通过漏洞赏金平台获得750美元奖励。研究表明差分测试是发现pickle实现中安全相关差异的有效方法,为未来更定向的模糊测试提供了方向。

💡 推荐理由: pickle在AI/ML生态中广泛使用,其实现差异可能被攻击者利用绕过安全扫描,导致反序列化攻击。该研究直接揭示了现有防御的盲区,对模型托管和依赖pickle的框架有重要安全参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: Yiyang Chen, Nuoqi Gui, Long Wang, Longfei Chen, Xuanqing Shi, Xi Cao, Chao Zhang 0008

定向模糊测试(Directed Fuzzing)旨在高效地到达程序中的特定目标位置(如潜在漏洞点),但现有方法往往忽略触发条件(Triggering Conditions),即目标代码被执行所需的特定输入特征或程序状态,导致难以在复杂条件下触发深层漏洞。本文提出 TRIGFUZZ,一种触发条件引导的定向模糊测试框架。首先,通过静态分析(符号执行与约束求解)从目标代码及其上下文提取触发条件,包括输入格式、数据依赖、路径约束等。其次,设计了一个反馈驱动的输入生成机制,动态地构造满足触发条件的测试用例,并利用种子调度策略优先变异能逼近这些条件的输入。最后,在多个真实世界程序(如 libxml2, libpng, OpenSSL 等)上评估,与现有定向模糊测试工具(如 AFLGo, Hawkeye)相比,TRIGFUZZ 在到达目标位置的速度和成功率上均有显著提升,并能发现多个已知和未知的崩溃。实验证明,显式建模触发条件能有效指导模糊器绕过障碍,提高漏洞发现效率。

💡 推荐理由: 该研究提升了定向模糊测试在复杂触发条件下的有效性,有助于安全工程师更高效地挖掘需要特定输入状态才能触发的深层漏洞。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nathaniel Bennett, Tyler Tucker, Carson Stillman, William Enck, Patrick Traynor, Kevin R. B. Butler

本文提出了 Fizzle,一个用于网络协议模糊测试的确定性且可复现的框架。网络模糊测试在发现协议实现中的漏洞方面具有重要作用,但传统模糊测试工具由于随机化和非确定性执行,导致测试结果难以复现。Fizzle 通过引入确定性调度和状态记录机制,确保每次运行产生完全相同的输入序列和代码覆盖率,从而为漏洞验证和回归测试提供可靠基础。该框架支持多种网络协议的自定义变异策略,并集成了轻量级模拟器以消除环境依赖。实验表明,Fizzle 在多个真实世界协议实现(如 HTTP、DNS)上能够持续复现已知漏洞,并与现有模糊测试工具相比,运行速度损失控制在 10% 以内。主要贡献包括:1)定义确定性模糊测试的规范;2)实现可复现的变异引擎;3)开源框架以促进社区协作。

💡 推荐理由: 对于安全测试人员,可复现的模糊测试结果能显著提升漏洞验证与响应效率,减少因环境或随机性导致的误报。

🎯 建议动作: 建议安全团队评估并测试该框架在内部协议测试中的适用性,尤其是对复现性有严格要求的场景。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Fatemeh Moradihaghighi, Zihao Zhan, Yanan Guo, Ziming Zhao, Mashrur Chowdhury, Zhenkai Zhang

该论文提出了一种名为Fuzz'EMup的方法,利用电磁(EM)侧信道辐射来指导纯黑盒环境下的嵌入式固件模糊测试。随着物联网和嵌入式设备在众多领域的普及,固件安全变得至关重要。模糊测试是一种系统化发现漏洞的有效手段,而覆盖率反馈能通过引导探索提升其效果。然而,许多设备由于固件提取、插桩或精确模拟的困难,导致覆盖率信息无法获取,测试者只能进行低效的黑盒模糊测试。论文的核心挑战在于如何将原始EM测量值转化为可靠的引导信号:EM迹线噪声大,时序抖动会导致不同迹线中的对应特征在时间上偏移。作者通过结合基于活动与空闲信号对比的频带选择(activity-to-idle signal contrast)和动态时间规整(dynamic time warping)来对齐每个输入的迹线并检测持续偏差,同时通过将执行组织成基于发散时间的树形结构来保持可扩展性。在四个真实固件目标上的评估表明,EM衍生的反馈增强了路径探索,相比无引导的模糊测试实现了更高的代码覆盖率。该方法为无法获取内部状态信息的黑盒固件测试提供了新的解决方案。

💡 推荐理由: 对于安全从业者,该方法在无法获取固件源码或进行插桩的嵌入式设备上,开创了利用侧信道信号提升模糊测试效率的实用路径,有望发现传统黑盒测试难以触及的漏洞。

🎯 建议动作: 研究跟进,评估该技术对自身负责的嵌入式设备安全测试流程的潜在改进。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
推荐 11.5
Conf: 50%
👥 作者: Moritz Schloegel, Nils Bars, Nico Schiller, Lukas Bernhard, Tobias Scharnowski, Addison Crump, Arash Ale Ebrahim, Nicolai Bissantz, Marius Muench, Thorsten Holz

过去十年中,模糊测试已被证明是一种高效的软件漏洞发现方法。自AFL引入轻量级覆盖率反馈这一开创性概念以来,模糊测试领域涌现了大量科学工作,提出了新技术、改进了现有策略的方法论方面,或将现有方法移植到新领域。所有这些工作都需要通过展示其解决问题的适用性、测量性能,并通过深入的经验评估证明其相对于现有工作的优越性。然而,模糊测试对其目标、环境和条件高度敏感,例如测试过程中的随机性。毕竟,依赖随机性是模糊测试的核心原则之一,控制着模糊器行为的许多方面。结合往往难以控制的环境,实验的可重复性成为一个关键问题,需要谨慎的评估设计。为了应对这些有效性威胁,一些工作,尤其是Klees等人的《Evaluating Fuzz Testing》,已经概述了如何精心设计评估设置,但其建议在实践中被采纳的程度仍不清楚。本文系统分析了2018年至2023年间顶级会议上发表的150篇模糊测试论文的评估方法。我们研究了现有指南的实施情况,并观察到潜在的不足和陷阱。我们发现,现有指南在统计检验方面被惊人地忽视,且模糊测试评估中存在系统性错误。例如,在调查报告的漏洞时,我们发现对真实世界软件中漏洞的搜索导致了作者请求并接收了质量可疑的CVE。将我们的文献分析扩展到实践领域,我们尝试复现八篇模糊测试论文的声称。这些案例研究使我们能够评估模糊测试研究的实际可重复性,并识别评估设计中的典型陷阱。不幸的是,我们的复现结果揭示了所研究论文中的若干缺陷,我们无法完全支持和复现相应的声称。为帮助模糊测试领域迈向科学上可重复的评估策略,我们提出了更新后的评估指南,供未来工作遵循。

💡 推荐理由: 模糊测试评估的严谨性直接影响科研成果的可信度和实际应用价值。本文揭示了当前评估实践中的系统性缺陷,并提出改进指南,对模糊测试研究人员和从业人员均有重要参考意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaizheng Liu, Ming Yang 0001, Zhen Ling 0001, Yue Zhang 0025, Chongqing Lei, Junzhou Luo, Xinwen Fu

该论文提出了一种名为RIoTFuzzer的新型黑盒模糊测试方法,旨在远程发现物联网设备漏洞。由于IoT系统架构和外设的多样性,黑盒模糊测试是发现漏洞的首选方案,但现有工具依赖伴侣应用生成有效测试包,却面临无法绕过云服务器端验证以及仅关注Android伴侣应用中Java组件而忽略非Java组件(如基于JavaScript的小程序)的局限性。RIoTFuzzer专门针对由一体化应用(All-in-one Apps)中JavaScript小程序驱动的IoT设备,通过文档式控制命令提取、混合分析变异点识别以及侧信道引导的模糊测试三大技术,实现对IoT设备的远程模糊测试。文档式控制命令提取从伴侣应用的UI文档中解析控制命令;混合分析结合静态与动态分析识别可变异点;侧信道反馈(如设备响应时间)引导模糊测试方向,提高效率。作者在主流平台的27款IoT设备上应用RIoTFuzzer,发现了11个漏洞,均获得厂商确认,其中8个漏洞已确认并分配了4个CVE编号。实验表明,侧信道引导模糊测试平均提升76.62%的测试包发送效率,最高提升362.62%。该方法显著增强了物联网设备漏洞挖掘的覆盖面和有效性。

💡 推荐理由: 该方法解决了现有黑盒模糊测试工具无法绕过云验证和忽视非Java组件的痛点,大幅提升了IoT设备远程漏洞发现效率,对IoT安全测试具有实用价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sergej Schumilo, Cornelius Aschermann, Ali Abbasi 0002, Simon Wörner, Thorsten Holz

该论文提出并实现了 NYX,一种针对超管理器(Hypervisor/VMM)的高性能、覆盖引导的模糊测试工具。超管理器负责隔离同一物理机上不同虚拟机(VM)的安全边界,恶意用户若能在云 VM 上运行自己的内核,则可攻击大量攻击面,一旦利用成功将完全控制宿主机的所有 VM。因此,高效检测超管理器漏洞对现代云基础设施安全至关重要。现有研究表明,盲目模糊测试因测试吞吐量极高而成为最有效的方法。然而,NYX 通过引入快速快照恢复机制,实现了每秒数千次的重载被测系统,显著提升了性能。此外,作者提出了一种基于自定义字节码程序(编码为有向无环图 DAG)和仿射类型(affine types)的新型变异引擎,能够灵活表达复杂交互。评估结果显示,虽然 NYX 的吞吐量低于最先进的盲目模糊测试器,但在简单目标上表现相当,仅需稍长时间达到相同覆盖率。对于复杂设备,NYX 显著优于现有工作。更重要的是,NYX 发现了大量新漏洞:总计 44 个新 bug,其中 22 个已申请 CVE。实验证明覆盖引导的价值巨大,即使盲目模糊测试器可能更快。该研究适合超管理器开发者、云安全工程师、模糊测试研究人员阅读。

💡 推荐理由: 超管理器漏洞可导致云平台完全沦陷,NYX 以创新的快照恢复和基于仿射类型的变异引擎,大幅提升了复杂设备的漏洞发现能力,对云基础设施安全防御具有重要指导意义。

🎯 建议动作: 研究跟进:评估 NYX 在自身超管理器测试中的适用性,并考虑集成其覆盖引导与变异引擎技术。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiameng Shi, Wenqiang Li, Wenwen Wang 0001, Le Guan

该论文提出了一种名为 IPEA 的非侵入式动态固件测试框架,专门针对深度嵌入式设备(如基于微控制器 MCU 的物联网设备)的固件测试挑战。这类设备通常资源受限,运行环境与通用计算机差异巨大,导致现有动态测试技术难以直接应用。IPEA 的核心洞察是利用微控制器设备在固件开发阶段的独特位置:开发者通常需要借助功能强大的工程工作站来编程和调试目标设备。因此,IPEA 将资源密集型分析任务从微控制器卸载到工作站,仅在固件中保留轻量级的“探针”(needle probes)来采集内部执行信息,而不进行本地处理。这种解耦设计使得分析的性能开销被显著降低。论文还基于 IPEA 框架实现了两个具体工具:基于指针能力(pointer capability)的消毒器 IPEA-San 和灰盒模糊测试器 IPEA-Fuzz。IPEA-San 用于检测内存安全错误,通过与移植到微控制器的 AddressSanitizer 对比,在真实固件上内存开销降低了 62.75%,且检测精度更高。IPEA-Fuzz 结合 IPEA-San 进行模糊测试,在流行的 IoT 库(3个)和外设驱动代码(4个)中发现了 7 个零日漏洞。该工作展示了非侵入式动态分析在嵌入式固件测试中的巨大潜力,为安全研究人员和固件开发者提供了一种高效、低成本的漏洞发现方法。

💡 推荐理由: 嵌入式固件漏洞难以通过传统动态测试发现,而该框架通过将分析任务卸载到工作站,大幅降低了资源消耗,使得在受限设备上进行高效漏洞挖掘成为可能,填补了物联网安全测试的重要空白。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 14.5
Conf: 50%
👥 作者: Tae Eun Kim, Jaeseung Choi 0002, Kihong Heo, Sang Kil Cha

本文提出了一种名为DAFL的定向灰盒模糊测试方法,旨在通过数据依赖关系引导模糊测试过程,提高对特定目标代码区域的覆盖率和漏洞发现效率。传统的灰盒模糊测试通常依靠覆盖率反馈来探索程序,但在定向场景下(如针对特定补丁或关键函数),随机探索效率低下。DAFL利用静态分析构建程序的数据依赖图,并设计了一种新的种子优先级策略,优先选择能够更快触发目标位置依赖链的输入。同时,DAFL结合了符号执行和约束求解技术,以生成能够满足依赖条件的测试用例。实验在多个真实世界程序上进行了评估,包括libpng、libjpeg等,结果表明DAFL在到达指定目标代码位置和发现相关漏洞方面,相比现有定向模糊测试工具(如AFLGo、Hawkeye)具有显著优势,平均加速比达到2-3倍。此外,DAFL还成功发现了多个未知漏洞,证明了其实际有效性。本文的主要贡献包括:首次将数据依赖分析系统性地融入定向模糊测试的种子调度和变异过程;提出了轻量级的依赖图构建方法,避免了过度开销;并开源了实现代码,便于社区复现和扩展。

💡 推荐理由: 定向模糊测试在漏洞复现、补丁验证和关键代码审计中至关重要。DAFL通过数据依赖引导,显著提升了到达目标代码的效率,有望加速安全研究人员的分析工作,并为自动化漏洞发现提供新的思路。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alexander Bulekov, Bandan Das, Stefan Hajnoczi, Manuel Egele

该论文提出了一种名为FUZZNG的新型内核模糊测试方法,旨在解决现有操作系统模糊测试工具(如Syzkaller)依赖手动编写的系统调用接口描述(语法规则)的扩展性问题。Syzkaller需要为每个内核接口提供精确且详细的语法描述,这限制了其可扩展性,并且手动创建这些描述非常耗时。FUZZNG利用内核设计的基本特性(例如系统调用编号和文件描述符)来重塑和简化模糊器的输入空间,从而无需复杂的系统调用接口描述即可工作。具体来说,FUZZNG只需要一个小的配置文件,包含要探索的文件列表和系统调用编号,即可开始测试。作者在Linux内核上实现了FUZZNG,并在10个已有Syzkaller详细描述的Linux组件上进行了测试。实验结果表明,FUZZNG平均达到了Syzkaller覆盖率的102.5%,并且发现了9个新漏洞,其中5个位于Syzkaller已经模糊测试多年的组件中。此外,FUZZNG的配置文件大小仅为Syzkaller手动编写语法的1.7%以下,且不需要初始种子输入或专家指导。该工作为内核模糊测试提供了一种更轻量级、更易扩展的方法,尤其适用于快速评估新内核组件或接口的安全性。

💡 推荐理由: 传统内核模糊测试依赖大量手动工作,FUZZNG通过消除对系统调用描述的需求,大幅降低了测试门槛,提高了可扩展性。对于安全团队,这意味着可以更快速地覆盖内核新接口,发现潜在漏洞。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Giovanni Vigna

定向模糊测试旨在将模糊器导向用户定义的目标函数以发现漏洞,但经常在长时间运行后仍无法触发崩溃。本文识别了两个关键挑战:一是间接调用的静态分析不完整,导致基于距离的引导无法发现可达路径;二是缺乏对崩溃前提条件的语义引导,使得盲目变异在合理时间预算内无法满足这些条件。自然的干预点是初始种子语料库:编码正确控制流路径并满足关键崩溃前提条件的种子可以将模糊测试从盲目探索转变为局部优化。现有的种子生成方法均未同时解决这两个问题:基于语法和格式的方法生成结构有效但无目标感知的输入,而基于LLM的方法要么缺乏目标定位,要么通过单次提示继承了静态分析的局限性。本文提出SeedSmith,一个智能LLM流水线,模拟安全分析师的工作流程:从目标函数出发,迭代探索代码库,解析间接调用,识别崩溃前提条件,并合成满足这些条件的具体输入。由于SeedSmith作为种子生成前端运行,其种子与模糊器无关,可无修改地改进任何下游基于变异的模糊器。在Magma基准测试中,使用SeedSmith种子的模糊器相比默认种子,崩溃时间几何平均加速达到11.51倍(AFL++)到14.66倍(AFLGo)。在ARVO上,SeedSmith使模糊器触发了跨越10个项目的16个先前不可达的bug,涵盖多种输入格式。

💡 推荐理由: SeedSmith针对定向模糊测试效率低下的根源问题,提出了一种实用的种子合成方法,显著提升了漏洞发现效率。对于安全工程师和模糊测试研究人员来说,该方法有望缩短漏洞挖掘周期,并适用于多种输入格式和项目。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 16.5
Conf: 50%
👥 作者: Kunpeng Zhang, Xiaogang Zhu 0001, Xi Xiao 0001, Minhui Xue 0001, Chao Zhang 0008, Sheng Wen

本文针对基于突变的模糊测试(fuzzing)中字节重要性量化不足的问题展开研究。现有方法通常关注输入字节与路径约束的关系,但忽略了并非所有与约束相关的字节都能发现新代码。作者通过Shapley值分析发现,不同字节位置对模糊测试性能的贡献存在差异,且这种差异在不同种子间具有一致性。基于这一观察,提出ShapFuzz,一种通过Shapley值指导字节选择和突变的模糊测试方案。具体地,ShapFuzz在每次输入测试时以低开销更新字节的Shapley值,并利用上下文多臂老虎机(Contextual Multi-Armed Bandit)在突变高Shapley值字节和低频率被选中的字节之间进行权衡。基于AFL++实现原型,并与10个最先进的模糊测试器(包括5个字节调度增强型模糊测试器和5个常用模糊测试器)进行对比。实验结果表明:与字节调度增强型模糊测试器相比,ShapFuzz在三组不同初始种子集上发现了更多的新边(edges)和暴露了更多的漏洞;与常用模糊测试器相比,ShapFuzz在MAGMA基准上比最佳对比模糊测试器多暴露20个漏洞,并发现6个额外的CVE。此外,在最新版本的程序中发现了11个新漏洞,其中3个已得到供应商确认。该研究为模糊测试中的字节重要性量化提供了新视角,有效提升了模糊测试的代码覆盖和漏洞发现能力。

💡 推荐理由: 本文提出了一种基于Shapley值指导字节选择的新型模糊测试方法ShapFuzz,在漏洞发现效率上显著优于现有方案,有助于安全测试人员更高效地挖掘软件缺陷。其核心思想可迁移至其他基于突变的测试场景。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xing Zhang, Zikang Huang, Gang Yang, CongChong Wang, Lu Liu, Bin Yin, Mingyi Wang, Ziquan Zhao, Min Li, Zhenyu Chen, Bo Wu, Lingyun Ying

该论文提出 SynapseFlow,一种基于状态机引导的自动化模糊测试 harness 生成工具,旨在解决现有大语言模型(LLM)单轮生成方法中因函数粒度过粗和生成流程错位导致的幻觉及覆盖率不足问题。SynapseFlow 的创新包括两点:一是数据流感知的函数聚合,通过分析源代码构建结构流图(Structural Flow Graph)并提取连贯的函数三元组(Function Triplets);二是采用分阶段且支持回滚的生成工作流分解,将 harness 合成过程分为四个阶段,并由分阶段回滚算法确保正确性。在 25 个真实世界开源软件项目上的实验表明,SynapseFlow 在分支覆盖率和漏洞发现率上显著优于现有工具(OSS-Fuzz-Gen、CKGFuzzer、PromeFuzz),分支覆盖率分别提升 3.07、1.71、4.26 倍,漏洞发现率分别提升 1.77、1.51、1.36 倍。更重要的是,SynapseFlow 发现了 7 个此前未报告的漏洞(其中 5 个已分配 CVE),证明了其在真实场景中的实用效果。该研究适合安全测试工程师、模糊测试研究人员和 LLM 自动化工具开发者阅读。

💡 推荐理由: 高质量 fuzz harness 是高效灰盒模糊测试的关键瓶颈,SynapseFlow 利用 LLM 结合数据流分析与分阶段工作流,显著提升了自动化生成质量,并在真实项目中发现了多个新漏洞,证明了实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.6
Conf: 50%
👥 作者: Zezhong Ren, Han Zheng 0006, Zhiyao Feng, Qinying Wang, Marcel Busch, Yuqing Zhang 0001, Chao Zhang 0008, Mathias Payer

内核模糊测试是发现内核漏洞的有效手段,但现有工具如Syzkaller过度追求代码覆盖率,导致低频代码区域测试不足。本文提出SYSYPHUZZ,一种面向代码频率的内核模糊器,旨在提升对未充分测试代码区域的探索。首先,通过对Linux内核中Syzkaller的精细评估,揭示了代码覆盖不平衡的问题。SYSYPHUZZ引入两个关键技术:选择性任务调度(Selective Task Scheduling)动态优先管理探索任务,避免任务爆炸;上下文保持突变(Context-Preserving Mutation)减少对低频系统调用上下文依赖的破坏。与Syzkaller和SyzGPT的对比实验表明,SYSYPHUZZ显著减少了未探索代码区域,发现31个被Syzkaller遗漏和27个被SyzGPT遗漏的独特bug,并发现5个被持续运行的Syzbot遗漏的漏洞。将SYSYPHUZZ与SyzGPT集成后,新工具SyzGPTsysy多发现33%的独占bug,证明了其增强效果。所有漏洞已负责任披露,代码已开源。该研究为内核模糊测试提供了新方向,有望提升Linux内核的安全性。

💡 推荐理由: 内核漏洞是高危目标,传统覆盖率导向的模糊测试已陷入瓶颈。SYSYPHUZZ从代码频率角度切入,可发现大量被现有工具遗漏的漏洞,对提升内核安全性有直接价值,值得安全研究人员和内核开发者关注。

🎯 建议动作: 关注SYSYPHUZZ开源项目,评估将其集成到内部内核模糊测试流程的可能性,以增强对低频代码区域的覆盖。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yu-De Lin, Nils Ole Tippenhauer

本文针对模糊测试中反馈收集的局限性问题展开研究。在传统模糊测试中,通常需要能够观察和插桩二进制程序中的基本块以获取执行反馈,从而指导输入生成。然而,在许多实际场景中,例如对黑盒设备进行原位模糊测试或对经过混淆编译的二进制进行测试时,无法直接收集这类反馈。为解决这一挑战,作者提出了基于运行时执行轨迹构建控制流图(CFG)类似结构的方法,以从执行轨迹中推导反馈信息。首先,作者介绍了一种简单的分歧检测方法,用于识别唯一的执行轨迹;随后,提出了一种改进的基于执行分歧图(Execution Divergence Graph, EDG)的方法。EDG 能够更有效地处理循环中的重复代码执行等特殊问题,并构建出更精细的反馈信号。作者实现了这两种方法,并在一系列基准测试和混淆目标上进行了实验。结果表明,与纯盲模糊测试器相比,基于 EDG 的方法显著提高了代码覆盖率和漏洞发现效率。此外,作者还展示了该方法在无法进行静态插桩的场景下的有效性。尽管本文研究的场景假设攻击者可以直接观察完整的指令轨迹,但该方案同样可应用于其他反馈通道(如功耗分析)的场景。本文的主要贡献在于提出了一种无需静态插桩即可从执行轨迹中提取反馈的新方法,并验证了其在模糊测试混淆二进制和黑盒设备中的有效性,为安全测试领域提供了一种实用的替代方案。

💡 推荐理由: 该研究为黑盒设备模糊测试和混淆二进制测试提供了新的反馈机制,无需静态插桩即可实现高效的引导式模糊测试,对安全测试工程师在受限场景下发现漏洞具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Daniel Klischies, Dyon Goos, David Hirsch 0001, Alyssa Milburn, Marius Muench, Veelasha Moonsamy

蜂窝基带固件是现代移动设备的核心安全组件,但对其进行安全测试极具挑战。现有仿真器因无法完整模拟数字信号处理器(DSP)、SIM卡、射频前端等复杂外设,导致测试覆盖度有限,模糊测试(fuzzing)只能发现浅层漏洞。本文提出BaseBridge,一种全新的基带仿真方法,通过从真实设备的物理内存转储中提取并恢复关键状态,显著提升仿真逼真度。BaseBridge原型支持联发科(MediaTek)和三星(Samsung)两大主流厂商的基带固件,在评估中能够正确响应97%的RRC和NAS协议消息,代码覆盖度平均提升2.41倍(三星)和5.54倍(联发科),并通过多项LTE一致性测试。基于该仿真的模糊测试进一步显示:整体覆盖度提升2.3~5倍,针对所关注的协议功能区域覆盖度提升9.0~22.5倍。BaseBridge共发现5个新漏洞,已向受影响厂商披露。该方法突破了传统仿真器的外设支持瓶颈,为基带固件的大规模、高保真安全测试开辟了新路径。

💡 推荐理由: 蜂窝基带漏洞可导致远程窃听、拒绝服务等严重攻击,而现有测试手段覆盖不足。BaseBridge通过高保真仿真大幅提升漏洞发现能力,为防御者提供了更有效的基带固件安全评估工具,有助于提前发现并修复高危缺陷。

🎯 建议动作: 建议关注该研究的技术细节,评估其是否适用于内部基带安全测试流程,并考虑与厂商合作扩展支持更多基带平台。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Dakshina Tharindu, Sahan Sanjaya, Philip Baptist, Prabhat Mishra

本文提出 PowerFuzz,一种基于功耗侧信道测量的统计黑盒固件模糊测试框架。其核心动机是:许多嵌入式系统的固件或二进制文件不公开,导致无法使用依赖执行反馈(如分支覆盖率)的灰盒模糊器。PowerFuzz 无需目标固件的任何内部可见性,仅通过测量固件运行时的功耗迹线来推断执行路径。为了解决黑盒模糊中确定执行分支的挑战,作者采用滑动窗口结合增长窗口的全迹线相关方法,利用功耗迹线识别分支行为,并构建固件的高层控制流图。该控制流图用于引导模糊器生成测试用例,探索未覆盖的执行路径。实验在三个嵌入式硬件平台(如 ARM Cortex-M 系列)和十个固件基准测试上进行,结果表明 PowerFuzz 的分支覆盖率与灰盒模糊器相当(差距在 13.5% 以内),且显著优于现有的黑盒模糊器(最高提升 22%)。该方法为闭源固件安全测试提供了一种实用且有效的途径。

💡 推荐理由: 本方法解决了闭源固件无法使用灰盒模糊的痛点,利用功耗侧信道实现黑盒环境下的分支覆盖引导,显著提升了黑盒模糊测试效率,对 IoT 和嵌入式设备安全评估具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Xinyang Ge, Ben Niu 0007, Robert Brotzman, Yaohui Chen 0001, HyungSeok Han, Patrice Godefroid, Weidong Cui

该论文提出 HyperFuzzer,一种针对虚拟机监控器(hypervisor)中CPU虚拟化实现的高效混合模糊测试工具。在云计算时代,hypervisor 的安全性至关重要,尤其是 CPU 虚拟化模块,它运行在最高特权级,漏洞可能导致整个云平台被攻破。传统黑盒和灰盒模糊测试因搜索空间巨大(涉及数千条指令、复杂交互状态)而只能发现浅层错误;白盒模糊测试(符号执行)虽能进行系统性分析,但现有实现依赖于慢速的硬件模拟器,无法扩展到真实规模。HyperFuzzer 创新地结合了三种技术:灰盒模糊测试用于快速覆盖新代码路径,白盒符号执行对关键模块进行深度分析,以及一个轻量级虚拟 CPU 模型来加速符号执行并避免硬件模拟器瓶颈。核心贡献包括:(1)设计了一种混合测试框架,在灰盒与白盒之间自适应切换,优先探索高风险区域;(2)提出可增量更新的虚拟 CPU 模型,准确刻画指令语义且开销低;(3)在多个主流 hypervisor(如 KVM、Xen)上进行了评估,结果表明 HyperFuzzer 比纯灰盒工具发现深层漏洞的效率提升 10 倍以上,并找到了若干之前未知的虚拟 CPU 漏洞。该方法适用于 hypervisor 安全测试、操作系统内核虚拟化单元测试,以及任何需要深度指令级验证的场景。本文供 hypervisor 开发者、安全研究员以及云平台安全团队参考。

💡 推荐理由: 虚拟 CPU 是 hypervisor 最核心且最难测试的组件,HyperFuzzer 提出了一种可落地的混合模糊测试方案,显著提升了深层漏洞发现效率,对云安全防御具有直接实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Ali Ranjbar, Tianchang Yang, Kai Tu, Saaman Khalilollahi, Syed Rafiul Hussain

基带固件是蜂窝通信中的关键组件,但因其专有、闭源以及状态化处理逻辑的复杂性,系统性安全测试面临巨大挑战。现有方法往往忽视基带任务间的依赖关系和输入处理逻辑的状态性,导致测试覆盖有限且效率低下。本文提出 Loris,一种针对商业基带固件的状态化模糊测试框架。Loris 采用迭代符号分析技术,逐步识别协议状态变量及其上的谓词,从而定义不同协议状态,同时缓解状态爆炸问题。这使得 Loris 能够对具有高漏洞潜力的程序区域进行定向探索和模糊测试。研究者在来自两家主流厂商的 5 款商用设备上评估了 Loris,覆盖 4G LTE 和 5G NR 两种制式,验证了其广泛适用性。测试共发现 7 个新漏洞,攻击者可通过空中接口利用这些漏洞,导致基带崩溃、远程代码执行或拒绝服务。该工作为基带固件安全测试提供了新思路,填补了状态化分析在闭源固件上的空白。

💡 推荐理由: 基带固件漏洞直接影响移动通信安全,Loris 框架能够有效发现传统方法遗漏的状态相关漏洞,对防御者理解新型攻击面和提升测试能力具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jingcheng Yang, Enze Wang, Jianjun Chen 0005, Qi Wang 0094, Yuheng Zhang, Haixin Duan, Wei Xie 0007, Baosheng Wang

本文提出了一种名为JWTeemo的自动化测试方法论,用于系统性地发现JSON Web Token (JWT) 实现中的安全漏洞。JWT作为分布式Web应用中广泛使用的认证和授权标准,其实现常存在签名验证绕过、令牌伪造、拒绝服务等漏洞。此前的研究多为单个漏洞报告,缺乏系统性分析。作者基于JWT规范(RFC 7515等)和常见实现错误,设计了JWTeemo,它通过构造畸形的JWT令牌(如修改签名算法、使用无效密钥、伪造头部等)来测试实现的鲁棒性。作者在10种主流编程语言的43个JWT实现上进行了评估,共发现31个此前未知的安全漏洞,其中20个已分配CVE编号。这些漏洞的影响包括:在Kubernetes中可实现认证绕过(由于Kubernetes使用JWT进行API服务器认证),以及在Apache James中可发起拒绝服务攻击。作者将漏洞归纳为五类:签名验证绕过、令牌伪造、DoS、密钥管理缺陷、算法混淆。针对每类漏洞,提出了缓解策略,并与IETF进行了讨论,IETF已承认这些发现并计划在新RFC中采纳缓解措施。此外,研究团队向受影响的供应商报告了漏洞,收到了Apache、Connect2id、Kubernetes、Let's Encrypt、RedHat等的确认和赏金奖励。该研究适合安全研究人员、JWT库的开发者以及依赖JWT的Web应用安全工程师阅读。

💡 推荐理由: JWT是当今Web应用身份认证的基石,但其实现漏洞可能导致严重的安全后果。该研究首次系统性地评估了多语言JWT库,发现了大量高危漏洞(包括CVE),并推动了IETF RFC的改进,对业界具有直接指导意义。

🎯 建议动作: 研究跟进:安全团队应关注JWTeemo工具或类似方法,对内部使用的JWT库进行测试;评估并修补已知CVE。

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaoyue Ma, Lannan Luo, Qiang Zeng 0001

该论文针对Matter智能家居物联网协议的安全测试问题展开研究。Matter协议由连接标准联盟(CSA)维护,其规范文档长达上千页,复杂且庞大,导致传统模糊测试方法难以有效覆盖隐藏漏洞。作者提出了一种基于大语言模型(LLM)辅助的模糊测试方法,利用LLM理解和解析协议规范文本,自动生成语义正确且边界覆盖更广的测试用例。具体步骤包括:使用LLM从规范中提取协议状态机、消息格式和字段约束;基于这些信息构造结构化测试输入;驱动真实的Matter设备进行执行并监控异常。实验在多个商用Matter设备上开展,成功发现了15个之前未知的漏洞,其中多个涉及协议实现中的状态处理错误和输入验证缺失。该工作表明,LLM能够有效桥接自然语言规范和底层实现之间的鸿沟,显著提升物联网协议模糊测试的深度和效率。

💡 推荐理由: Matter协议旨在统一智能家居设备互联,其安全性至关重要。本文提出的LLM辅助Fuzzing方法可自动挖掘协议实现中的隐蔽漏洞,对保障物联网生态安全具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ting Yang, Yue Qin, Lan Zhang 0008, Zhiyuan Fu, Junfan Chen, Jice Wang, Shangru Zhao, Qi Li 0002, Ruidong Li 0001, He Wang 0014, Yuqing Zhang 0001

蓝牙低功耗(BLE)已成为现代物联网设备的核心通信标准,但其协议设计的复杂性导致了许多逻辑缺陷,例如字段解析语义歧义或无效状态转换,可能被利用实现认证绕过、未授权控制或拒绝服务(DoS)攻击。现有黑盒模糊测试工具通常基于随机变异或简单语法,无法深入触及协议语义层面的不一致性。为此,本文提出BSFuzzer——一种基于上下文感知语义的BLE逻辑缺陷模糊测试框架。BSFuzzer创新地利用大语言模型(LLM)智能体从蓝牙核心规范文本和图中自动提取状态机与数据包语义,生成两种变异类型:违反协议规则的字段级变异和破坏关键状态转换的状态级变异。这些变异被组合为结构化测试序列并在目标设备上执行。LLM智能体进一步用于验证设备响应是否符合预期行为,从而发现传统工具难以捕获的细微逻辑缺陷。实验在19个真实BLE设备(包括9个系统级芯片(SoC)模块和10部智能手机)上进行,共发现36个安全问题,其中34个为先前未知漏洞,9个已分配CVE编号。两个关键漏洞被主流厂商通过漏洞赏金计划确认。结果表明,BSFuzzer在基于LLM的规范分析(准确率高达97%)和响应验证(准确率高达85.8%)方面表现优异,相比四种最先进的BLE漏洞检测工具,代码覆盖率提升9.34%,并暴露了更广泛类型的漏洞,证明其在揭示BLE协议实现深度解释不一致性方面的有效性。

💡 推荐理由: BSFuzzer利用LLM理解协议规范,自动生成语义敏感的测试用例,能发现传统模糊测试难以触及的BLE逻辑缺陷,为蓝队评估BLE设备安全性提供了全新且高效的方法。

🎯 建议动作: 研究跟进BSFuzzer方法,评估将其集成到BLE安全测试流程的可行性。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 14.5
Conf: 50%
👥 作者: Zhenpeng Lin, Yueqi Chen 0001, Yuhang Wu 0003, Dongliang Mu, Chensheng Yu, Xinyu Xing 0001, Kang Li

在 Linux 内核安全领域,动态测试工具(如 fuzzing)已加速漏洞发现,但这些工具生成的报告通常只展示触发漏洞时的单一错误行为(如空指针解引用、缓冲区溢出等)。安全分析师依赖该错误推断漏洞的可利用性,进而决定漏洞修复优先级。然而,同一漏洞通过不同路径或在不同上下文中触发,可能表现出多种不同的错误行为,从而影响其利用潜力的评估。仅凭单一报告可能低估漏洞风险。 为解决该问题,本文提出 GREBE(内核模糊测试工具),其核心创新在于对象驱动(object-driven)的内核模糊测试技术。与传统的代码覆盖率驱动的 fuzzing 不同,GREBE 聚焦于有 bug 的代码片段,通过智能变异输入来探索各种上下文和路径,使同一漏洞展现多种错误行为。具体而言,它通过分析漏洞代码访问的内核对象及其状态,生成多样化的测试用例,以触发不同错误表现。 实验在 60 个真实 Linux 内核漏洞上评估 GREBE。结果显示,相比原始报告,GREBE 平均为每个漏洞额外发现超过 2 种错误行为;其中 26 个漏洞被揭示具有更高的利用潜力(即可能被攻击者利用)。此外,研究人员将部分被误判为低风险的漏洞报告给内核厂商,促使厂商紧急应用补丁。 论文的主要贡献在于:1)提出一种新的内核 fuzzing 思路,从单一错误扩展到多错误行为评估;2)设计并实现对象驱动的模糊测试框架;3)通过大规模实验证明该方法能显著提升漏洞利用性评估的准确性。适合内核安全研究人员、漏洞分析师以及 SOC 团队阅读,以改进漏洞优先级排序。

💡 推荐理由: 帮助蓝队和漏洞分析师摆脱对单一错误报告的依赖,更准确地评估内核漏洞的实际威胁,避免因低估风险而导致未及时修复的高危漏洞被攻击者利用。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Jie Liang 0006, Mingzhe Wang, Chijin Zhou, Zhiyong Wu 0010, Yu Jiang 0001, Jianzhong Liu, Zhe Liu 0001, Jiaguang Sun 0001

本文提出了一种名为PATA的模糊测试工具,其核心创新在于实现了路径感知的污点分析技术。传统污点分析在处理真实程序中的循环结构时,难以区分同一变量在循环中多次出现的约束条件。PATA通过以下步骤解决该问题:首先,识别约束中使用的变量,并构建代表变量序列(RVS),该序列包含所有代表性约束变量的出现及其值;其次,扰动输入,将扰动后的RVS与原始RVS匹配,通过值变化识别影响每个RVS条目的输入字节;最后,变异对应的输入字节以求解给定路径上的约束。实验在Google的fuzzer-test-suite、LAVA-M以及多个开源项目上评估,与AFL、MOPT、TortoriseFuzz、VUzzer、Angora、Redqueen和Greyone等先进模糊测试工具对比。在Google测试套件上,PATA发现的唯一路径数量和覆盖的基本块数量分别比其他领先模糊测试工具高出29%–1830%和7%–87%,并发现了更多漏洞,包括17个未列出的漏洞。在LAVA-M上,PATA在所有评估的模糊测试工具中表现最佳,发现了2602个漏洞。在开源项目中,PATA发现了40个以前未知的漏洞,其中12个已确认为CVE。

💡 推荐理由: 该研究提出了一种新颖的路径感知污点分析方法,显著提升了模糊测试在复杂程序(尤其是含循环结构)中的约束求解能力和漏洞发现效率,对改进模糊测试技术有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Han Zheng, Qinying Wang, Qiang Liu, Mathias Payer

该论文是系统化知识(SoK)研究,旨在对现代Web浏览器的低层攻击面进行系统化分类和分析。背景是:浏览器作为远程攻击面,内存破坏漏洞在真实世界利用中仍占核心地位。尽管过去十年已有大量浏览器测试和漏洞披露工作,但社区仍缺乏一个明确的、防御导向的低层攻击面系统化框架。先前SoK论文调查了浏览器漏洞和缓解技术,但视角碎片化,未回答一个核心问题:现代Web浏览器的低层攻击面如何结构化?哪些部分在现有安全测试中尚待探索?为回答该问题,作者提出三个子问题:(RQ1)浏览器的攻击面如何沿输入类和组件结构化?(RQ2)内存破坏漏洞在该分类中出现在何处?(RQ3)这些攻击面模式对现有浏览器安全测试有何启示?针对RQ1,作者推导出一个架构驱动的“输入×组件×权限”分类法,将浏览器架构抽象为统一视图。针对RQ2,他们将2016年至2025年间公开的2233个内存破坏报告映射到该分类法上。针对RQ3,他们将过去十年的学术浏览器模糊测试器(按目标输入类分类)叠加到bug密度图上。系统化工作揭示:当前测试集中在已充分探索的组件,而bug密集、高影响的攻击面测试不足。此外,他们识别出三个与学术工作正交的模糊测试部署缺口。该工作为未来的浏览器安全研究提供了结构化基础。

💡 推荐理由: 该研究系统化地绘制了浏览器低层攻击面的结构图谱,揭示了当前安全测试的盲点,有助于蓝队和浏览器开发者优先加固最易受攻击的组件,优化模糊测试资源投入。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ruixiang Qian, Ding Yang, Zengxu Chen, Yuxuan Gao, Chunrong Fang, Chao Zhang, Zhenyu Chen

本文首次研究了基于变异性(metamorphic)的模糊测试预言增强(MFOE)方法,旨在提升灰盒模糊测试的漏洞检测能力。传统的模糊驱动程序通常仅依赖崩溃预言(crash-based oracle),忽略了库函数功能的正确性验证,限制了发现非崩溃类缺陷的能力。为此,作者提出利用变异性关系(MRs)构造变异性预言,并将其集成到现有模糊驱动中。然而,手动构建和集成此类预言需要大量领域知识,难以自动化。为解决这一挑战,论文提出了MetaFOE框架,借助大型语言模型(LLM)自动生成并集成变异性预言。MetaFOE首先从目标函数接口和文档中提取信息,利用LLM生成候选MRs,然后通过静态分析和编译验证筛选出可用的MRs,再自动生成元驱动程序(meta driver)代码。实验基于OSS-Fuzz项目中的实际驱动程序,使用了三种现代LLM(GPT-4、Claude等)和五种提示策略。结果显示,MetaFOE生成了3475个MRs,其中77.3%可被应用;实现了12351个元驱动,其中6228个有效。经过三小时的模糊测试,有效元驱动平均提升了18.7%的边覆盖率,并触发了1528个独特的崩溃。该工作证明了变异性预言增强的有效性以及利用LLM自动化实现MFOE的可行性,为推进灰盒模糊测试提供了新思路。

💡 推荐理由: 该研究首次将变异性预言的自动化构造引入模糊测试,通过LLM显著降低了人工成本。提升边覆盖率和触发大量崩溃表明其实际效果,对安全测试人员改进模糊驱动、发现非崩溃类漏洞具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Seulbae Kim, Major Liu, Junghwan John Rhee, Yuseok Jeon, Yonghwi Kwon 0001, Chung Hwan Kim

该论文提出了一种名为 DriveFuzz 的模糊测试工具,旨在自动发现自动驾驶系统(ADS)中的安全缺陷。自动驾驶系统通常依赖深度神经网络处理传感器数据并做出驾驶决策,但这类系统可能因异常输入(如传感器噪声、不规则路况)而表现出不安全行为。然而,传统的模糊测试方法难以有效应用于复杂的 ADS 环境,因为它们需要模拟真实的物理世界交互。DriveFuzz 的关键创新在于引入了一种“驾驶质量引导”的模糊测试策略:它基于车辆控制信号的平滑性、碰撞风险等指标来量化每次测试输入的“驾驶质量”,并利用该指标指导变异算子生成更可能触发不安全行为的测试场景。具体而言,DriveFuzz 通过将原始传感器数据(如激光雷达点云、摄像头图像)作为输入,并利用一个反馈循环,选择那些导致驾驶质量下降的变异输入进行后续探索。论文在工业级自动驾驶模拟器(如 CARLA、LGSVL)上进行了评估,结果表明 DriveFuzz 能够有效发现多种类型的 bug,包括车辆偏离车道、碰撞障碍物、无视交通标志等,且发现的 bug 数量显著优于现有基线方法。该工作发表于 ACM CCS 2022,附录包含更多实验细节。

💡 推荐理由: 自动驾驶系统的安全性直接关乎人身安全,DriveFuzz 提供了一种自动化发现驾驶决策逻辑缺陷的方法,有助于在部署前识别高风险场景,减少路测风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jan Drescher, David Klein 0001, Martin Johns

本文针对现代浏览器(Chrome、Firefox)的站点隔离(Site Isolation)安全架构,提出了一种自动检测逻辑漏洞的方法。站点隔离通过将不同站点的渲染进程隔离到独立的沙箱中,以缓解Spectre等微架构攻击和渲染器内存破坏的影响。其安全依赖于操作系统进程隔离和浏览器进程的正确策略实施:浏览器进程需追踪每个渲染进程对应的站点上下文,并通过IPC消息限制跨站网络通信,遵守同源策略和CORS。若站点映射或策略实施存在逻辑缺陷,则可能导致站点隔离绕过漏洞,使攻击者能够跨站执行恶意JavaScript或窃取cookie。由于此类语义漏洞不会产生明显崩溃,传统工具(如Address Sanitizer)难以检测。作者提出了第一个自动检测方法:设计了一个新颖的检测规则,通过识别进程级别的跨站数据泄露来定位语义漏洞;并开发了一个模糊测试工具,模拟被攻破的渲染进程,通过挂钩IPC通信来利用浏览器进程作为“被混淆的代理人”,尝试发送恶意IPC消息。实验在Chrome和Firefox上发现了四个安全漏洞:其中三个漏洞允许跨站数据泄露,第四个漏洞可导致对受害者站点的完全控制。该研究为浏览器安全测试提供了自动化手段,适用于浏览器厂商和安全研究人员进一步评估和加固站点隔离实现。

💡 推荐理由: 站点隔离是浏览器核心安全机制,其绕过漏洞威胁所有用户数据。该工作首次实现自动化检测,填补了针对语义漏洞的空白,能帮助厂商在漏洞被利用前发现并修复。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nilo Redini, Andrea Continella, Dipanjan Das 0002, Giulio De Pasquale, Noah Spahn, Aravind Machiry, Antonio Bianchi, Christopher Kruegel, Giovanni Vigna

本文针对物联网设备固件难以提取和仿真的问题,提出了一种利用配套移动应用生成有效且欠约束的模糊测试输入的方法。关键洞察是:在配套应用中存在一类称为“模糊触发函数”的代码位置,它们位于输入验证代码之后、数据变换函数(如网络序列化)之前。通过在这些点注入模糊数据,可以生成既不被应用端校验限制、又不被设备因格式无效而丢弃的测试用例。作者开发了工具Diane,结合静态分析和动态分析在Android配套应用中定位模糊触发函数,并自动对物联网设备进行黑盒模糊测试。在11款流行物联网设备上,Diane发现了11个漏洞,其中9个为零日漏洞。实验表明,若不使用模糊触发函数,许多设备无法生成触发漏洞的输入。该方法有效提升了IoT黑盒模糊测试的效率和深度。

💡 推荐理由: 为物联网设备安全测试提供了一种实用的黑盒模糊测试方法,可发现传统方法难以触及的漏洞,对提升IoT生态安全性有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Peihong Lin, Pengfei Wang 0010, Xu Zhou 0004, Wei Xie 0007, Gen Zhang, Kai Lu 0001

定向灰盒模糊测试(DGF)旨在通过预定义目标位置强化对易受攻击代码区域的测试。现有DGF技术主要基于启发式算法优化适应度指标,但这些方法依赖历史执行信息,对尚未执行的路径缺乏预见性,导致难以处理具有复杂约束的路径,从而降低DGF效率。本文提出DeepGo,一种预测性定向灰盒模糊测试器,通过结合历史与预测信息,引导DGF沿最优路径到达目标位置。首先,DeepGo引入路径转换模型,将DGF建模为通过特定路径转换序列到达目标的过程;变异生成的新种子会引发路径转换,高奖励路径转换序列对应的路径更有可能到达目标。其次,为预测未执行的路径转换及其奖励,DeepGo使用深度神经网络构建虚拟集成环境(VEE),该环境逐步模仿路径转换模型并预测路径转换的奖励。然后,开发了模糊测试强化学习(RLF)模型,生成具有最高序列奖励的转换序列,RLF结合历史与预测路径转换生成最优序列,并指导变异策略。最后,为执行高奖励路径转换序列,提出动作组概念,综合优化模糊测试关键步骤,高效实现最优路径。实验在包含25个程序、100个目标位置的基准测试集上进行,结果表明DeepGo在到达目标位置的速度上比AFLGo、BEACON、WindRanger和ParmeSan分别快3.23倍、1.72倍、1.81倍和4.83倍,在暴露已知漏洞方面分别快2.61倍、3.32倍、2.43倍和2.53倍。

💡 推荐理由: 该研究通过引入预测性路径规划和强化学习,显著提升了定向灰盒模糊测试的效率和漏洞发现能力,为安全测试工具的智能化改进提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peng Xu, Yanhao Wang, Hong Hu 0004, Purui Su

本文提出COOPER,一种用于测试脚本语言(如JavaScript)与低级语言(C/C++)之间绑定代码的协同变异方法。许多商业软件(如Adobe Acrobat)集成脚本语言以实现动态文件修改,但脚本与底层实现之间的绑定层因数据转换和表示形式而存在语义不一致和安全漏洞。现有测试方法仅关注脚本侧,忽略需要特殊程序本机输入的缺陷。COOPER通过协同变异同时生成脚本端输入和程序本机输入,以触发绑定代码中的不一致性,从而发现潜在漏洞。实验结果表明,COOPER能够有效检测出真实世界软件中隐藏的绑定缺陷,包括一些先前未发现的漏洞,证明了其在提高软件安全性方面的价值。该方法适用于任何使用脚本语言扩展功能的系统,特别是PDF解析器、浏览器插件等场景。

💡 推荐理由: 揭示了脚本语言与底层代码间绑定层的安全盲区,提供了一种针对性的自动化测试方法,有助于发现传统fuzzing遗漏的严重漏洞。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alvin Charles, Adrian Herrera, Peter Oslington, Alwen Tiu

该论文提出了一种名为PeAR的静态二进制重写框架,旨在解决闭源软件二进制级模糊测试中的覆盖率引导问题。传统上,二进制模糊测试依赖动态二进制插桩(DBI)来获取覆盖率信息,但DBI会引入显著运行时开销。静态二进制插桩(SBI)虽可避免运行时开销,但常被认为存在精度和正确性挑战。作者通过实验表明,利用现有成熟框架可以实现精确且可扩展的SBI,并基于此构建了PeAR框架。PeAR支持多种现代模糊器特性,包括延迟初始化、持久模式和共享内存模糊测试。作者在FUZZBENCH基准上进行了总计4.25 CPU年的模糊测试评估,结果表明:(i) PeAR成功插桩了88%的FUZZBENCH目标,与最佳SBI模糊器相当;(ii) 在使用持久模式和共享内存模糊测试时,中位数吞吐量提升了4倍;(iii) 达到了与编译器插桩相当的覆盖率。这些结果证明SBI是二进制模糊测试中一种实用且有效的技术,现代二进制重写框架能够在高粒度下应用复杂插桩,且性能损失极小。该研究适合对二进制安全、模糊测试、静态分析感兴趣的从业者阅读。

💡 推荐理由: 该工作展示了静态二进制插桩在二进制模糊测试中的可行性,为闭源软件漏洞挖掘提供了低开销、高吞吐的替代方案,有助于提升工业界对静态重写技术的信心。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gen Zhang, Pengfei Wang 0010, Tai Yue, Xiangdong Kong, Shan Huang 0002, Xu Zhou 0004, Kai Lu 0001

灰盒模糊测试(CGF)是一种高效的软件测试技术,但现有方法难以同时优化多个目标。本文提出MobFuzz,一种基于多目标优化(MOO)的自适应灰盒模糊器。首先,将多目标优化过程建模为多人多臂老虎机(MPMAB)问题,自适应选择当前最合适的客观组合。其次,该模型处理能量调度,在选定客观组合下自适应分配能量给种子。此外,提出进化算法NIC,在无额外性能开销下同时优化多个目标。在12个真实程序及MAGMA数据集上的实验表明,MobFuzz优于单目标模糊器:能选择最优客观组合,使多个目标值提升高达107%,能耗最多降低55%;程序覆盖率提升最高6%,发现独特漏洞数量是基线模糊器的3倍;NIC算法性能提升至少2倍,开销仅约3%。

💡 推荐理由: MobFuzz提出的自适应多目标优化机制显著提升了模糊测试的覆盖率和漏洞发现能力,为复杂软件的安全测试提供了更高效的方法。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.7
Conf: 50%
👥 作者: Haya Schulmann, Niklas Vogel

资源公钥基础设施(RPKI)已成为保护域间路由安全的关键技术。然而,RPKI软件的安全性测试长期停留在浅层解析阶段,现有模糊测试工具(如AFL++、libFuzzer)因假设每次执行输入单一且独立,无法处理RPKI仓库中数百个相互依赖、经密码学链接的对象。这种复杂性导致现有工具无法精确追踪多对象仓库中的代码覆盖率,破坏了基于反馈的探索机制,从而遗漏了RPKI验证中的多数严重漏洞。本文提出并实现了一种新型模糊测试工具CAT,通过连续采样和将函数作为侧信道实现大规模输入仓库中每个对象的精确覆盖率归因。同时,通过将解析输入转换为带标签的树结构,CAT能够在保持变异仓库密码学有效性的前提下进行结构和语义突变。CAT结合了非顺序模糊测试与模板无关的ASN.1变异引擎,相比顺序模糊测试吞吐量提升66倍,相比libFuzzer和先前工作多探索24%-47%的独特代码路径。在RPKI验证器上的评估中,CAT发现了21个先前未知的漏洞,其中8个已分配CVE(CVSS 7.5-9.8),包括缓冲区溢出、拒绝服务(DoS)和可被利用的仓库投毒逻辑缺陷。CAT已开源,以支持可重复性、进一步研究以及将方法推广至DNSSEC、TLS等其他基于密码学的复杂协议。

💡 推荐理由: RPKI是保护互联网路由安全的关键基础设施,其验证软件中的漏洞可能导致路由劫持、服务中断等严重后果。CAT工具显著提升了RPKI软件的安全性检测能力,发现的多个高危漏洞(CVSS最高9.8)直接威胁到全球路由安全。

🎯 建议动作: 建议RPKI实现者评估并集成CAT进行持续测试,关注已分配CVE并尽快修复;安全研究者可借鉴其方法应用于其他协议。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Kunpeng Zhang, Zongjie Li, Daoyuan Wu, Shuai Wang 0011, Xin Xia 0001

本文提出了一种名为 G2FUZZ 的新方法,旨在实现对非文本输入(如图像、视频、PDF 文件)的语法感知模糊测试。传统上,大型语言模型(LLM)擅长生成符合语法的文本和代码,但生成非文本输出却成本高昂且能力有限。G2FUZZ 利用 LLM 合成和变异输入生成器(以 Python 脚本形式),这些生成器能生成符合给定输入格式语法的非文本数据,然后由传统模糊器(如 AFL++)进一步变异这些数据以有效探索程序输入空间。该方法采用混合策略,结合 LLM 驱动的全局搜索和工业级模糊器的局部搜索。LLM 在合成和变异输入生成器方面表现出色,有助于跳出局部最优,从而实现与变异模糊器的协同效应;同时,LLM 仅在必要时被调用,显著降低了使用成本。作者在 TIFF 图像、MP4 音频和 PDF 文件等多种输入格式上评估了 G2FUZZ,在 UNIFUZZ、FuzzBench 和 MAGMA 三个平台上,与 AFL++、Fuzztruction 和 FormatFuzzer 等最先进工具相比,G2FUZZ 在代码覆盖率和漏洞发现方面均表现更优。该研究为将 LLM 应用于非文本输入的模糊测试提供了低成本、高效率的解决方案。

💡 推荐理由: 首次将 LLM 用于非文本输入的语法感知模糊测试,提出混合搜索策略,显著提升代码覆盖率和漏洞发现能力,且成本可控。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhuo Zhang 0002, Wei You 0001, Guanhong Tao 0001, Yousra Aafer, Xuwei Liu, Xiangyu Zhang 0001

本文提出 StochFuzz,一种针对 stripped binaries 的模糊测试技术。Stripped binaries 由于缺少符号信息,传统 instrumentation 方法困难。现有方案如 QEMU 依赖硬件或昂贵的动态二进制翻译引擎,或做出不实际假设(如二进制中不含内联数据)。StochFuzz 利用模糊测试的高重复性特点,采用增量随机重写方法。在模糊测试过程中,它生成多个重写版本,通过大量测试运行验证其有效性,并使用概率分析聚合证据,逐步收敛到正确重写。实验在两组真实程序上进行,与 e9patch、ddisasm、RetroWrite 等基线相比,StochFuzz 在正确性和成本效益方面表现更优,性能与基于源码的模糊器相当。工具已开源。

💡 推荐理由: 为 stripped binaries 的模糊测试提供了一种无需硬件加速或昂贵引擎的轻量级方案,降低了二进制安全测试的门槛。

🎯 建议动作: 研究跟进,评估在内部模糊测试流程中的适用性

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhiyi Yao

本论文提出 FuzzPilot,一种针对 AFL++ 模糊测试工具的控制器,旨在将昂贵的推理过程移出变异热路径。当覆盖率出现平台期时,FuzzPilot 会快照当前语料库,生成候选变异配方(以 JSON 数据形式表示),在独立的 AFL++ 微活动中评估这些配方,并仅推广具有正验证奖励的配方。配方由原生自定义变异器消费,包含操作符权重、字节范围、语料库选择规则和字典令牌等。候选配方可来自本地规则或语言模型代理,后者可利用 Ghidra 提取的常量和反编译上下文作为目标提示。论文在 cJSON 上进行了故意狭窄的评估,每轮运行 5 次 14400 秒,比较了标准 AFL++ 和全功能 FuzzPilot。实验发现 cJSON 覆盖已饱和:基线 AFL++ 在约 2500 秒中位数时达到暴露的 269 条边上限。因此,实验无法证明语言模型提议能提高覆盖率或泛化到 cJSON 之外。在本次范围内,FuzzPilot 保持了吞吐量(中位 execs_per_sec 约为基线的 1.06 倍),并显示出描述性的更短中位平台期(1384 秒对比 2532 秒),但在 N=5 时差异不显著(Mann-Whitney p=0.42)。验证门评估了 20 个模型提出的配方,均未提升(奖励为零)。观察到的平台期减少更可能来自控制器的快照和重启机制,而非模型或配方变异器。本版本最好作为可审计的实现报告和正在进行的非饱和目标评估的基线。适合对模糊测试优化和 LLM 辅助测试感兴趣的研究人员阅读。

💡 推荐理由: FuzzPilot 尝试将 LLM 引入模糊测试配方生成,提供了一种结构化的平台期处理思路。尽管实验未证明显著改进,但其方法和实现细节值得关注,可作为安全测试自动化研究的参考。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Ze Sheng, Dmitrijs Trizna, Luigino Camastra, Zhicheng Chen, Qingxiao Xu, Jeff Huang

本文针对C/C++软件中模糊测试(fuzz testing)的关键瓶颈——fuzz harness(连接模糊器和库API的程序)的正确性问题,提出了一种自动化生成高质量harness的系统QuartetFuzz。现有的自动化harness生成工具无法系统性地确保harness的正确性,导致逻辑错误、API误用和生命周期违规等问题在源代码层面被忽视。随着基于大语言模型(LLM)的生成技术使harness创建规模化,缺乏质量控制反而使规模成为负担。QuartetFuzz的核心是四个原则框架:逻辑正确性(P1)、API协议合规(P2)、安全边界尊重(P3)和入口点充分性(P4),这是首个在源代码层面定义harness正确性的框架,包含数学规范与可实现的检查。该系统将这四个原则操作化为一个自主LLM智能体,通过“生成-检查-修复”循环,在模糊测试开始前确保生成的harness满足P1-P4。在涵盖C/C++、Java和JavaScript的23个开源项目上部署后,系统提交了42个漏洞报告,其中29个已被上游修复或确认(包括3个CVE),仅有2个被拒绝(误报率4.8%)。在生成过程中,内置的P1/P2检查自动拦截了58个由harness引起的崩溃,否则这些崩溃将成为误报。当作为质量审核工具应用于70个项目的586个现有生产环境harness时,系统识别出53个违规(45个已确认,35个已修复)。此外,作者发布了包含100个标注harness的数据集以供可复现评估。该工作对于提升模糊测试的有效性、减少误报、以及自动化安全测试基础设施有重要意义。

💡 推荐理由: 该研究首次从源代码层面定义并实现了fuzz harness的正确性框架,解决了LLM生成harness时质量失控的问题,显著降低了模糊测试中的误报率,并已产出实际漏洞修复(含3个CVE),对安全测试工程师和自动化工具开发者具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ze Sheng, Zhicheng Chen, Qingxiao Xu, Kewen Zhu, Jeff Huang

软件漏洞是严重的安全威胁,仅2025年报告的CVE数量就接近5万个。大型语言模型在自动化漏洞检测方面展现出潜力,但仍面临三大挑战:一是生成的漏洞报告误报率高且缺乏可重复验证;二是现有的LLM方法在漏洞定位时粒度选择次优,函数级分析在上下文过多时容易遗漏漏洞,而行级分析则缺乏足够的上下文;三是难以推理具有复杂跨函数依赖和触发条件的漏洞。针对这些问题,本文提出了FuzzingBrain V2,一个基于多智能体LLM的系统,其核心贡献包括:(1) 基于Google的OSS-Fuzz实现完全自动化的漏洞分析,确保所有报告的漏洞都可通过模糊测试复现;(2) 提出Suspicious Point这一基于控制流的新型抽象,实现最优粒度的精确漏洞定位;(3) 采用逻辑驱动的层次化函数分析与双层模糊测试,在资源约束下增强函数覆盖;(4) 基于MCP的静态和动态分析工具结合上下文工程,增强复杂漏洞的推理能力。在AIxCC 2025决赛的C/C++数据集上,FuzzingBrain V2实现了90%的检测率(40个漏洞中检测到36个)。在实际部署中,该工具在12个开源项目中发现了29个零日漏洞,所有漏洞均被维护者确认并修复,其中2个已分配CVE编号。

💡 推荐理由: 该研究提出了一种可复现、低误报的自动化漏洞发现系统,结合多智能体LLM与模糊测试,显著提升了真实世界漏洞检测效率,对蓝队和安全工程师评估LLM在漏洞挖掘中的实用性具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: Yujian Zhang, Yaokun Liu, Jinyu Xu, Yanhao Wang

本文提出了一种名为前驱感知定向灰盒模糊测试(PDGF)的新方法,旨在解决现有定向灰盒模糊测试(DGF)技术中存在的重量级和不完整性问题。DGF是一种面向目标的模糊测试技术,用于复现或发现软件漏洞,通常分为静态分析(预先获取程序结构信息)和动态执行(引导模糊测试向目标位置靠近)两个阶段。然而,现有方法在识别和接近目标时需额外开销,且由于间接调用或路径覆盖不足,导致对目标位置的测试不完整。PDGF将DGF重新定义为路径搜索问题,通过将程序划分为前驱区域和非前驱区域,并利用轻量级程序分析初始维护前驱集合,在动态执行中不断扩充该集合。PDGF引入了一种新的适应度指标——区域成熟度,用以表示前驱区域的覆盖率,并结合基于模拟退火的能量调度技术以及种子选择和变异策略,高效且全面地覆盖前驱区域。在包含30个真实程序目标点的基准测试上,PDGF与现有最先进的DGF工具进行了广泛比较,实验结果表明,PDGF在暴露时间、路径多样性和漏洞发现方面均优于竞争对手。此外,PDGF发现了9个新漏洞,其中6个已分配CVE编号。该工作对软件安全测试领域具有重要参考价值,适合安全测试研究员、模糊测试工具开发者和软件质量保障人员阅读。

💡 推荐理由: 针对现有定向灰盒模糊测试的效率与覆盖瓶颈,提出了轻量级的前驱感知机制,显著提升了路径多样性和漏洞发现能力,为实际软件安全测试提供了更有效的工具。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sicong Cao, Biao He 0002, Xiaobing Sun 0001, Yu Ouyang, Chao Zhang 0008, Xiaoxue Wu 0001, Ting Su 0001, Lili Bo, Bin Li 0006, Chuanlei Ma, Jiajia Li, Tao Wei 0002

本文提出了一种名为 ODDFuzz 的新型混合解决方案,用于高效发现 Java 反序列化漏洞。Java 反序列化漏洞是实际中严重的威胁,现有静态分析和模糊测试方法在有效性和效率上存在局限。ODDFuzz 首先执行轻量级静态污点分析,识别可能引发反序列化漏洞的候选 gadget 链,此步骤旨在定位所有候选者并避免漏报。随后,ODDFuzz 采用定向灰盒模糊测试(DGF)探索这些候选链,生成概念验证(PoC)测试用例以消除误报。具体而言,ODDFuzz 应用了结构感知的种子生成方法保证测试用例的有效性,并采用新颖的混合反馈和逐步向前策略指导定向模糊测试。在流行 Java 反序列化仓库 ysoserial 上的评估表明,ODDFuzz 发现了 34 条已知 gadget 链中的 16 条,而两个最先进的基线仅识别出 3 条。此外,在真实应用如 Oracle WebLogic Server、Apache Dubbo、Sonatype Nexus 和 protostuff 上,ODDFuzz 发现了 6 条先前未报告的可利用 gadget 链,并获得了 5 个 CVE 编号。

💡 推荐理由: ODDFuzz 为 Java 反序列化漏洞发现提供了高效的方法,在实际应用中已发现新漏洞并获得 CVE,对安全防御者理解攻击面和改进检测有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zu-Ming Jiang, Jia-Ju Bai, Zhendong Su 0001

该论文提出了一种名为DynSQL的有状态模糊测试方法,专门针对数据库管理系统(DBMS)进行测试。传统的DBMS模糊测试通常只生成简单的SQL查询,难以发现与复杂状态相关的深层漏洞。DynSQL的核心创新在于能够自动生成复杂且语义有效的SQL查询,同时保持对数据库状态(如表结构、索引、数据分布)的感知和追踪。它通过构建一个状态机模型来模拟数据库的演化过程,并利用该模型指导SQL生成,确保生成的查询在语法和语义上都有效,且能够覆盖更多数据库状态转换路径。实验在多个主流DBMS(如SQLite、MySQL、PostgreSQL等)上进行了评估,结果表明DynSQL比现有工具发现了更多独特漏洞,且生成的查询复杂度更高,代码覆盖率也显著提升。该工作为DBMS的安全性测试提供了一种新的有效手段,尤其适合发现与多语句交互、事务隔离、约束违反等相关的复杂缺陷。

💡 推荐理由: DBMS漏洞可能导致数据泄露或破坏,现有模糊测试方法难以生成复杂有效SQL。DynSQL通过有状态生成显著提升发现深层漏洞的能力,对数据库安全测试有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Justin Applegate, Andreas Kellas

Python 的原生序列化协议 pickle 虽然功能强大,但由于存在已知的安全风险,在处理不可信数据时非常不安全。它常被用于保存机器学习模型等场景,但攻击者可能通过构造恶意的 pickle 数据来执行任意代码。开发者有时会通过限制反序列化时的导入或使用静态/动态分析工具来缓解风险,但这些方法容易出错,且高度依赖对 Pickle 虚拟机(PVM)操作码的准确解释。Python 的三个原生 PVM 模块(pickle、cPickle、_pickle)之间存在实现差异,这些差异会导致错误检测恶意负载,从而削弱现有防御。为了高效且可扩展地识别这些差异,本文提出了 PickleFuzzer,一种基于生成的定制化模糊测试工具。PickleFuzzer 通过语法生成 pickle 对象,将其传递给每个实现,并检测抛出的异常或关键内部状态的变化。它通过比较每个测试实现的执行行为来确定差异,而不需要依赖于规范派生的 oracle。PickleFuzzer 发现了 14 个新的差异,其中 4 个是关键的,可用于绕过 Hugging Face 等流行模型托管平台上部署的安全扫描工具。作者向 Python 软件基金会披露了所有发现,并将安全问题报告给漏洞赏金平台,获得了 750 美元奖励。该工作证明了差分测试是识别重要 pickle 实现中安全相关差异的有效方法,并为通过更定向的模糊测试发现更深层的 pickle 漏洞提供了有前景的未来方向。

💡 推荐理由: PickleFuzzer 揭示了不同实现间的差异可被利用来绕过安全检查,直接影响 Hugging Face 等平台上的模型安全。安全从业者应关注此类间接漏洞检测方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.6
Conf: 50%
👥 作者: Yunlong Lyu, Peng Chen, Fengyi Wu, Junzhe Yu, Kit Long Hon, Hao Chen

库模糊测试是保障软件供应链安全的重要手段,但大规模采用仍面临成本高昂、环境配置复杂、测试用例生成难以满足复杂API约束,以及难以区分真实库bug与测试驱动导致的崩溃等问题。现有的基于LLM的自动化工具通常作为一次性代码生成器运行,忽略了运行时反馈,限制了代码覆盖深度和报告bug的有效性。本文提出FuzzAgent,一个基于多智能体系统的进化式库模糊测试框架。其核心洞察是:有效的库模糊测试本质上是迭代的——每次测试暴露新的覆盖瓶颈和崩溃,下一次测试应基于这些信号进化,而非从头开始。FuzzAgent由一组专门智能体组成,覆盖模糊测试全生命周期,包括:环境设置、harness生成、运行监控、覆盖分析、崩溃分类等。每个决策都基于具体的运行时证据,通过多轮迭代逐步优化harness套件,以实现更深覆盖和更精确的崩溃分析。在20个真实世界的C/C++库上,FuzzAgent无需人工干预即可完成完整模糊测试流程,达到179,619个分支,分别超越OSS-Fuzz、PromptFuzz、PromeFuzz和OSS-Fuzz-Gen 45.1%、73.2%、92.1%和191.2%。此外,FuzzAgent发现了102个真实库bug,其中78个已被上游维护者确认并修复。该工作展示了多智能体协作与进化学习在自动化库模糊测试中的巨大潜力。

💡 推荐理由: FuzzAgent创新性地将多智能体系统与进化学习结合,显著提升了库模糊测试的自动化程度和有效性,对软件供应链安全防御具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek

该论文提出了GRIEF,一种面向LLM推理引擎的灰盒模糊测试工具,旨在发现服务层漏洞。当前LLM推理引擎(如vLLM、SGLang)引入了KV缓存、批处理、前缀共享、推测解码、适配器和多租户调度等机制,这些共享状态行为仅在真实并发工作负载下才显现,而标准的模型测试、安全测试和API测试无法覆盖。GRIEF将定时多请求轨迹作为一等输入,使用轻量级预言(oracle)检测崩溃、挂起、性能异常和静默输出损坏,并通过带log-probability检查的可控重放来确认可重现的服务层故障。在vLLM和SGLang上的早期测试中,GRIEF发现了15个漏洞,其中10个被开发者确认,包括2个CVE,涵盖KV缓存隔离失败、跨请求性能干扰、崩溃或活锁问题。结果表明,并发、缓存和状态重用可导致静默跨请求污染、邻区噪声拒绝服务以及延迟崩溃,且无需畸形输入或显式服务器错误。因此,并发的服务行为应作为LLM基础设施的一级安全与可靠性边界。

💡 推荐理由: LLM服务系统已成为关键基础设施,但其服务层漏洞(如跨请求污染、拒绝服务)难以通过常规测试发现。GRIEF首次系统性地针对服务层并发特性进行模糊测试,揭示了一类被忽视的安全风险,对保障LLM生产环境稳定性和数据隔离有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiwon Kim 0001, Dave Jing Tian, Benjamin E. Ujcich

本文提出Chimera,一个针对P4可编程网络基础设施的模糊测试工具,旨在检测跨控制平面和数据平面的多平面漏洞。传统P4安全研究主要关注数据平面,忽略了与控制平面的交互。作者通过分析开源P4实现中的历史漏洞报告,发现许多漏洞源于两个平面之间的相互影响。Chimera采用混合执行(concolic execution)来捕获控制-数据平面的交互,并提出了两种新的输入变异策略:解析器感知数据包变异(PAPM)和头部引导规则生成(HGRG),以利用跨平面和P4程序的依赖关系。在ONOS、Stratum和BMv2三个平台上的评估中,Chimera发现了7个新bug,包括3个安全关键漏洞,其中2个由多平面输入触发,2个为跨平面漏洞。与现有单平面模糊测试器相比,Chimera实现了更高的覆盖率和3.5倍的漏洞检测率。该研究适合网络协议安全研究人员、P4开发者和模糊测试工具开发者阅读。

💡 推荐理由: P4可编程网络扩大了攻击面,而现有工具忽视控制面与数据面的交互。Chimera首次系统性地检测多平面漏洞,能发现传统单平面工具遗漏的安全关键缺陷。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 16.5
Conf: 50%
👥 作者: Patrick Jauernig, Domagoj Jakobovic, Stjepan Picek, Emmanuel Stapf, Ahmad-Reza Sadeghi

模糊测试是一种广泛应用于工业界的自动化软件测试技术,其中基于变异的模糊测试在实践中发现了大量错误。尽管学术界多年来一直在研究基于变异的模糊测试,但模糊器中算法的交互非常复杂,加上每个模糊器实例中的随机性,可能导致不可预测的效果。大多数改进这种脆弱交互的努力都集中在优化种子调度上,然而像Google的FuzzBench这样的实际结果表明,这些方法在实践中并未持续带来改进。另一种算法上改进模糊测试过程的方法是优化变异调度。不幸的是,现有的变异调度方法也未能令人信服,因为它们缺乏实际改进,或者需要过多用户可控参数,这些参数的配置需要目标程序的专家知识。这留下了如何巧妙地处理测试用例并实现可测量改进这一具有挑战性的问题。本文提出了DARWIN,一种新颖的变异调度器,它是首个在现实场景中展示模糊测试改进且无需引入额外用户可配置参数的方法,从而将这种方法开放给了广泛的模糊测试社区。DARWIN使用进化策略系统地优化和调整模糊测试过程中变异操作符的概率分布。作者基于流行的通用模糊测试器AFL实现了原型。DARWIN在自主覆盖实验、FuzzBench以及MAGMA基准测试中均显著优于最先进的变异调度器和AFL基线,在MAGMA中以最快速度找到了21个bug中的15个。最后,DARWIN在广泛使用的真实世界应用程序中发现了20个独特的bug(包括一个新bug),比AFL多出66%。

💡 推荐理由: DARWIN首次在无需额外用户参数的情况下,在真实场景中显著提升了变异模糊测试的效率,为模糊测试领域提供了一种即插即用的改进方案,具有广泛的实用价值。

🎯 建议动作: 研究跟进,考虑将DARWIN集成到现有模糊测试管道中。

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Samuel Groß, Simon Koch 0001, Lukas Bernhard, Thorsten Holz, Martin Johns

该论文提出了FUZZILLI,第一个专门针对JavaScript JIT编译器漏洞的模糊测试工具。现代JavaScript引擎依赖JIT编译器实现高性能,但JIT编译器的复杂性带来了安全漏洞风险。现有的模糊测试工具主要生成常规JavaScript代码,难以触发JIT编译器特有的语义,因此无法有效发现JIT相关漏洞。FUZZILLI通过设计一种中间表示(IR),能够生成专门触发JIT编译器优化、编译、运行时等阶段的测试用例,从而发现JIT编译器中的安全缺陷。作者实现了完整原型,并在六个月评估期内发现了17个已确认的安全漏洞,证明了靶向JIT模糊测试的可行性和现有模糊测试覆盖中的一个被危险忽略的空白。该研究为JavaScript引擎安全提供了新的测试方法论,对安全研究人员和浏览器厂商具有重要参考价值。

💡 推荐理由: JIT编译器漏洞是当前浏览器安全的重要攻击面,但现有模糊测试工具对此覆盖不足。FUZZILLI首次提出针对性方案,填补了关键空白。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.3
Conf: 50%
👥 作者: Yuan Chang, Chun-Chia Huang, Tatsuya Mori, Hsu-Chun Hsiao

该论文在ArXiv上以海报形式发表,提出了一种名为YFuzz的数据驱动模糊测试方法。研究指出,传统的代码覆盖率引导的灰盒模糊测试存在关键局限性:即使覆盖了相关代码,也可能遗漏bug,因为触发bug通常需要满足特定条件,而代码覆盖率仅关注代码是否被执行,无法全面捕捉这些条件。YFuzz旨在通过数据分析来指导模糊测试,以生成更可能触发bug的输入。由于本研究仅提供摘要,未公开具体方法细节和实验评估,因此属于初步研究展示。适合对模糊测试改进感兴趣的研究人员阅读。

💡 推荐理由: 指出了覆盖率引导模糊测试的固有局限,并提出了数据驱动的新思路,对提升模糊测试效率有潜在价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.3)
👥 作者: Jiaying Meng, Xuewei Feng, Qi Li, Min Liu, Ke Xu

工业控制协议(ICP)对于工业基础设施的可靠性和稳定性至关重要,但其安全性受到规范盲点(specification-blindness)瓶颈的根本性影响。现代模糊测试工具受限于基于观测的推理,难以深入协议状态或检测微妙的语义偏差。本文提出了AFL-ICP,一种自主模糊测试框架,开创了规范驱动的范式。AFL-ICP包含一个上下文感知的规范形式化流水线,可将复杂规范转换为严格的机器可执行语法。在此基础上,AFL-ICP利用大语言模型(LLM)实现自动化的协议适配和种子生成,从而以最少的人工工作快速扩展到新协议。此外,它还包含一个基于LLM的差分检查器,将实现输出与规范要求进行交叉引用,以检测现有模糊测试工具无法发现的细微语义和逻辑错误。作者实现了AFL-ICP,并在四种广泛使用的ICP(包括开源和闭源变体)上进行了评估。结果表明,AFL-ICP在覆盖率方面显著优于最先进的模糊测试工具,并发现了24个先前未知的漏洞,已获得受影响供应商(如FreyrSCADA)的确认。其中,识别出的漏洞包括16个语义和逻辑错误,这些错误可能悄无声息地破坏工业操作并降低服务可用性。本文适合工业控制系统安全研究人员、模糊测试工具开发者以及工控协议设计者阅读。

💡 推荐理由: 该研究提出了一种利用LLM增强模糊测试的新范式,能系统性地发现工控协议中隐蔽的语义和逻辑漏洞,对提升工业安全至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Meng Wang, Philipp Görz, Joschua Schilling, Keno Hassler, Liwei Guo, Thorsten Holz, Ali Abbasi 0002

业务逻辑漏洞是软件安全中一个关键且难以检测的问题,它们源于应用程序设计或实现中的错误,使攻击者能够触发非预期的行为。传统的基于模糊测试的动态分析工具在检测内存安全漏洞方面表现出色,但往往无法发现业务逻辑漏洞,因为这些缺陷需要理解特定于应用程序的语义上下文。已有的推测上下文的方法由于依赖启发式和非可移植的语言特性,本质上是脆弱且不完整的。由于业务逻辑漏洞在CWE Top 40中占据27个,是实际中最危险的软件弱点之一,现有工具的盲点令人担忧。本文提出了ANOTA,一种新型的人机协同的sanitizer框架。ANOTA引入了一个轻量级、用户友好的注解系统,使用户能够直接将其领域知识编码为轻量级注解,这些注解定义了应用程序的预期行为。运行时执行监视器观察程序行为,将其与注解定义的策略进行比较,从而识别指示漏洞的偏差。为了评估ANOTA的有效性,作者将其与最先进的模糊测试器结合,与其他针对相同目标的流行漏洞发现方法进行比较。结果表明,ANOTA+FUZZER在有效性上优于其他方法。具体来说,ANOTA+FUZZER成功复现了43个已知漏洞,并在评估期间发现了22个以前未知的漏洞(分配了17个CVE)。这些结果证明,ANOTA为发现传统安全测试技术经常遗漏的复杂业务逻辑缺陷提供了一种实用且有效的方法。

💡 推荐理由: 业务逻辑漏洞是实际中最常见但最难以自动化检测的安全弱点之一,ANOTA提出了一种实用的注解式sanitizer方案,填补了现有工具的盲区。

🎯 建议动作: 研究跟进,评估集成到现有测试管线的可行性

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
推荐 11.6
Conf: 50%
👥 作者: Johannes Lenzen, Mohamadreza Rostami, Lichao Wu, Ahmad-Reza Sadeghi

现代CPU作为黑盒,其微架构漏洞日益复杂,传统分析手段难以应对。虽然已有通过繁琐手工挖掘出的关键漏洞,但缺乏自动化、系统化的后硅漏洞检测框架。本文提出Fuzzilicon,首个面向真实x86 CPU的后硅模糊测试框架,通过引入微码级内省填补了可见性鸿沟。Fuzzilicon的核心是新型微架构反馈提取技术:通过逆向工程Intel的专有微码更新接口,实现对处理器微架构的深度内省,并开发了最小侵入性的插桩方法,集成于基于Hypervisor的模糊测试工具链中,实现了无需寄存器传输级(RTL)访问的精确反馈引导输入生成。在Intel Goldmont微架构上的实验表明,Fuzzilicon发现了5项重要发现,包括两个此前未知的微码级推测执行漏洞,并自动重现了之前手动检测到的μSpectre类漏洞。与基线技术相比,Fuzzilicon将覆盖率收集开销降低最多31倍,并达到了16.27%的可挂钩位置唯一微码覆盖率,成为此类首个实证基线。该框架是一种实用、覆盖引导且可扩展的后硅模糊测试方法,为自动化发现复杂CPU漏洞奠定了新基础。

💡 推荐理由: Fuzzilicon首次实现了面向真实x86 CPU的自动化后硅模糊测试,通过微码级反馈彻底改变了CPU漏洞挖掘范式,对硬件安全研究和防御具有里程碑意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhicong Zheng, Jinghui Wu, Shilin Xiao, Yanze Ren, Chen Yan 0001, Xiaoyu Ji 0001, Wenyuan Xu 0001

本文提出了一种名为 PhyFuzz 的新型传感器漏洞检测方法,利用物理信号模糊测试来发现传感器中的安全缺陷。传感器在现代系统中广泛应用,但物理层面的攻击往往被忽视。PhyFuzz 通过生成物理信号(如声波、电磁波等)并注入到传感器中,观察系统的异常行为,从而检测出传感器对物理干扰的脆弱性。该方法系统性地探索了传感器物理输入空间,结合自适应变异策略以提高漏洞发现效率。实验在多种实际传感器设备上进行,结果表明 PhyFuzz 能够有效发现传统软件模糊测试无法触及的物理层漏洞,例如传感器饱和、信号干扰导致的错误输出等。该研究为物联网和嵌入式系统安全提供了新的测试视角,有助于开发更鲁棒的传感器系统。主要贡献包括:1)提出了物理信号模糊测试的通用框架;2)设计了针对传感器特性的变异生成算法;3)通过案例验证了方法的有效性。

💡 推荐理由: 传感器是物联网和智能系统的核心,其物理层漏洞可被远程利用导致严重后果。PhyFuzz 提供了一种自动化检测手段,帮助安全团队在部署前发现并修复这些隐蔽的脆弱性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peihong Lin, Pengfei Wang, Lei Zhou, Gen Zhang, Xu Zhou, Wei Xie, Zhiyuan Jiang, Kai Lu 0001

该论文提出了一种名为PortRush的硬件模糊测试框架,旨在检测由写端口竞争引发的微架构侧信道漏洞。写端口竞争是现代超标量处理器中多个执行单元同时尝试写入同一物理端口时产生的资源冲突现象,这种竞争可能导致时序差异,进而被攻击者利用来窃取敏感信息。PortRush通过自动化生成针对写端口竞争的高效测试用例,利用硬件性能计数器实时监控微架构事件,从而触发并识别潜在的信息泄露路径。该框架结合了静态分析和动态模糊测试技术,能够系统地探索处理器微架构中的竞争条件,并自动确认漏洞的可利用性。实验在多种主流处理器(如Intel Core和AMD Ryzen系列)上进行,成功发现了多个之前未知的写端口竞争侧信道漏洞,证明了该方法的有效性。PortRush的贡献在于提出了一种新的自动化检测手段,填补了针对写端口竞争这一特定侧信道攻击类型在安全测试工具方面的空白,为处理器安全评估提供了重要支持。

💡 推荐理由: 写端口竞争是微架构侧信道攻击的新兴向量,传统侧信道检测工具难以覆盖,PortRush提供了一种自动化、系统化的检测方法,对保障CPU安全和数据机密性具有前瞻意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Eunkyu Lee, Junyoung Park, Insu Yun

本文提出了一种针对实时操作系统(RTOS)内核的上下文自适应函数级模糊测试方法,名为RTCON。RTOS广泛应用于嵌入式系统和物联网设备,其内核安全性至关重要。传统模糊测试通常以系统调用或整个程序为输入,但RTOS内核具有高度耦合的上下文依赖关系,例如中断处理、任务调度和资源锁定,这使得通用模糊测试难以有效探索内核状态空间。RTCON创新性地在函数级别进行模糊测试,并利用上下文信息(如当前运行任务、中断状态、锁持有情况等)动态调整测试输入和路径选择。具体地,该方法通过静态分析提取函数间的上下文依赖图,并在执行过程中实时监控上下文变化,从而生成更导向的测试用例,提高对临界区、中断服务例程和竞争条件等深层漏洞的覆盖能力。实验在多个主流RTOS内核(如FreeRTOS、Zephyr)上进行,结果表明RTCON在代码覆盖率、漏洞发现数量和测试效率方面显著优于现有通用模糊测试工具,成功发现了多个未知的内存破坏和死锁漏洞。本文的主要贡献包括:定义了RTOS内核模糊测试的上下文自适应问题,提出了函数级测试生成算法,设计并实现了原型工具RTCON,并通过实证验证了其有效性。

💡 推荐理由: RTOS内核漏洞可能导致嵌入式设备被完全控制,影响关键基础设施。RTCON提供了一种针对RTOS特性的高效模糊测试方法,能发现传统工具遗漏的上下文相关漏洞,提升安全审计能力。

🎯 建议动作: 研究跟进,评估其在自身RTOS安全测试流程中的适用性

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiangan Ji, Chao Zhang 0008, Shuitao Gan, Lin Jian, Hangtian Liu, Tieming Liu, Lei Zheng, Zhipeng Jia

本文提出 FirmAgent,一种融合模糊测试与大型语言模型(LLM)智能体的方法,用于自动化发现物联网(IoT)固件中的安全漏洞。研究背景是:IoT 设备数量激增,其固件普遍存在内存破坏、逻辑缺陷等漏洞,而传统模糊测试在固件平台上面临代码覆盖率低、种子生成盲目等挑战。FirmAgent 核心思路是让 LLM 智能体理解固件结构(如二进制文件解析、文件系统识别)后,动态指导模糊测试的种子生成与变异策略。具体而言,智能体先通过静态分析提取固件关键函数、协议处理逻辑等信息,再结合运行时覆盖率反馈,生成更可能触发深层路径的测试用例。实验在多个真实 IoT 固件(如路由器、摄像头)上进行,与 AFL、LibFuzzer 等基线工具对比,FirmAgent 在漏洞发现数量、代码覆盖率及触发崩溃效率上均有显著提升,成功挖掘出多个未公开的零日漏洞。主要贡献包括:1)首次系统性将 LLM 智能体与模糊测试结合用于固件安全;2)提出智能体引导的种子生成机制;3)构建专用数据集并公开评估结果。本文适合固件安全研究人员、AI 辅助漏洞挖掘开发者阅读。

💡 推荐理由: 传统模糊测试在IoT固件上效率低,FirmAgent借助LLM的语义理解能力智能化指导测试,开辟了新型漏洞发现范式,能显著提升固件安全评估效率。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Manuel Andreas, Fabian Specht, Marius Momeu

本文提出了一种名为 HyperMirage 的新型混合虚拟 CPU 模糊测试方法,旨在解决传统模糊测试在虚拟化环境中状态覆盖不足的问题。该方法通过直接操纵虚拟CPU的内部状态(如寄存器、内存映射和特权级),结合符号执行和覆盖率引导的变异策略,显著提升了对虚拟化执行路径的探索效率。实验在QEMU、KVM和Bhyve等主流虚拟化平台上进行,结果显示HyperMirage相比现有工具(如Hypercube和TriforceAFL)在代码覆盖率和漏洞发现数量上均有大幅提升,共发现20个先前未知的虚拟化实现漏洞,其中12个被认定为安全关键。论文详细描述了状态快照与恢复机制、混合执行引擎的设计以及针对虚拟CPU特定指令集的模糊策略。该研究属于学术界对虚拟化安全测试方法的创新,适合虚拟化平台开发者、安全研究员和漏洞挖掘专家阅读。

💡 推荐理由: 虚拟化是现代云基础设施的核心,其安全漏洞影响面极广。HyperMirage提出直接状态操纵方法,突破了传统模糊测试在虚拟CPU测试中的瓶颈,为发现虚拟化层深层漏洞提供了有效手段。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nuno Sabino, Darion Cassel, Rui Abreu 0001, Pedro Adão, Lujo Bauer, Limin Jia 0001

该论文提出了一种针对DOM-XSS(文档对象模型跨站脚本)漏洞的自动化检测方法。核心思路是将网页交互模糊测试与URL组件合成相结合。具体而言,方法首先通过模糊测试生成各种用户交互事件(如点击、输入、滚动等),触发网页中的JavaScript逻辑;同时,系统会动态合成包含恶意payload的URL组件(如哈希、查询参数等),并注入到页面中,以观察是否触发执行。实验在真实世界的网站集上验证了该方法的有效性,发现多个未知的DOM-XSS漏洞,并与现有工具进行了对比。该方法不需要访问页面源代码,仅通过黑盒测试即可检测,适合大规模自动化扫描。主要贡献包括:1)设计了一种兼顾交互覆盖和URL变异的模糊测试策略;2)提出了一种基于执行上下文追踪的漏洞判定机制;3)在真实环境下展示了较高的检出率和较低的误报率。

💡 推荐理由: DOM-XSS是Web安全中最难防御的漏洞之一,因其完全在客户端执行且绕过服务器过滤。该研究提供了一种自动化的黑盒检测方案,可帮助安全团队在无源码场景下快速发现此类漏洞。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
推荐 9.5
Conf: 50%
👥 作者: Kaihua Wang, Jianjun Chen 0005, Pinji Chen, Jianwei Zhuge, Jiaju Bai, Haixin Duan

本文对QUIC协议实现中的逻辑漏洞进行了系统性研究。QUIC作为一种基于UDP的传输层协议,旨在提升HTTP/3的性能与安全性,但不同实现(如Chromium、Quinn、msquic等)可能因状态机处理不当、参数校验缺失或并发控制缺陷而引入逻辑漏洞。作者首先构建了针对QUIC实现的黑盒与白盒测试框架,通过模糊测试和手工分析相结合的方式,对主流实现进行了深度审计。研究发现多类逻辑漏洞,包括连接迁移机制中的权限绕过、0-RTT数据重放攻击、流控制窗口计算错误以及握手状态跳跃导致的内存破坏。实验表明,这些漏洞可导致拒绝服务、信息泄露或中间人攻击。论文进一步提出了基于状态机建模的静态分析工具,用于自动检测此类缺陷,并在真实实现中发现了多个未见报的漏洞。该工作为QUIC实现的安全性评估提供了系统方法论,对协议标准化和实现优化具有重要参考价值。

💡 推荐理由: QUIC是HTTP/3的基础,其实现漏洞直接影响现代Web通信的安全;本文首次系统揭示该领域逻辑漏洞类型,有助于防御者提前识别风险。

🎯 建议动作: 研究跟进:建议QUIC实现方及安全团队参考论文中的测试框架进行内部审计,并关注后续PoC发布。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yu Liang, Peng Liu

该论文提出了一种自底向上基于语法的 SQL 生成方法,用于高效检测数据库管理系统(DBMS)中的漏洞。与传统自顶向下的生成方式不同,该方法从基本语法单元(如关键字、运算符)开始,逐步构建复杂 SQL 语句,从而覆盖更多边界情况和异常路径。通过将 SQL 语法规则编码为状态机,并采用随机搜索与约束求解相结合的策略,生成的 SQL 语句能够触发 DBMS 解析器、优化器和执行引擎中的深层错误。实验在多个主流 DBMS(如 MySQL、PostgreSQL 等)上进行,结果表明该方法在漏洞发现效率和代码覆盖率方面均优于现有模糊测试工具(如 SQLancer、SQLsmith)。论文还分析了检测到的漏洞类型,包括崩溃、断言失败和逻辑错误,并证明了方法在自动化测试中的实用性。对于安全团队而言,该方法可集成到 CI/CD 管道中,持续发现 DBMS 0day 漏洞。

💡 推荐理由: DBMS 0day 漏洞可能导致数据泄露或拒绝服务,本文提出更高效的自动化检测方法,能够降低人工审计成本,提升防守方对数据库安全的掌控力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuangxiang Kan, Xiao Cheng, Yuekang Li

该论文提出了 MUTATO,一种通过自适应 API 选项变异来增强模糊测试驱动(fuzz driver)的方法。在库模糊测试中,模糊驱动程序通常需要构造 API 调用序列及其参数,但现有工具往往忽略了 API 选项(如配置参数或标志位)的变异,导致测试覆盖率受限。MUTATO 设计了一种轻量级的自适应策略,能够基于动态反馈(如代码覆盖率增长情况)自动调整选项变异的概率和范围,从而更有效地探索库的深层路径。方法包括三个关键组件:选项类型推断(从函数签名中识别选项参数)、变异概率调度(使用带宽分配模型)以及交叉影响处理(考虑多个选项间的组合)。在多个真实库(如 libxml2、libpng、OpenSSL)上的实验表明,MUTATO 相比基线工具(如 AFL++ 的默认驱动)实现了平均 23% 的代码覆盖率提升和 31% 的崩溃发现数量增加。该工作为自动化模糊测试驱动生成后的优化提供了新思路,尤其适用于具有大量配置选项的库。

💡 推荐理由: 库模糊测试是发现底层漏洞的关键手段,但选项参数的变异长期被忽视。MUTATO 自动化提升了测试效率,可直接增强现有模糊测试工具链,降低安全人员的手动调优成本。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yongheng Chen, Rui Zhong, Hong Hu 0004, Hangfan Zhang, Yupeng Yang, Dinghao Wu, Wenke Lee

本文提出了一种通用的语言处理器模糊测试框架,旨在解决现有模糊测试工具针对特定语言处理器(如JSON解析器、XML解析器等)定制化程度高、通用性差的问题。该框架的核心创新在于引入了语义验证机制,能够自动识别并过滤掉语义无效的测试用例,从而大幅提升模糊测试的效率和覆盖率。方法上,作者设计了一个统一的接口来适配多种语言处理器的输入规范,并利用轻量级的语义模型对生成的测试用例进行实时验证。实验在多个流行的语言处理器(包括libxml2、json-c、yaml-cpp等)上进行,结果表明该框架在代码覆盖率、漏洞发现数量上均显著优于现有的专用模糊测试工具。主要贡献包括:1)提出了一种通用且高效的语言处理器模糊测试方法;2)开发了可扩展的语义验证模块;3)通过大量实验证明了方法的有效性。适合安全研究人员和模糊测试工具开发者阅读。

💡 推荐理由: 语言处理器(如解析器)是安全攻击面的高发区域,现有模糊测试工具缺乏通用性。本文提出的通用框架能显著降低测试成本并提升漏洞发现能力,对蓝队和开发人员评估自身软件安全性具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Mario Rodríguez Béjar, B. Romera-Paredes, Jose L. Hernández-Ramos

本文提出 FunFuzz,一个基于大型语言模型(LLM)的进化模糊测试框架,旨在解决传统 LLM 驱动模糊测试中 prompt 初始化和采样方差导致的探索效率低下和输入冗余问题。FunFuzz 采用多岛进化算法,并行运行多个隔离的搜索过程,并定期迁移高价值候选输入以维持种群多样性。初始生成 prompt 从文档中提取,每个岛屿使用特定主题的指令初始化,随后通过反馈引导的 prompt 选择机制持续调整 prompt。在模糊测试过程中,候选输入根据增量编译器覆盖率进行排序,同时利用编译器内部失败信号识别崩溃触发输入。在 GCC 和 Clang 编译器上的 24 小时连续实验表明,FunFuzz 相比之前的 LLM 驱动基线方法实现了更高的编译器覆盖率,并发现了更多独特的编译器内部失败触发输入。该方法有效结合了 LLM 的输入生成能力和进化算法的全局搜索能力,为编译器等结构化输入场景的模糊测试提供了新思路。

💡 推荐理由: FunFuzz 将 LLM 与进化算法有机结合,显著提升了编译器模糊测试的覆盖率和缺陷发现能力,对于软件安全测试领域具有创新意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Yousra Aafer, Wei You 0001, Yi Sun 0004, Yu Shi, Xiangyu Zhang 0001, Heng Yin 0001

本文提出了一种针对Android SmartTV的日志引导模糊测试方法,旨在自动化发现这些设备中的安全漏洞。Android SmartTV设备由于其封闭性、资源受限以及定制化系统,传统的模糊测试方法难以有效覆盖其攻击面。作者设计了Log-Guided Fuzzing(LGF)框架,通过实时捕获设备运行时的系统日志和应用日志,解析日志中的状态信息(如Wifi状态、蓝牙事件、输入事件等),并利用这些信息动态调整模糊测试的输入生成策略,从而提高代码覆盖率并触发深层逻辑。具体而言,LGF将日志解析为结构化的事件序列,基于事件之间的依赖关系构建行为模型,然后指导Fuzzer生成符合设备实际运行状态的有效输入。实验在多个品牌的Android SmartTV上进行了评估,发现多个此前未知的漏洞,包括系统服务崩溃、权限绕过和远程代码执行等严重问题,证明了该方法在真实设备上的有效性。该研究为IoT和智能电视领域的漏洞挖掘提供了新思路。

💡 推荐理由: Android SmartTV用户广泛,但安全研究不足;该方法通过日志引导突破模糊测试瓶颈,可有效发现TV固件及预装应用中的高危漏洞,防止隐私泄露和远程控制。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)