#reproducibility

共收录 14 条相关安全情报。

← 返回所有主题
👥 作者: Safayat Bin Hakim, Houbing Herbert Song

该论文针对威胁报告知识图谱提取工具评估的可复现性问题进行系统审计。研究者注意到工具发布时引用的三元组F1分数高度依赖于预测三元组与黄金标注之间的匹配规则,而匹配算法(精确匹配、同义词、嵌入相似度等)的选择会显著影响最终得分。作者检查了12个公开系统,仅对5个系统能够重新实现其论文中所述的匹配规则,其余7个规则不透明。在共享文档上使用8种不同匹配协议重新评分10个系统的预测输出,结果显示45对系统排名中有11对发生倒置;同一组预测在不同协议下F1得分可从0.16变化至0.70。在GRID外部378项校准数据集上,作者对比了词汇匹配、嵌入和蕴含等机械匹配器与多审阅者的人工裁决,一致性最高不超过71%,而使用LLM作为评判时一致性达到86%。为分离模型本身与匹配规则的影响,作者构建CTIForge,可固定抽取结果、仅改变验证层。实验发现,在7种部署配置下,验证层对精确率的影响并非单边:4个托管后端精确率提升,3个离线后端精确率下降,该差异与骨干网络、解码和提示耦合,不能简单归因于服务方式。同时,对于明确争论实体类型的动作增加了约2.8倍,说明手写验证规则内嵌了其为之开发的后端的约定。作者开源了完整管道、协议集合和逐三元组审计记录。此工作对于安全团队如何客观评估威胁情报知识图谱工具、避免被表面F1分数误导具有重要参考价值。

💡 推荐理由: 安全团队常依赖知识图谱工具的F1分数做采购决策,但匹配协议不透明会导致分数虚高和排名失真。该文揭示了这一隐患,并提供了可复用的审计工具与方法,有助于提升威胁情报工具评估的可信度。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Omri Ram, Mitchell Horner, Ron Van der Meyden, Alsharif Abuadbba, Hammond Pearce

本文提出了 GraftyVul,一个通过将真实世界漏洞“嫁接”到开源项目中来自动构造含漏洞程序的数据集生成系统。现有漏洞数据集通常难以同时满足多样性(语言和漏洞类型)、可复现性与可执行性以及真实性这三项要求:部分数据集使用人工构造或合成代码,缺乏真实上下文;部分数据集虽有真实漏洞但缺少可用的构建和测试环境。GraftyVul 的核心思想是从已知漏洞提交中提取补丁差异,并将其移植到其他开源项目,从而保留真实漏洞的语义特征,同时利用目标项目原本正常的构建和测试环境,并借助漏洞触发脚本来验证新引入的漏洞确实改变了程序行为。作者使用该系统生成了 212 个经过验证且可被利用的易受攻击程序,覆盖五种编程语言(Python、TypeScript、Java、Go 和 C#)以及 23 个 CWE 类别。为了评估生成样本的保真度,论文提出了一种与语言和上下文无关的语义嵌入方法,通过对比漏洞的 sink、机制和宿主特征而非表面代码来衡量相似性。实验表明,该嵌入方法在跨语言克隆检测和 CWE 分类上优于标准代码嵌入,并且 GraftyVul 生成的样本与其来源漏洞在语义上有强相关性。此外,作者将 GraftyVul 与 13 个广泛使用的数据集进行对比,发现它在保持竞争力的多样性的同时,是唯一一个具备广泛语言和 CWE 覆盖的可复现可利用漏洞数据集。最后,论文通过一个工业案例研究展示了 GraftyVul 在评估生产级漏洞修复系统方面的实际效用。

💡 推荐理由: 为漏洞检测、自动化修复和安全的代码生成模型提供高质量、可复现且真实的训练与评估数据,弥补现有数据集在多样性、可执行性与真实性之间的缺口,有助于提升安全模型的泛化能力和可信度。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher M. Frost

本文提出并实施了一套面向后量子密码学(PQC)标准 ML-KEM 的跨实现可复现性验证协议,旨在解决加密标准独立实现之间已知答案测试(KAT)一致性验证中因语料、版本、公共接口、排除规则和证据记录不一致而导致的验证结论不可靠问题。作者设计了一个产品中立的协议 v2,该协议冻结了各实现的具体能力,采用对称的验证错误分类法,保留所有选中的测试用例,并将字节流、验证判定、不支持操作与适配器错误进行严格分离。实验基于 NIST 的自动化密码验证协议(ACVP)固定语料,对三种公开实现进行源码构建测试:@noble/post-quantum 0.7.0、liboqs 0.16.0 和 Go 1.26.4。在三轮重复实验中,共包含 2160 条基础记录:其中 1650 条声明可执行的评估结果全部与 NIST 预言机一致,510 条不支持记录与 Go 预先声明的能力边界完全匹配。对于可执行交集,两两一致率达到 100%:noble-liboqs 共 720 条、Go 与另外两者各 210 条。此外,一个额外的 keyGen-ek-projection 诊断工具验证了 Go 的 150 条封装密钥投影,但未计入完整密钥生成。三个冻结控制组分别测试了字节比较、判定比较和畸形响应错误分离,均产生完全符合预声明的结果。整个实验未出现基础失败、适配器错误或状态不稳定。该证据确立了受限的、由作者运行的重复性,同时暴露了一个实际标准缺口:公共 ML-KEM 包在确定性和验证测试接口上存在显著差异。需要注意的是,研究不验证认证、穷举正确性、侧信道抗性、安全集成或生产级保证,且独立的外部重复尚未观测。该论文适合密码标准实现者、安全评估人员和 PQC 迁移技术决策者阅读,以理解跨实现验证的严谨方法和当前生态的差距。

💡 推荐理由: 为 PQC 实现一致性验证提供了可复现的协议范例,揭示了公共 ML-KEM 库在验证接口与确定性行为上的实质差异,直接影响 NIST 标准落地时的互操作性与安全性评估。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bo Chen

该论文针对 LLM/agent 驱动的漏洞验证工件(如 PoC 仓库、验证管道)的可复现性与可靠性进行了一项预注册的独立审计研究。研究背景是:随着大语言模型与自动化代理被用于漏洞挖掘和验证,安全社区产生了大量自动化生成的安全工件,但工件'可公开访问'、'可运行'、'能产生信号'、'语义上确认针对特定 CVE'这四级目标之间存在严重落差,而此前缺乏系统测量。作者通过检索 2023 至 2026 年间的文献,经双人筛选形成包含 104 篇论文的共识语料,其中 59 篇(56.7%)提供公开可获取的工件。随后作者对 18 篇论文级工件进行 R0(原环境)与 R1(仅修复环境依赖)两级复现,并对锚定基准(arXiv:2509.24037)的全部 102 个验证案例执行复现,对其中 30 个案例追加补丁反事实(在已修复版本上运行同一验证逻辑),对 19 个案例施加匹配的阴性输入对照。主要发现包括三方面:其一,102 个锚定案例中有 58 个(56.9%)案例的脚本内部 CVE 标识符与所在目录声称的 CVE 不一致,说明存在 CVE 混淆或错误标注;其二,18 个论文级工件在 R0 阶段仅 10 个(55.6%)能完整跑完声明的工作流,经 R1 修复提升到 11 个(61.1%),说明大量工件的可运行性欠佳;其三,工件自带的验证预言机(判定是否触发漏洞的信号逻辑)严重不可靠:30 个补丁反事实审计中有 20 个在已打补丁的构建上仍输出“已利用”信号,19 个阴性对照中有 7 个在良性输入上被误判为触发,预言机整体灵敏度仅 60%、特异性 45%。作者强调,仅凭在脆弱版本上的触发并不能证明对该 CVE 的准确复现,必须配合干净的补丁反事实与阴性对照。该研究的贡献在于提出一套可复用的复现审计协议,包括预注册后置条件、R0/R1 修复阶梯、G1-G3 语义证据级别和补丁反事实预言机等,为安全工件复现社区提供了模板。由于本研究为预注册探索性结果,外部效度受限,但方法值得借鉴。

💡 推荐理由: 该研究揭示 LLM/agent 自动生成的漏洞验证工件存在大量假阳性与 CVE 错配问题,直接冲击依赖自动化 PoC 的漏洞运营流程。防御者若仅以'触发信号'作为漏洞存在的依据,可能被误导,需要在响应流程中引入补丁反事实与阴性对照验证。

🎯 建议动作: 研究跟进(评估其审计协议,用于内部漏洞验证流程的可信度核查)

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mohammad E. Alim, Tommy Morris

本文献(arXiv 论文,作者 Mohammad E. Alim 与 Tommy Morris)从标题看,聚焦于工业控制系统(ICS)安全数据集在“安全工件评估”政策下的透明性与可复现性问题。核心研究问题是从“可用(Available)”到“可复用(Reusable)”的数据集质量评估,即当前许多 ICS 安全数据集虽然公开发布,但缺乏足够的元数据、采集环境说明、标签定义或验证流程,导致其他研究者难以复现实验结果或验证检测方法的有效性。论文可能提出了一套基于安全工件评估政策(如 artifact evaluation 惯例)的测量框架或指标,用于量化数据集的透明度和可复现性,并可能对现有 ICS 数据集进行系统性的评测或对比。由于仅获得标题信息,具体方法、实验设置和结论尚不明确,但该研究对 ICS 安全领域的社区生态建设具有参考价值,尤其有助于推动数据集标准化和可复现性文化的形成。建议关注该论文全文以获取具体的评估维度和标准。

💡 推荐理由: ICS 安全研究高度依赖高质量的公开数据集,数据集的透明性和可复现性直接影响检测模型的可信度与可比性。该论文若提出系统化评估方法,将有助于实践者甄别可靠数据,提升安全研究的基础设施质量。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Alizishaan Khatri, Dun Li Chan

本文是对Khatri等人(2026)提出的潜在空间安全探针方法的可复现性研究。原始方法表明,在单一大语言模型(LLaMA-3.1-8B)的最终层激活上训练轻量级MLP探针,能够以与比其大1000倍的防护模型相竞争的F1分数检测有害提示,且每个基准只需一个探针。作者从零开始复现了这一完整流程,并沿着原始研究未涉及的两个方向进行扩展:第一,测试跨模型架构和规模的泛化能力,在Gemma-4-E4B、Mistral-7B-v0.3和Qwen2-7B上训练相同的探针,并使用WildJailbreak、BeaverTails和AEGIS 2.0三个基准进行验证;第二,通过五个随机种子重复激活提取实验,测量F1分数的方差,以评估推断过程中非确定性对结果的影响。实验结果显示,原始LLaMA模型基准的复现F1分数与原文差距在0.37个百分点以内(BeaverTails上不超过0.2个百分点),验证了原始方法的可复现性。此外,MLP探针架构成功扩展到其他模型家族,F1分数与LLaMA-3.1-8B的报道值相差不超过1个百分点,表明该方法具有良好的跨模型泛化能力。种子变化实验揭示了一个有趣现象:对于所有测试的架构,无论随机种子如何,最终token的潜在向量均保持不变,暗示激活提取过程具有高度确定性。这项工作的贡献在于:证实了轻量级探针作为高效有害内容检测器的可靠性,为其实际部署提供了强有力证据,并揭示了潜在空间表示的稳定性。适合对LLM安全机制、可解释性和高效检测方法感兴趣的研究者阅读。

💡 推荐理由: 该研究验证了轻量级探针检测有害提示的有效性,为安全团队提供了比防护模型更高效的替代方案。跨模型泛化能力表明此方法可快速适配不同LLM架构,降低安全监控成本,并增强对LLM内部安全状态的理解。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lucy Steele, Fahad Alotaibi, Sergio Maffeis

该论文针对深度学习网络入侵检测系统(NIDS)评估中的可重复性和公平性问题展开研究。现有评估通常假设数据分布静态,忽略随机性和环境变化的影响,导致报告性能无法反映真实部署情况。作者聚焦于能够感知并适应数据分布偏移的先进模型(shift-aware models),通过控制变量实验,系统分析了随机种子、训练数据划分、超参数、环境噪声等随机和环境因素对F1分数等指标的影响。实验表明,即使是微小的变化也可能导致F1分数大幅波动,影响结果的可重复性;部分因素会显著偏斜性能。基于发现,论文提出了一系列实用建议,包括固定随机种子、使用多次重复实验、报告置信区间、统一评估协议等,以支持深度学习NIDS的公平和可重复评估。该工作对于推动NIDS领域的科学评估方法具有重要参考价值。

💡 推荐理由: 安全运维团队在部署或选型基于深度学习的NIDS时,需要了解评估结果是否可靠。该论文揭示的性能波动问题直接关系到模型在实际环境中能否稳定工作,强调必须采用更严谨的评估方法论。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nathaniel Bennett, Tyler Tucker, Carson Stillman, William Enck, Patrick Traynor, Kevin R. B. Butler

本文提出了 Fizzle,一个用于网络协议模糊测试的确定性且可复现的框架。网络模糊测试在发现协议实现中的漏洞方面具有重要作用,但传统模糊测试工具由于随机化和非确定性执行,导致测试结果难以复现。Fizzle 通过引入确定性调度和状态记录机制,确保每次运行产生完全相同的输入序列和代码覆盖率,从而为漏洞验证和回归测试提供可靠基础。该框架支持多种网络协议的自定义变异策略,并集成了轻量级模拟器以消除环境依赖。实验表明,Fizzle 在多个真实世界协议实现(如 HTTP、DNS)上能够持续复现已知漏洞,并与现有模糊测试工具相比,运行速度损失控制在 10% 以内。主要贡献包括:1)定义确定性模糊测试的规范;2)实现可复现的变异引擎;3)开源框架以促进社区协作。

💡 推荐理由: 对于安全测试人员,可复现的模糊测试结果能显著提升漏洞验证与响应效率,减少因环境或随机性导致的误报。

🎯 建议动作: 建议安全团队评估并测试该框架在内部协议测试中的适用性,尤其是对复现性有严格要求的场景。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Tiago Heinrich, Sebastian Giessler, David Klein 0001, Alexandra Dirksen

该论文评估了顶级安全与隐私会议(CCS)2020至2022年间论文的开放科学实践情况,重点关注可重复性。研究系统地分析了这些论文中代码、数据集、工件等的公开可用性,发现虽然部分论文提供了工件,但整体开放科学实践水平较低,尤其缺乏完整的可重复性支持。作者提出了改进开放科学实践的建议,旨在提升研究透明度和可重复性。

💡 推荐理由: 帮助安全社区了解顶级会议在开放科学方面的现状,推动改进研究可重复性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Calvin Ardi, Alefiya Hussain, Stephen Schwab

本论文聚焦于解决网络仿真测试平台中缺乏可重现视频流流量生成工具的问题。视频流流量占互联网流量主导地位,但现有工具难以在受控环境中生成具有代表性且可重现的流量,这限制了流量分类、服务质量(QoS)算法及流量工程系统的评估。作者提出了一个工具集,能够生成多种可重现的视频流流量模式。初步工作中,他们探讨了27种不同的流媒体视频流量类型组合,涵盖不同协议和传输特性,并通过实验展示了这些协议在网络层动态上的多样性,包括数据包大小分布、时间间隔模式及突发性等关键网络特征。该工具基于开源框架构建,支持在Docker等容器化或虚拟化测试床上部署,允许研究者精确控制流量参数并重复实验。主要贡献包括:1)填补了仿真测试环境中视频流流量生成工具的空白;2)提供了27种流量组合的详细配置,覆盖主流视频协议如HLS、DASH、WebRTC等;3)验证了生成流量的网络层动态与实际网络抓包数据的高度相似性,确保实验结果的可靠性。该工作尤其适用于网络研究、安全模拟及性能测试场景,为后续研究提供了标准化、可复现的流量生成基础。

💡 推荐理由: 安全团队常需在模拟环境中测试检测算法,但缺乏真实且可重现的流量数据。此工具可生成多样化的视频流流量,提升测试可信度。

🎯 建议动作: 研究跟进,关注工具开源情况并评估集成至内部测试平台。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Daniel Olszewski

本文探讨计算机安全社区中研究成果可重复性的定义与提升方法。可重复性是科学进步的关键,尤其在计算机安全领域,代码和数据的天然可计算性本应使独立复现结果相对简单。然而,尽管安全社区近年来日益重视可重复性,当前方法是否有效仍存疑问。本论文从三个层面展开:首先,衡量现有可重复性研究实践的影响力;其次,构建框架和工具以促进可重复结果;最后,分析作者所采取方法的成效。核心目标是提供简化并增强可重复性的工具集,帮助安全研究人员更有效地共享验证其工作。本文适合关注学术严谨性、希望提升自身研究可复现性的安全学者及审稿人阅读。

💡 推荐理由: 可重复性危机在安全研究中日益突出,缺乏复现手段导致结果可信度下降。本文提供的系统性框架可直接帮助研究者建立可复现工作流,提升整个社区的科学质量。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

本文针对文本到图像(T2I)生成模型越狱评估中存在的复现性和可比性问题,提出了一种自演进论文到管线智能体框架PixJail。当前T2I越狱技术发展迅速,但现有基准和复现工作流难以同步更新;更重要的是,T2I越狱评估并非单次提示级测试,而是一个由多个阶段构成的管线级问题,包括提示转换、图像生成、安全过滤和多模态评判等环节,导致不同论文的结果难以可靠复现和公平比较。PixJail通过以下方式解决该问题:给定一篇T2I越狱论文及可选参考代码,在统一合约下快速构建论文特定的攻击模块和可运行的评估管线,并忠实复现原始实验结果;同时维护一个记忆库,存储论文摘要、攻击演化模式、可复用模板、失败案例及版本化工件,使后续复现工作能够复用先前经验。作者复现了11种代表性T2I越狱方法(包括有代码和无代码论文),在其原始设置下,框架能以极小误差(平均2.1%,中位数0%)准确恢复先前结果。PixJail旨在为未来T2I越狱复现和评估提供统一基础,大幅减少人工工作量。该工作主要面向安全研究社区,特别是关注生成式AI安全评估的从业者。

💡 推荐理由: T2I越狱评估的复现性是生成式AI安全领域的痛点。PixJail提供自动化、可扩展的复现框架,有助于标准化评估流程,提升研究可信度,为防御者跟进最新攻击手法并设计对策提供基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sidnei Barbieri, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

网络安全文献综述需要可复现的论文集合作为筛选和综合之前的固定分母。然而,当前常用的出版商门户、文献索引和学术API的覆盖范围、格式和查询语义随时间变化,导致不同研究之间难以复现和比较。本文提出TopVenues,一个开源系统,将语料库构建实现为版本化的研究工件。TopVenues通过声明一个会议/期刊和年份范围,以DBLP计算机科学书目作为元数据主干,利用开放学术API和特定出版商提取器丰富记录(添加摘要和BibTeX条目),并将结果存储在单调递增的SQLite快照中,提供命令行界面、Web界面以及适用于综述工作流的导出路径。2026年5月的快照包含从2017年至2026年来自11个网络安全来源的9,925篇论文,摘要覆盖率达99.86%,BibTeX覆盖率达99.99%;对完整语料库的关键词搜索在31毫秒内完成,一套包含250个测试的测试套件验证了数据完整性不变性。固定的语料库还支持可重复测量:在我们的范围内,2024至2025年来自四个顶级安全会议的论文中有29.2%以arXiv预印本形式出现,中位时间在正式出版前五个月;基于先前作者记录过滤器在召回率90%时实现了16.5倍的精确度提升,用于筛选后来出现在同一会议集中的预印本。TopVenues通过使语料库本身可执行、可检查、可引用,将语料库构建与可审计的网络安全测量联系起来。该工件在GitHub上开源。

💡 推荐理由: 为网络安全文献综述提供了可复现的语料库构建工具,解决了以往依赖易变API导致的复现难题,有助于提高研究质量与可比性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.5
Conf: 50%
👥 作者: Jonathan Evertz, Niklas Risse, Nicolai Neuer, Andreas Müller 0025, Philipp Normann, Gaetano Sapia, Srishti Gupta 0004, David Pape, Soumya Shaw, Devansh Srivastav, Christian Wressnegger, Erwin Quiring, Thorsten Eisenhofer, Daniel Arp, Lea Schönherr

本文系统性地探讨了大语言模型(LLM)在安全研究中引入的独特挑战。作者识别出九个常见陷阱,这些陷阱涵盖从数据收集、预训练、微调到提示工程和评估的整个计算流程,可能损害研究的有效性。为了评估这些陷阱的普遍性,作者分析了2023至2024年间发表在顶级安全与软件工程会议(如IEEE S&P、USENIX Security、ICSE等)上的72篇经同行评审的论文。结果发现每篇论文至少包含一个陷阱,且每个陷阱在多篇论文中出现,但仅有15.7%的陷阱被作者明确讨论,表明大多数陷阱未被研究者意识到。为进一步理解这些陷阱的实际影响,作者开展了四项实证案例研究,展示了单个陷阱如何误导评估结果、夸大性能或损害可复现性。例如,不恰当的基线选择或数据泄露会导致虚假的性能提升。基于发现,作者提出了一系列可操作指南,包括在论文中明确报告数据分割、参数设置、评估指标和随机种子,以及使用标准化测试集和鲁棒性检查。该研究为LLM安全研究的可复现性和严谨性提供了重要警示,适合从事LLM安全研究的研究人员、审稿人和从业者阅读。

💡 推荐理由: 揭示了LLM安全研究中普遍存在但被忽视的方法论陷阱,为提升研究可复现性和可靠性提供关键指南。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)