👥 作者: Mohammad E. Alim, Tommy Morris
本文聚焦于工业控制系统(ICS)安全研究中的数据集可重现性与透明度问题。研究背景:随着ICS网络安全领域蓬勃发展,大量公开数据集被用于训练入侵检测模型等研究,但数据集的可用性(可获取)与可复用性(可重现结果)之间存在显著差距。核心问题:现有ICS数据集的发布是否遵循了足够严格的工件评估政策,以确保研究结果的可重复验证?方法:作者提出了一套基于安全工件评估政策(如NDSS、USENIX Security等顶会采用的Artifact Evaluation政策)的评估框架,并系统性地审查了多个公开的ICS数据集。他们从数据集文档完整性、环境配置可复现性、数据采集流程清晰度、标签准确性等维度进行量化评分。主要贡献:1)首次系统测量ICS数据集的透明度与可重现性水平;2)揭示了现有数据集普遍存在的文档缺失、环境依赖性高、预处理步骤不透明等问题;3)提出了改进数据集发布规范的建议,包括采用标准化元数据、强制容器化环境、提供可执行预处理脚本等。实验结果表明,仅有不到20%的数据集能达到“可完全复现”的标准,多数数据集存在临时性缺失或依赖未公开的私有工具。适合读者:ICS安全研究员、入侵检测系统开发者、数据集维护者以及网络安全会议论文评审人。
💡 推荐理由: ICS数据集的不可复现性直接导致大量研究成果无法被验证或被实际部署,拖延了关键基础设施安全防御的落地。本文揭示了影响复现的根本原因,为提升ICS安全研究的可重复性提供了可操作指引。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Marton Bognar, Lieven Desmet, Frank Piessens
本文提出了 CyCoAnalysis,一个包含网络安全会议元数据的数据集,旨在支持元科学研究(对研究本身的研究)和政策决策。该数据集系统性地收集了多个顶级安全会议(如 IEEE S&P、ACM CCS、USENIX Security、NDSS)的论文元数据,包括标题、作者、机构、出版年份、引用次数等。作者描述了数据集的构建过程、数据清洗和标注方法,并通过初步分析展示了其在揭示安全研究趋势、评估研究影响力、以及为资助机构制定政策提供依据方面的潜在价值。该数据集可复现、可扩展,并已公开用于学术研究。
💡 推荐理由: 为安全社区提供标准化的会议元数据资源,便于进行文献计量分析、趋势追踪和政策评估,有助于理解安全研究的发展动态。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Md Neyamul Islam Shibbir, Deepak K Tosh
本文针对工业控制系统(ICS)中信息技术(IT)与操作技术(OT)融合带来的多阶段网络攻击威胁,指出现有基于溯源(Provenance)的入侵检测系统(PIDS)虽然在IT环境中有效,但在工业信息物理系统(CPS)中应用受限,主要原因在于缺乏同时捕获主机级因果行为、工业网络语义和物理过程状态的数据集。为解决这一问题,作者设计并实现了一个开源、硬件在环(HIL)的CPS测试床,该测试床复制了工业化学反应器控制架构,跨越Purdue模型各层。基于该测试床,提出了ProvICS——一个专为CPS入侵检测构建的多模态溯源数据集。该数据集同步采集四个数据流:来自监控主机和资源受限PLC的完整系统溯源图、解码后的Modbus深度包检测记录,以及物理过程遥测数据。数据集包括48小时的正常阶段和22小时的攻击阶段,覆盖4个攻击战役、20种ICS ATT&CK技术和32个攻击事件,攻击类型涵盖侦察到物理过程操纵。对比分析表明,ProvICS是少数几个同时具备多主机内核级溯源、真实PLC硬件在环执行、解码Modbus流量、物理过程状态测量和原始PCAP踪迹的ICS/CPS基准数据集。基线检测实验验证了跨模态融合能够检测所有32个标注攻击事件(F1=0.913,假阳性率=1.40%),证明该数据集能够暴露跨模态的互补攻击信号,填补了先前基准的空白。
💡 推荐理由: 该研究填补了ICS/CPS领域缺乏多模态溯源数据集的空白,为开发跨主机、网络和物理层的融合检测方法提供了关键基准,有助于提升工业环境对多步攻击的检测能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gints Engelen, Vera Rimmer, Wouter Joosen
本论文回顾了广泛使用的网络入侵检测基准数据集CICIDS2017,对其数据收集流水线进行了深入分析,评估了数据集在流量生成、流构建、特征提取和标注方面的正确性、有效性和整体可用性。研究发现该数据集存在一系列严重问题:流量生成不符合实际网络环境、流构建存在错误、特征提取不一致、标签存在误标。这些问题严重影响了基于该数据集的机器学习模型的训练和评估。作者针对大部分缺陷提出了改进的数据处理方法,包括重新构建或重新标注了超过20%的原始流量记录。实验表明,在修正后的数据集上进行机器学习基准测试,模型性能得到显著提升,验证了数据质量问题对模型评估的巨大影响。本研究揭示了数据质量问题可能导致模型评估结果失真,并为类似数据集的构建和验证提供了预防建议。适合网络安全研究人员、数据科学家以及任何使用CICIDS2017进行入侵检测研究的人员阅读。
💡 推荐理由: CICIDS2017是入侵检测领域广泛使用的基准数据集,本文揭示其严重缺陷并提供了修正方案,有助于提升后续研究的可靠性和可比性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Luciano Pianese, Vittorio Orbinato, Pietro Liguori, Roberto Natella
本文针对生成式AI在网络安全领域带来的威胁,特别关注大型语言模型(LLM)被用于生成PowerShell恶意代码的攻击事件。作者提出了一个评估LLM生成PowerShell恶意软件的实验框架,包括一种新型动态分析沙箱,用于分析AI生成的恶意软件行为。此外,他们构建了一个手动整理的、带有自然语言注释的真实世界PowerShell恶意软件数据集,以辅助LLM的训练和评估。研究评估了多种宽松许可的开源LLM在生成PowerShell恶意软件方面的能力。结果显示,在触发的操作系统恶意事件方面,真实恶意软件与LLM生成的恶意软件之间具有高度相似性,中位Jaccard指数达到84.5%,48.4%的实例实现了完全重叠。该研究揭示了当前LLM在恶意代码生成方面的潜在风险,并为防御方提供了评估和检测AI生成恶意脚本的方法框架。
💡 推荐理由: 随着攻击者利用LLM生成恶意脚本,安全团队亟需理解AI生成恶意软件的能力和特征。本文提供的框架与数据集直接支持检测与防御研究。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Armin Sarabi, Ziyuan Huang 0004, Chenlan Wang 0001, Tai Karir, Mingyan Liu
本文系统性地回顾了2010年至2020年间勒索软件的演变过程,通过收集大量恶意软件样本,构建了一个细粒度的数据集,包含勒索软件家族、变种、传播方式、支付要求等多维信息。基于该数据集,作者进行纵向分析,揭示了勒索软件在技术复杂度、目标选择、攻击策略等方面的趋势变化,如从广泛传播到定向攻击、从简单加密到双重勒索等。研究还评估了不同攻击时段防御措施的有效性。该工作为理解勒索软件生态系统提供了宝贵的实证基础。
💡 推荐理由: 勒索软件是当前最严重的网络威胁之一,该研究提供了十年间攻击技术演变的全局视角,有助于安全团队制定长期防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: José M. Sacristán, Ana I. González-Tablas
本文提出 PRISM(PE 节间关系矩阵),一个用于静态 Windows PE 恶意软件检测的开源数据集和特征表示。现有基准(如 EMBER、BODMAS、SOREL-20M)将 PE 文件表示为扁平的一维特征向量,丢弃了节的顺序和节间关系上下文。PRISM 将每个二进制编码为一个二维矩阵,行按文件顺序对应各个 PE 节,并包含一个全局汇总行以保持与 EMBER 风格模型的兼容性。数据集来自四个恶意软件源(BODMAS、MalwareBazaar、VirusShare 和 CAPE)以及 SOREL-20M 良性软件,共 83,633 个去重矩阵,并构建了一个包含 684 个恶意软件家族的 49,204 个样本的家族过滤分析语料库。通过 Fisher 判别比、互信息和节间信息增益等正式的可分离性分析表明,逐节位置结构包含了扁平表示无法捕获的判别信息。在严格控制的样本匹配比较下,基于 PRISM 紧凑表示的梯度提升分类器在二进制检测性能上几乎与基于更大 EMBER 向量的相同分类器相当,而维度仅为 EMBER 的六分之一;EMBER 仅在极低假阳性区域保持微小的优势,在决策阈值处两者操作上无法区分。作者明确指出二进制检测任务已经饱和,因此 PRISM 保留的结构内容适用于具有更大度量空间的细粒度任务,例如家族分类和直接利用二维结构的架构。数据集、提取库、训练模型和完整分析管道以 CC BY-NC-SA 和 MIT 许可证发布。
💡 推荐理由: PRISM 提供了一种保留 PE 节顺序和节间关系的新型特征表示,弥补了现有扁平特征的不足,有助于提升恶意软件家族分类等细粒度任务的性能,对安全研究人员设计更精准的静态检测模型具有重要参考价值。
🎯 建议动作: 纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman
该论文针对多阶段网络攻击检测中缺乏同时覆盖系统、网络和浏览器日志的标注数据集的问题,构建了一个包含约230万条事件、870个会话(70个攻击会话、800个正常会话)的多源日志数据集。数据集在Windows端点同时捕获系统、网络和浏览器活动,并利用MITRE ATT&CK框架为恶意事件标注了12种战术和53种技术的技术ID。攻击数据使用真实工具生成,包括远程访问木马、命令与控制隧道和云数据泄露。为验证数据集的可学习性,论文使用低秩适配(LoRA)微调了三个小语言模型(SLM):Qwen2.5-1.5B、Llama-3.2-3B和Phi-4-Mini,在分块分类和ATT&CK技术识别两个任务上评估性能。结果显示,微调后所有模型在所有指标上均优于基础版本,分块分类准确率从约8%提升至90%-97%,但技术精确匹配准确率最高仅为42%,部分匹配分数较高表明模型学到了大部分推理逻辑。该研究填补了现有数据集在涵盖三种日志源并具备ATT&CK技术级别标注方面的空白,为多阶段攻击检测的机器学习方法提供了宝贵资源。
💡 推荐理由: 此前缺乏同时覆盖系统、网络和浏览器日志且带有ATT&CK技术标注的公开数据集,该工作填补了这一空白,有助于训练更准确的跨源攻击检测模型。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bojing Li, Duo Zhong, Prajna Bhandary, Raguvir S, Charles Maxa, Robert J Joyce, Charles Nicholas
本文提出MASCOT-Android,一个经过整理的Android恶意软件源代码数据集及自动化收集流水线。Android恶意软件源代码相较于二进制或反编译代码更能直接反映攻击者意图,但由于源代码稀缺且人工审查成本高昂,此类数据集难以构建和维护。作者的关键发现是:仓库级别的README文档本身即能作为恶意软件源代码收集的强信号。方法上,他们从8,772个恶意软件和25,747个良性项目的README文档中提取字符级TF-IDF特征,训练LinearSVC分类器区分恶意仓库。该仅基于README的模型在本地评估中达到96.28%的准确率和1.06%的假阳性率。此外,模型输出置信度分数,允许用户调整决策阈值以平衡假阳性率和覆盖率,使实际收集过程更具灵活性。研究贡献包括:提供了一个公开可用的Android恶意软件源代码数据集;提出了一个可扩展的自动化收集框架,降低了对人工标注的依赖;验证了项目文档作为安全信号的有效性。该工作适用于恶意软件分析、威胁情报收集及机器学习检测模型训练等场景。
💡 推荐理由: 为安全分析师提供了自动化、低成本获取Android恶意软件源代码的途径,有助于深入理解攻击者意图,改进基于源码的检测与防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiongchi Yu, Xiaofei Xie, Qiang Hu, Yuhan Ma, Ziming Zhao 0008
内部威胁是企业安全领域持续存在的重大风险,但由于恶意行为常隐藏于细微的用户活动中,在复杂企业环境下难以检测。现有基于机器学习的内部威胁检测(ITD)技术受限于高质量、真实训练数据的缺乏——公共数据集规模小,合成数据集缺乏泛化性、丰富语义和真实行为模式。本文提出Chimera,一个基于大语言模型的多智能体框架,可自动模拟良性及恶意的内部活动,并监控跨企业环境的系统日志。Chimera将每个智能体建模为具有精细角色的个体员工,并引入小组会议、成对交互和自组织调度以捕捉真实组织动态。基于从真实事件抽象出的15种内部攻击类型,Chimera在三个典型数据敏感组织场景中部署,构建了新数据集ChimeraLog。通过人工研究和定量分析验证了数据集的多样性和真实性。现有ITD方法在ChimeraLog上的检测性能显著低于现有数据集,表明其是更具挑战性和现实性的基准。尽管存在分布偏移,在ChimeraLog上训练的ITD模型展现出强泛化能力,凸显了基于LLM的多智能体仿真在推进ITD方面的实用价值。
💡 推荐理由: 当前内部威胁检测因缺乏高质量训练数据而受限,Chimera通过LLM多智能体仿真生成更真实、多样化的数据集,直接提升检测模型的现实适用性,对蓝队和SOC构建有效内部威胁检测系统具有重要意义。
🎯 建议动作: 研究跟进,评估ChimeraLog数据集及多智能体仿真方法对内部威胁检测模型训练的潜在价值
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoting Zhang, Zhipeng Gao, Yiran Lv, Xing Hu, Feifei Niu, Xin Xia
该论文提出了 GiANT 自动化框架,旨在解决智能合约审计数据集构建中的人工可扩展性瓶颈以及数据粒度和多样性不足的问题。GiANT 采用分治策略结合思维链技术,从 Code4rena 平台上的真实审计报告中提取结构化漏洞信息,并通过 LLM 作为裁判机制进行严格的质量保证。研究者在 388 份真实审计报告上运行 GiANT,生成了包含 7,711 个漏洞发现、覆盖五个严重级别的 GiAnt Corpus 数据集。手动评估显示信息提取可靠性极高,平均质量得分 4.76/5,评分者间一致性 κ=0.88。进一步,他们使用该数据集对四个最先进的 LLM 在漏洞检测、代码摘要、缓解建议和自动 Gas 优化任务上进行基准测试,建立了性能基线,为自动化智能合约审计的未来研究提供了宝贵的数据基础。
💡 推荐理由: 该工作提供了一个高质量、大规模、多粒度的智能合约审计数据集,有助于推动自动化审计工具和大型语言模型在区块链安全领域的研究与评估。
🎯 建议动作: 研究跟进,考虑将该数据集纳入智能合约安全工具的评估基准。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Carl Lochstampfor, Ayan Roy
该论文聚焦于多轮短信诈骗(smishing)检测,针对此前工作中提出的合成对话数据集COVA(3,201条标注对话)的局限性进行了扩展。作者指出COVA存在数据污染、标签不匹配、阶段指示泄露以及提示设计缺陷等问题,导致Transformer模型(如BERT)因输入截断和训练数据不足而表现不佳,而基于TF-IDF特征的XGBoost反而取得了最佳性能(准确率72.5%,macro F1 0.691)。为此,论文提出了COVA-X扩展数据集,包含10,985条对话,覆盖8种针对老年人的诈骗类型。通过改进的生成流程,标签纠错率从49.8%提升至3.9%(改善12.7倍),虚拟绑架类对话的人为痕迹率从67.1%降至46.5%。在扩展数据集上重新训练所有分类器后,核心发现是Longformer模型全面超越XGBoost,准确率达到79.71%,macro F1 0.7786,而XGBoost为78.43%和0.7563。这直接证实Transformer模型需要更大规模的对话语料才能发挥其上下文优势。此外,论文还进行了每类诈骗的结果分析,表明诈骗类别对检测效果有机制一致的影响;清洗前后的敏感性分析证实,数据精炼在所有三种分类器架构上都能恢复真正的标签相关信号。该研究为多轮短信诈骗检测提供了更高质量的数据集和更强的基线模型。
💡 推荐理由: 该工作为多轮短信诈骗检测提供了高质量扩展数据集和更强的基线模型,Longformer的优异表现表明上下文建模的重要性,有助于提升安全防护中针对复杂社交工程的检测能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Parthajit Borah, Sakshi Singh, D. K. Bhattacharyya, J. K. Kalita
恶意软件检测是网络安全领域的关键挑战,因为恶意软件具有复杂结构和行为。现有的检测方法中,通过函数调用图(FCG)分析恶意软件的结构和行为模式是一种可靠的方法,但缺乏足够大且高质量的数据集来支撑对众多恶意软件家族的有效分类。本文提出了AMD-FCG,一个增强的函数调用图数据集,其中集成了恶意软件的拓扑特征。该数据集包含多种恶意软件样本和良性应用程序的FCG,旨在为安全专业人员提供无需动态分析和大量预处理的高效检测流程。AMD-FCG框架简化了工作流程,可支持开发和部署更创新、高效的恶意软件检测系统。实验部分(根据摘要推断)可能验证了数据集在分类准确性和鲁棒性上的优势。该研究贡献了一个标准化基准数据集,有助于推动基于图的恶意软件检测研究。
💡 推荐理由: 为恶意软件检测研究提供了高质量、带拓扑特征的函数调用图数据集,填补了现有公共数据集不足,有助于开发和评估基于图神经网络的检测模型,提升安全分析效率。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hugo Bertin, Marc Dacier, Yérom-David Bromberg
该论文针对多人在线游戏(MOG)中作弊行为难以检测的问题,提出并构建了首个包含网络流干扰类作弊日志的公开数据集。作弊行为严重破坏游戏公平性,降低玩家满意度,尤其是一类基于网络流干扰的作弊(如篡改数据包延迟、丢包等)现有方法难以解决。为了支持此类作弊检测研究,作者利用一个实验框架,该框架集成了一款多人在线游戏和一个插件,插件能够复现多种作弊攻击,并同时收集网络层和应用层的日志。数据集包含真实玩家和自动化游戏客户端进行的多场游戏会话记录,明确标注了作弊行为。除了网络流干扰作弊,还记录了常见的自瞄(aimbot)和透视(wallhack)等作弊。该数据集旨在为学术界和工业界的研究者提供研发在线游戏作弊检测机制的基础。数据集设计为可扩展的,其他研究者可以利用所提供的框架创建自己的数据痕迹来丰富数据集。论文的主要贡献是填补了缺乏代表性标注数据集的空白,尤其是针对网络流干扰作弊,为后续检测算法验证提供了标准基准。适合游戏安全、流量分析、异常检测等领域的研究人员阅读。
💡 推荐理由: 网络流干扰类作弊长期缺乏公开数据集,阻碍了检测技术发展。该数据集填补了这一空白,为研究者和安全团队提供了标准化测试基准,有助于推动在线游戏公平性保障技术的进步。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wan-Hsuan Hsu, Wei-Hsin Wang, Cheng-Yu Liou, Ting-Rui Ke, Kentaroh Toyoda
该论文提出了Bastet,一个面向去中心化金融(DeFi)智能合约漏洞检测的细粒度专家标注数据集。2024年,DeFi协议因智能合约漏洞累计损失超过14.9亿美元,基于大语言模型(LLM)的漏洞检测成为有前景的应对方案,但现有评估数据集存在三大问题:基于过时的Solidity版本(如v0.4),无法反映现代DeFi合约;依赖自动化或LLM生成的标注,引入幻觉导致的标签噪声;采用粗粒度的单层标签,难以捕获真实业务逻辑漏洞的语义复杂性。Bastet通过以下方式解决这些问题:数据来源为2021-2024年的真实审计发现;由人类专家通过讨论达成共识进行标注;采用两层分类体系,包含46个标签和77个子标签。数据集包含从394份Code4rena竞争性审计报告中收集的4,402个发现(时间跨度为2021年4月至2024年11月),其中849个发现由DeFiHackLabs社区的白帽安全研究人员完全标注。所有标注均通过双标注者共识工作流程生成,确保了基于真实漏洞根因的标签准确性。该数据集的主要贡献在于:提供高质量、精细化的基准,以推动LLM在DeFi安全领域的应用研究,并促进可复现的实验评估。适合智能合约安全研究人员、LLM应用开发者及DeFi协议审计人员阅读。
💡 推荐理由: 现有漏洞检测数据集质量低下,限制了LLM模型的实际效果。Bastet通过专家标注和精细分类,为DeFi智能合约漏洞检测提供了可靠基准,有望显著提升自动化审计的准确性和实用性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vincent Koc, Patrick Erichsen, Jacob Tomlinson, Agustin Rivera, Michael Appel, Nir Paz
该论文研究了AI代理技能(Agent Skills)的安全信号问题。代理技能是一种可重用的指令、工具、脚本、引用和工作流,它们扩展了AI代理的能力,但其安全边界既不同于模型安全也不同于传统包恶意软件检测。论文构建了ClawHub Security Signals数据集,包含67,453个最新的公共OpenClaw技能版本,每个条目包含经过审查的SKILL.md内容和打包文件,以及来自三个扫描器家族的最终ClawScan注册表裁决和证据:VirusTotal(基于签名的恶意软件检测)、静态启发式分析和NVIDIA SkillSpector(语义代理风险评估)。作者不估计恶意技能的流行率,而是研究扫描器之间的不一致性。主要发现:三个扫描器很少标记相同的技能,任意两个扫描器在其组合阳性中重叠最多10.4%,仅0.69%的技能被所有三个扫描器标记,81.9%的被标记技能仅被单个扫描器识别。不一致性由攻击面决定:SkillSpector主要检测语义代理风险,在25,504个可疑行中标记了19,209个(75.3%),但在206个恶意行中仅标记了14个(6.8%);而恶意判定区域呈现相反分布:206个恶意行中150个(72.8%)被VirusTotal标记,这与捆绑代码的恶意软件证据一致。结果表明,代理技能安全需要分层治理,而非单扫描器允许/阻止决策。数据集作为经过处理的银标准数据集发布,标签是注册表的自动裁决,而非人工标注的真实结果,旨在支持社区进一步研究,例如针对技能安全分类的专用模型。
💡 推荐理由: 揭示了当前AI代理技能安全检测中多扫描器结果高度不一致的问题,强调了需要多层治理而非单一决策,对安全运营中评估代理技能风险有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Víctor Mayoral-Vilches
本文介绍了网络安全人工智能(CAI)数据集,这是一个为期十四个月的网络安全大语言模型(LLM)轨迹语料库,通过开源CAI agent框架收集。研究背景源于PentestGPT的发现:专家操作员轨迹而非基础模型能力是网络安全LLM性能的瓶颈。CAI数据集包含230,935个会话日志和26,027,742个用户提示,来自123个国家的16,768个源IP,涉及4,187个独特的LLM标识符,针对23,147个目标域,占用18.07 TB存储空间。数据混合了实战操作(36.4%攻击性、20.1%攻击者意图、27.5%业务/集成、4.4%防御性),据作者所知,这是已知最大的LLM驱动黑客轨迹语料库。数据集以不同规模(CAI Dataset10、CAI Dataset1k、CAI Dataset200k)向合作伙伴和选定客户发布。长期来看,该语料库记录了网络安全本身的自动化:操作员经常将实时凭证、生产主机名和令牌粘贴到提示中,明知输入会被记录,但为了保持竞争力而接受这一权衡。跨行业聚合后,大量攻击和防御操作上下文集中在少数前沿模型API提供商手中,形成一个单一故障面,一旦泄露或被出于政治动机重新利用,可能导致国家或企业规模的破坏。作者认为,唯一既能保持生产力优势又能保护操作员机密性的配置是在操作员信任边界内本地托管部署的网络安全专用LLM,而CAI数据集正是为使其实用而构建的。
💡 推荐理由: 该数据集首次大规模展示了网络安全LLM在实际操作中的真实轨迹,揭示了操作员在效率与隐私之间的现实权衡,对理解LLM在安全领域的风险与机遇至关重要。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: David Košťál, Martin Jureček
该论文提出了一个对抗性恶意软件数据集,基于公开的RawMal-TF真实恶意软件二进制文件集合。作者使用一套对抗性恶意软件生成器,构建了两个对抗性PE文件数据集:一个包含44,347个按家族标记的样本,另一个包含33,596个按类型标记的样本。这两个数据集针对EMBER分类器分别实现了98.35%和92.20%的逃逸率。每个对抗二进制文件都附有详细元数据,包括EMBER评分和VirusTotal分类结果。此外,论文通过一系列训练实验展示了恶意软件分类管道对数据投毒攻击的脆弱性:在家族标记数据集中仅注入0.5%的完全错误标记的对抗样本,就使得针对重新训练分类器的逃逸率从26.1%增加到92.8%。该数据集已公开发布,旨在促进对抗性恶意软件、投毒攻击以及基于机器学习的恶意软件检测系统鲁棒性的未来研究。
💡 推荐理由: 该研究提供了高逃逸率的对抗样本数据集,揭示了机器学习恶意软件检测系统面临的对抗性逃避和数据投毒双重威胁,对安全防御者评估和加固检测模型具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Joshua Bean, Dimitrios Michael Manias
本文系统综述了电动汽车充电基础设施(EVCI)的网络安全研究进展、现存挑战与未来方向。随着电动汽车普及,充电桩作为连接电网、通信网络和车辆的交汇点,面临日益严峻的网络攻击面。作者首先梳理了针对EVCI的典型攻击场景,包括对充电通信协议(如ISO 15118、OCPP)的利用、对充电桩固件的篡改、以及对电网侧的负荷操控攻击。现有防御措施主要依赖基于机器学习的入侵检测系统(IDS),但这些系统的性能受限于训练数据的质量和多样性。论文深入分析了当前公开和私有数据集的局限性,例如缺乏真实攻击流量、样本不平衡、场景覆盖不全等,并比较了各类IDS模型(如监督式、半监督式、生成式方法)在EVCI中的适用性。主要贡献在于:1)全面汇总了EVCI网络安全领域的数据集资源;2)识别了从数据采集、特征工程到模型评估的八项关键挑战;3)提出了未来研究方向,包括利用联邦学习保护数据隐私、构建数字孪生模拟环境、以及设计自适应攻击检测框架。适合从事智能电网安全、联网汽车安全以及工业控制系统安全的研究人员和工程师阅读。
💡 推荐理由: 电动汽车充电基础设施是新型关键基础设施,其网络安全直接影响电网稳定与用户安全。本文系统梳理了该领域的数据与方法瓶颈,为安全从业者开展针对性防御研究提供了重要参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chang Liu, Noah Fleischmann, Nicolò Altamura, Edward Raff, James Holt, Kristopher Micinski
该论文提出了ASSEMBLAGE-DEEPHISTORY,一个跨构建的二进制数据集,旨在弥补现有二进制语料库缺乏时间维度、跨编译多样性以及CVE标签组合的不足。数据集包含73,610个二进制文件,涵盖248个开源项目,使用GCC、Clang和MSVC编译器,在Linux和Windows平台上以多种优化级别编译,并包含跨多年的历史构建。每个二进制文件都通过数据库索引,关联其源代码、函数、调试信息、变体构建、历史版本以及易受攻击的函数。论文通过三个分析展示了该数据集的价值:一是设计了一个三阶段的LLM基准测试(识别、策略引导检测、跨构建迁移),用于测试LLM是否真正推理二进制漏洞还是仅匹配构建特定的模式;二是比较了MalConv嵌入、jTrans函数嵌入和TLSH模糊哈希在不同包版本的聚类效果;三是通过贝叶斯回归将二进制相似性分解为时间距离、文件变更和提交等贡献因素。该论文适合二进制安全分析、漏洞研究、机器学习应用于逆向工程领域的研究人员阅读。
💡 推荐理由: 该数据集为二进制安全研究提供了首个融合跨编译多样性、历史版本和CVE标签的统一框架,有助于提升漏洞检测模型的泛化能力和可解释性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh
本文介绍了 BEACON(Behavioral Engine for Authentication & Continuous Monitoring),一个大规模多模态数据集,旨在支持高保真游戏环境下的行为生物特征认证研究。背景方面,现有连续认证基准受限于小规模、单模态或缺乏同步环境上下文,难以反映真实认知与运动需求。为解决此问题,作者从战术射击游戏《Valorant》中采集数据,该游戏要求高精度运动技能和高认知负荷,为行为生物特征的鲁棒性提供了严格测试。数据集包含从 28 名玩家的 79 场游戏中收集的约 430 GB 同步模态数据(磁盘总大小 461 GB,含辅助配置),估计活跃游戏时长 102.51 小时。模态包括:高频鼠标动态(移动、点击、轨迹)、键盘事件(按键时序与组合)、网络数据包捕获(流量模式与延迟)、屏幕录像(视觉上下文)、硬件元数据(帧率、输入设备)及游戏内配置(灵敏度、键位设置)。所有模态在时间上精确同步。BEACON 可用于连续身份验证、行为画像、用户漂移检测及多模态表示学习等研究。作者在 Hugging Face 和 GitHub 上公开了数据集与代码,旨在建立可复现的基准以评估下一代行为指纹与安全模型。适合安全研究人员、行为生物特征学者、游戏数据科学家阅读。
💡 推荐理由: 该数据集提供了高精度、多模态的游戏行为数据,可模拟真实高压场景下的用户行为,有助于开发更鲁棒的连续认证方案,减少传统静态认证的局限性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bikrant Bikram Pratap Maurya, Nitin Choudhury, Daksh Agarwal, Arun Balaji Buduru
该论文针对键盘声学侧信道攻击(ASCA)中存在的数据集规模小、用户/键盘/环境多样性不足等问题,提出了一个全新的多维度数据集HEAR,涵盖53名参与者使用37种笔记本电脑键盘的录音,包括三种采集场景:外接麦克风、设备内置麦克风(无网络噪声)以及基于VoIP的流式传输。基于HEAR,论文建立了ASCA基准测试,评估了传统特征和预训练表征(包括单模态和多模态)。为解决跨键盘泛化问题,作者提出了DECKER框架,通过键盘签名归一化、域对抗解耦、跨键盘对比对齐和声学风格随机化四个阶段学习域不变嵌入,并利用基于LLM的后处理层进行句子级推理以增强识别。实验表明,DECKER在跨键盘和跨用户场景下显著提升了击键识别准确率,语言模型校正进一步带来增益。研究结果证实ASCA在多样化用户、设备和噪声环境中仍具有实际威胁。
💡 推荐理由: 该研究揭示了键盘声学侧信道攻击在现实多设备、多用户场景下的持久有效性,为安全防御者提供了评估风险的新基准和对抗思路,具有重要的安全研究意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)