👥 作者: Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar
传统恶意软件检测系统通常依赖单一表示(模态),如二进制字节、反汇编代码或图像等,难以识别新型威胁,且某些模态提取依赖于反汇编成功率,引入额外失效模式。已有工作尝试通过集成更多模态或更判别性表示来提升分类性能。本文提出 Malformer,一个四模态恶意软件检测模型,融合了 Windows 可执行文件的文本、图像、图和音频四种表示,利用多模态 Transformer 融合机制增强检测能力。具体架构包括两个 RoBERTa 编码器分别处理文本和图谱相关特征,一个改进的 Vision Transformer 处理图像数据,WavLM 处理音频数据,并采用自适应损失加权方案动态融合各模态表示。在包含 201,549 个二进制样本的数据集上评估,Malformer 达到 98.3% 的准确率和 0.9833 的 F1 分数,显著优于单模态基线和双模态检测器,性能提升 4.6 至 17.6 个百分点。结果表明多模态融合为应对日益增长的恶意软件威胁提供了有前景的基础,赋予防御者更通用且稳健的检测能力。该研究的核心贡献在于验证了多种异构模态组合的可行性,特别是引入音频表示这一较新颖的模态,并通过自适应权重学习平衡各模态贡献,从而提升整体检测鲁棒性。适合对机器学习安全、恶意软件分析及多模态学习感兴趣的研究人员和安全工程师阅读。
💡 推荐理由: 该研究证明多模态Transformer融合可显著提升恶意软件检测的准确性和鲁棒性,为蓝队摆脱单一特征局限、应对新型变种提供了可行思路,值得安全团队关注其对现有检测架构的启发。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohammadreza Ebrahimi 0001, Jason Pacheco, Weifeng Li 0002, James Lee Hu, Hsinchun Chen
本文研究针对静态恶意软件检测器的黑盒对抗攻击问题。近年来,基于机器学习和深度学习的静态恶意软件检测器在识别未知恶意软件变体方面表现出色,因此被广泛采用以降低动态分析和人工签名识别的成本。然而,研究表明这类检测器容易受到对抗性恶意软件攻击的影响,即攻击者巧妙地修改已知恶意软件可执行文件,使其被误判为良性文件。现有的大多数对抗性恶意软件样本生成(AMG)方法依赖于检测器的架构或参数等先验知识,这在实践中通常不可获得;此外,这些方法大多局限于追加式修改,即仅向文件末尾追加内容而不改变原始内容,限制了攻击的灵活性和有效性。针对这些局限,本文提出了一种基于强化学习的新方法AMG-VAC,将变分Actor-Critic(VAC)算法扩展到非连续动作空间,以处理恶意软件修改中固有的离散操作。作者在两个知名的基于机器学习的恶意软件检测器上评估了该方法的逃逸性能,实验结果表明,AMG-VAC在统计显著意义上优于现有的非强化学习和基于强化学习的AMG方法。此外,生成的对抗性动作序列有助于揭示检测器存在的漏洞,为改进检测器的鲁棒性提供了方向。本文的研究贡献在于提出了一种无需内部知识即可生成对抗样本的黑盒方法,并展示了强化学习在离散动作空间中解决该问题的有效性,适合对对抗性机器学习、恶意软件检测和强化学习应用感兴趣的研究人员阅读。
💡 推荐理由: 该研究揭示了静态恶意软件检测器在无需内部知识的情况下可被黑盒对抗攻击绕过,为评估检测器鲁棒性和改进防御提供了重要参考。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Vibha Bhavikatti, Mark Stamp
该研究专注于恶意软件检测领域中的二进制到图像转换技术,并引入可解释人工智能(XAI)工具来提升模型的可解释性。作者使用 Gradient-weighted Class Activation Maps (Grad-CAM) 作为解释工具,分析了由恶意软件样本生成的八种不同图像表示类型。研究目标包括:通过定量指标评估 Grad-CAM 热图的忠实度(faithfulness)和稳定性(stability),并将其与另一种解释方法 HiResCAM 进行对比;同时验证 Grad-CAM 特征能否用于恶意软件分类。实验表明,利用 MobileNetV2 卷积神经网络从 Grad-CAM 图像中提取特征,再使用随机森林分类器,可以在包含 17 个恶意软件家族的数据集上达到 0.777 的测试准确率,超过了该数据集之前 0.750 的基准结果。此外,研究还发现一个关键现象:在所选用的八种图像变换中,分类准确率与解释的忠实度并不一致,即能够产生最忠实解释的图像变换方法,其分类准确率仅处于中等水平。这一发现对恶意软件检测模型的设计与评估具有重要意义,提示在追求高准确率的同时需要兼顾可解释性。该工作为后续将 XAI 引入恶意软件分析提供了定量分析和实证基础。
💡 推荐理由: 该研究将可解释人工智能(Grad-CAM)系统应用于恶意软件图像检测,揭示了准确率与解释忠实度之间的矛盾,为蓝队在选择模型和特征表示时提供了新的评估维度,有助于提升安全检测的可信度。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Faisal Ahmed, Zarin Tasnim Biash, Abu Raihan Shakil, Ahmed Ann Noor Ryen, Arman Hossain, Faisal Bin Ashraf, Muhammad Iqbal Hossain
随着智能设备(如智能手机和平板电脑)的普及,移动应用生态蓬勃发展,但恶意软件也日益猖獗。尽管官方应用商店要求应用在上架前通过恶意软件筛查,许多恶意应用仍能通过隐藏复杂变种绕过检测,且其恶意行为往往仅在运行时触发,传统的静态分析难以识别,导致恶意软件可能在安装后才被察觉,进而对用户和设备造成不可逆的损害。针对这一问题,本文提出了一种名为 ShielDroid 的实时 Android 恶意软件检测框架,采用混合动态分析技术,通过分析应用运行时的行为来准确识别和分类复杂恶意软件。研究流程包括:首先对收集的数据集进行预处理和过滤,然后使用多种机器学习算法对应用进行分类,并对不同分类技术在检测准确率和执行时间方面进行了综合性能评估。实验结果表明,将随机森林(Random Forest)与多层感知机(Multilayer Perceptron)结合的混合模型取得了最佳综合性能,准确率达到 97.5%,执行时间为 22.945 秒。该框架能够提升移动设备安全防护能力,通过及时检测恶意应用降低网络攻击风险。本文的主要贡献在于提出了一个结合传统机器学习与深度学习的混合动态检测方案,并在实际数据集上验证了其有效性,为移动端恶意软件检测提供了新的思路。适合移动安全研究人员、SOC 分析师及移动应用安全工程师阅读。
💡 推荐理由: 该研究聚焦 Android 恶意软件的运行时行为检测,提出的混合模型(RF+MLP)在准确性和效率上表现均衡,对移动端威胁检测方案的设计具有参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang
随着开源软件(OSS)的广泛采用,恶意代码投毒攻击已成为针对公共包注册表和开源平台的重要安全威胁。攻击者通过向合法仓库中注入恶意代码,可在下游用户不知情的情况下窃取数据、植入后门或破坏供应链。现有的恶意代码检测方法主要分为基于启发式规则、基于机器学习以及基于大语言模型(LLM)三类,但普遍存在语言特定设计、跨语言泛化能力差、分析成本高昂等问题,难以适应大规模多语言仓库的检测需求。为应对上述挑战,本文提出 MalTotal,一个可扩展、具备成本效益且语言无关的恶意代码投毒检测框架。MalTotal 的核心方法包括:利用 LLM 辅助语义推理识别代码中的敏感 API,通过混合语义切片(hybrid semantic slicing)技术对代码进行细粒度分析,并结合重构恶意行为上下文(reconstruct malicious behavior contexts)来判定代码是否具有恶意意图,同时显著降低分析开销。作者在 5 种主流编程语言的多组数据集上进行了评估,结果表明 MalTotal 平均 F1 分数达到 93.1%,优于 8 个现有基线方法;其混合切片技术减少了 94.0% 的 LLM token 消耗,将针对 2168 个仓库的分析成本从 86.25 美元降至 5.19 美元。此外,作者对 120K 个 GitHub 仓库(包含超过 730 万个文件)进行了大规模扫描,以总计 338 美元的成本发现了 564 个此前未知的恶意仓库,证明了该方法在真实场景中的有效性、可扩展性和成本可控性。该研究对于增强开源供应链安全防护、推动大语言模型在恶意代码检测领域的落地具有重要参考价值,适合安全研究员、SOC 分析师以及开源社区维护者阅读。
💡 推荐理由: 开源供应链投毒攻击日益猖獗,现有检测工具难以兼顾跨语言、低成本和规模化。MalTotal 提供了一种面向防御者的大规模恶意仓库筛查方案,显著降低分析成本,可直接应用于代码审计或 CI 扫描流程,帮助蓝队提前发现未知风险。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: ABM. Adnan Azmee, Pranto Protim Choudhury, Md. Aosaful Alam, Orko Dutta, Muhammad Iqbal Hossain
该论文针对传统基于签名的防病毒软件难以检测新型恶意软件的问题,提出了一种基于机器学习(ML)的恶意软件检测框架。研究选取了基准恶意软件数据集,对多种主流的分类算法——包括人工神经网络(ANN)、支持向量机(SVM)、XGBoost和Extra Trees分类器——进行了系统的评估与比较。实验结果显示,XGBoost表现最优,达到了98.62%的准确率,显著优于其他模型。为了验证方法的实际可应用性,作者还利用Flask框架开发了一个实时的客户端-服务器恶意软件检测系统,能够对可执行文件进行恶意或良性的高效分类。研究结论表明,先进的机器学习技术能够有效提升恶意软件检测能力,为构建智能、可扩展的网络安全解决方案提供了有力支持。本文适合对基于ML的恶意软件检测方法感兴趣的研究人员、安全工程师和SOC分析人员阅读,有助于了解不同算法的性能对比及实际部署方案。
💡 推荐理由: 为蓝队提供基于ML的恶意软件检测基准对比,尤其XGBoost的高准确率可作为内部检测模型选型的参考依据。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alireza Abolhasani Zeraatkar, Parnian Shabani Kamran, Inderpreet Kaur, Nagabindu Ramu, Tyler Sheaves, Hussain Al-Asaad
本文研究基于硬件性能计数器(HPC)的恶意软件检测方法。HPC 是处理器运行时采集的低层微架构活动数据,可反映应用行为。传统杀毒软件依赖特征匹配,难以应对未知威胁;硬件辅助检测作为补充,可增强系统安全。然而,HPC 检测面临挑战:处理器每个时钟周期最多只能同时测量 2 到 8 个性能事件,而完整刻画应用行为通常需要更多事件,导致检测效率低下。为此,作者提出利用集成学习技术优化 HPC 选择与分类器组合,以较少的 HPC 数量达到甚至超过传统多 HPC 方案的检测性能。实验基于 18 种机器学习模型和两种集成学习方法,构建了共 144 种配置。结果表明,采用集成学习仅用 2 个 HPC 即可比使用 8 个 HPC 的标准分类器提升最多 10% 的检测性能;同时,仅需 4 个 HPC 就能匹配使用 16 个 HPC 的标准 ML 检测器性能,从而大幅降低硬件测量开销,使运行时恶意软件检测成为可能。该研究为高效、低开销的硬件级恶意软件检测提供了新思路,并验证了集成学习在减少性能事件数量方面的有效性。
💡 推荐理由: 硬件级检测可弥补传统杀软的盲区,本研究表明集成学习能以极小开销实现高检测率,为端点防病毒和云工作负载的实时监控提供可落地的优化方向,值得安全工程师关注。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Milad Nasr, Yanick Fratantonio, Luca Invernizzi, Ange Albertini, Loua Farah, Alex Petit-Bianco, Andreas Terzis, Kurt Thomas, Elie Bursztein, Nicholas Carlini
本文研究的是生产环境中的恶意软件检测系统在面对可迁移对抗性攻击时的鲁棒性。随着深度学习模型被广泛集成到大型生产系统中,其个体缺陷可能被利用,进而引发系统层面的安全漏洞。作者以 Gmail 的恶意软件检测流水线为案例,该流水线依赖一个名为 Magika 的机器学习模型来识别文件类型,并据此将潜在恶意软件路由至不同的专用检测器以提升准确率和性能。Magika 已开源,使得攻击者可以针对其构造对抗样本:通过仅修改恶意软件样本中的 13 个字节,作者在 90% 的情况下成功欺骗 Magika,导致恶意软件被错误路由至不匹配的检测器,从而绕过 Gmail 的检测机制。随后,作者提出了相应的防御策略,使得在防御后的生产模型中,即使是资源充足的攻击者也需要 50 字节才能达到仅 20% 的攻击成功率。该防御已与 Google 工程师合作部署至 Gmail 分类器的生产环境中。本文的核心贡献包括:揭示生产系统中 ML 组件的脆弱性传导机制、提出具体可操作的对抗样本构造方法(但摘要未提供技术细节)、设计并部署了有效的缓解措施。适合安全研究员、ML 系统开发者以及关注对抗鲁棒性的安全工程师阅读。
💡 推荐理由: 该研究展示了 ML 组件在生产流水线中的安全短板如何被攻击者利用,即使单个模型未被攻破,错误路由也可绕过整体检测。防御已实际部署,对邮件安全与 ML 系统安全设计有直接借鉴意义。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yinan Gao, Jiarong Xu, Xiaohang Zhao, Xiao Fang
随着组织数字化转型的深入,网络安全风险日益突出,恶意软件已成为一种普遍且破坏性极强的威胁。现有基于字节的机器学习检测方法虽然广泛应用,但容易受到攻击者通过操纵原始字节实施规避行为的影响。相比之下,基于图的方法通过将软件表示为捕获执行行为的程序图,受此类操控影响较小,但现有图方法未能显式识别共同实现有意义程序行为的基本块聚簇,也未能学习足够具有表达力的程序图表示以实现精确检测。针对上述问题,本文提出 MalGuard——一种面向组织恶意软件风险管理的图基恶意软件检测方法。MalGuard 包含两项方法论创新:一是操作角色识别方法,将基本块的凝聚组识别为操作角色,使检测器能够捕获从孤立基本块中不可见的程序行为;二是程序图表示学习方法,通过建模操作角色之间的交互来学习富有表达力的程序图表示,保留稀疏的恶意信号并捕获层次化图结构。大量实验表明,MalGuard 在检测性能上优于现有方法,并降低了未检出恶意软件带来的预期成本。本文属于信息系统(IS)领域的恶意软件检测研究,适合关注图神经网络与恶意软件检测交叉方向的研究人员、安全分析师以及负责组织风险管理的从业者阅读。
💡 推荐理由: 该研究提出一种新颖的图基恶意软件检测框架,通过识别操作角色和学习层次程序图表示,显著提升对规避行为的鲁棒性,为组织恶意软件风险管理提供了更可靠的检测方案。
🎯 建议动作: 研究跟进,评估其方法在内部恶意软件检测流程中的适用性。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Andrea Ponte, Daniel Gibert, Matous Kozak, Dmitrijs Trizna, Maura Pintor, Battista Biggio, Fabio Roli, Luca Demetrio
该论文指出现有基于AI的Windows恶意软件检测器缺乏系统性的评估方法,导致无法确定哪种模型适合实际部署。现有评估存在四个主要缺陷:1)训练和测试数据不统一;2)未考虑时间维度,无法检验模型随时间推移的性能衰减;3)缺少对抗攻击下的安全性评估,尤其是内容注入攻击;4)忽略计算开销,可能导致终端上推理速度缓慢。为弥补这些不足,作者提出了EXE-Bench,一个综合性的基准测试框架。EXE-Bench从性能、时间鲁棒性、对抗鲁棒性和计算开销四个维度评估检测器,并将这些指标聚合为单一分数,从而实现模型间的直接公平比较。通过实验,论文强调仅仅在部署后进行性能评估是不够的,无法全面反映模型表现。关键发现是:基于特征工程注入领域知识的传统方法(如手工特征)在抵抗时间变化和对抗攻击方面依然极其有效,而大多数深度神经网络仅在部署初期表现优异,长期和对抗环境下性能下降严重。该研究为安全社区选择实际可用的AI恶意软件检测器提供了重要参考。
💡 推荐理由: 安全团队需要知道如何在多个AI恶意软件检测器中做出选择,而现有评估碎片化。EXE-Bench提供了一个统一基准,帮助从业者权衡性能、鲁棒性与部署成本,避免仅凭短期准确率做出错误决策。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shiwen Song, Yiheng Xiong, Sen Chen, Xiaofei Xie
该论文针对Android恶意软件检测问题,指出现有方法基于表面信号(如学习特征或代码片段)进行检测,容易产生误报和漏报,因为偏离代理信号并不等同于恶意。作者提出行为导向的检测方法,并实现系统Praxis。Praxis采用假设-确认-判断流水线:首先从粗粒度静态信号假设候选行为,然后通过程序分析验证代码证据来确认行为,最后在上下文中判断确认的行为是否真正恶意(考虑用户意识、应用功能上下文以及它们如何组合成攻击)。对于恶意应用,Praxis返回判决和支持的行为。实验在三个挑战性场景下与七种基线方法对比,整体F1达到87.4%,比基线提高18.6-34.8个百分点;在高权限良性应用上,误报率降至13.0%,比基线降低41.1-67.0个百分点;在细粒度恶意行为恢复上,F1达到87.3%,比先前行为级方法提高56.5-73.4个百分点。消融实验证明各阶段均有贡献。
💡 推荐理由: 提出行为驱动的检测范式,从根本上区分“看起来异常”和“真正恶意”,显著降低误报并提升对进化和混淆恶意软件的检测能力,适合安全运维和研究团队参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Kun Hu, Xin Hu, Xin Peng
开源软件易受针对传递依赖的供应链攻击,尤其恶意代码注入NPM包。现有检测器常存在以下不足:对混淆行为的建模不充分,忽视JavaScript的面向对象特性,静态与动态分析协调不佳,以及行为抽象过程中丢失语义信息。为此,本文提出ProfMalPlus,一种恶意NPM包检测器,它将对象敏感行为图与基于LLM的注释代码切片协同推理相结合。该方法首先识别安装命令和入口文件,然后构建捕获敏感API、第三方调用和未解析调用的行为图。从这些图中提取安全相关的代码切片,并添加内联静态分析证据。本地评判Agent独立评估每个切片,通过自一致性机制合并重复判断以降低LLM方差;全局评判Agent综合所有报告形成条目级判定。对于未确定案例,路由器选择第三方增强(添加注册表派生的模块和方法语义)或动态增强(在沙箱中执行包以解析运行时依赖行为)。增强后的证据被反馈用于重新评估。最后,定位Agent报告恶意代码片段及解释。ProfMalPlus在F1分数上达到98.1%,比现有最先进检测器高出3.5%至52.6%,并发现了597个先前未知的恶意包,这些包均已被确认并从NPM移除。该研究对防御供应链攻击具有重要参考价值。
💡 推荐理由: 针对NPM生态的供应链攻击日益严重,ProfMalPlus结合静态动态分析与LLM推理,显著提升恶意包检测精度,为安全团队提供可落地的检测方案。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lam D. Dao, Vang T. Nguyen, Anh M. T. Bui, Phuong T. Nguyen
本文研究了大语言模型(LLM)内部如何识别恶意代码的机制。尽管LLM在代码补全、漏洞检测等软件工程任务中表现优异,但其识别恶意或漏洞代码的内部工作机制仍不透明。作者采用机械可解释性方法,对三个指令微调的LLM(Llama3.1-8B-Instruct、Mistral-v0.3-7B-Instruct和Qwen2.5-7B-Instruct)进行了分析,利用PyPI Malregistry中的1500个恶意包和1500个良性包进行探测。实验首先通过线性探针定位前馈网络(FFN)中与恶意代码检测相关的神经元,然后通过因果干预(放大或抑制这些神经元)验证其作用。结果表明,放大促进恶意检测的神经元并抑制抑制性神经元可以提高分类准确率,而反向操作则会导致预测向单一类别崩溃,但该效果强烈依赖于具体模型。不同模型的护栏检测机制存在差异,其恶意代码检测行为在FFN层中的编码方式各不相同。该研究揭示了LLM编码恶意编程概念的方式,为神经元层级编辑、选择性遗忘和安全对齐等更可靠的防御机制奠定了基础。适合对LLM安全、可解释性和代码安全感兴趣的研究者阅读。
💡 推荐理由: 该研究首次从神经元层面揭示了LLM识别恶意代码的内部机制,为设计更可靠的LLM防御策略(如神经元编辑、安全对齐)提供了理论基础,有助于提升代码LLM在实际部署中的安全性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rahul Kale, Thesath Wijayasiri, Kar Wai Fok, Vrizlynn L. L. Thing
本文提出了一种新颖的恶意软件二进制文件到图像的转换技术HilEnT,旨在解决传统基于签名的检测方法难以应对未知或变种恶意软件的问题。该方法首先将恶意软件二进制文件通过希尔伯特曲线进行空间填充变换,保留二进制数据的局部相关性;同时结合恶意文件与良性及恶意类别之间的熵特征比较,生成三幅灰度图像。这三幅灰度图像随后被组合成一幅三通道彩色图像,作为机器学习模型的输入,用于恶意软件检测。研究者在四种数据集(Dike、Michael Lester Dataset、Microsoft BIG 2015以及自收集数据集)上进行了有监督的二分类和多分类实验,验证了HilEnT的有效性。为了评估该方法在样本数量有限场景下的鲁棒性,还进行了小样本学习实验。此外,他们探索了通过HOG(方向梯度直方图)与PCA(主成分分析)结合进行特征降维,以提升时间性能。实验结果表明,HilEnT在多个数据集上取得了最先进的检测效果。本文的主要贡献在于提出了一种新的二进制到图像转换范式,融合了空间填充曲线和熵特征,为恶意软件检测提供了新的思路。适合机器学习安全、恶意软件分析方向的研究人员阅读。
💡 推荐理由: 该研究提出了一种新颖的恶意软件图像化方法,结合希尔伯特曲线和熵特征,在多个标准数据集上达到SOTA,为基于深度学习的恶意软件检测提供了新的特征表示思路,可能推动实际检测系统的发展。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zimo Ji, Congying Xu, Zongjie Li, Yudong Gao, Xin Wei, Shuai Wang, Shing-Chi Cheung
该论文针对LLM编码代理(coding agent)中第三方技能(skill)带来的软件供应链攻击面展开研究。代理技能从公共市场获取,并拥有与代理相同的权限,恶意技能可能窃取凭证、泄露源代码或安装后门。现有防御主要采用基于模式匹配或LLM作为评审的静态扫描器,但论文质疑其对自适应逃逸的鲁棒性。作者首先提出SkillCloak,一个保留载荷语义的逃逸框架,通过两种互补策略:结构混淆(将可见载荷指标重写为语义等价形式)和自我提取技能打包(SFS Packing,将恶意组件隐藏于安装时视图之外,在执行时恢复)。在8个扫描器和1613个野外恶意技能上的实验表明,SFS Packing以超过90%的逃逸率绕过所有扫描器,结构混淆在大多数静态扫描器上逃逸率超过80%,在混合扫描器上达到96%,证明基于外观的审计不足。受此启发,作者提出SkillDetonate,一个行为中心的运行时审计器,在沙箱中执行技能并通过操作系统边界的信息流证据(而非安装时外观)检测恶意效果。它结合按需闭包提升(观察执行期间具体化的指令)和基于标记的污点分析(跟踪代理上下文、文件、进程和网络操作中的敏感数据流)。结果显示SkillDetonate以2%的误报率检测97%的攻击,在真实恶意技能上维持87%的检测率。该研究揭示了当前技能安全机制的脆弱性,并提供了可扩展的运行时检测方案。
💡 推荐理由: 该研究揭示了LLM代理生态中第三方技能安全审计的严重缺陷——现有静态扫描器可被轻易绕过,并提出了有效的运行时检测方法,对保护AI供应链安全具有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Derek Everett, Edward Raff, James Holt
该论文提出了一种名为“hamm-grams”的新型特征,用于恶意软件检测中的静态分析。传统的n-gram特征虽然被广泛使用,但存在鲁棒性不足的问题,容易因代码微小变化而失效。作者将hamm-grams定义为具有固定长度和单字符通配符的特殊正则表达式,能够在保持匹配灵活性的同时保留模式结构。核心贡献是设计了一种高效的挖掘算法,利用新的局部敏感哈希(LSH)函数,使得汉明距离较小的字节序列容易发生哈希碰撞,并在哈希桶内通过聚类确定通配符位置。该算法能够从大量可执行文件中快速找到常见的hamm-grams。实验部分在恶意软件分类和检测任务上验证了hamm-grams的优势,与传统n-gram相比,特征更具鲁棒性,分类性能得到提升。本文适合对恶意软件静态特征工程、机器学习鲁棒性感兴趣的读者。
💡 推荐理由: 为恶意软件检测提供了一种更鲁棒的静态特征,能抵抗代码轻微变形,提升机器学习模型的泛化能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christian Scano, Diego Soi, Angelo Sotgiu, Luca Demetrio, Davide Maiorca, Giorgio Giacinto, Fabio Roli, Battista Biggio
本文关注机器学习驱动的安卓恶意软件检测器在问题空间(problem space)中的对抗性攻击。现有攻击方法存在诸多不足:大多数技术通过软件移植注入完整良性模块,引入大量副作用特征,且常导致构建失败;细粒度方法仅注入少量组件,效果有限;使用混淆的方法依赖脆弱的字节码重写,生成的APK虽然在语法上有效,但语义上不可用。此外,先前研究仅通过安装和基本执行的冒烟测试评估攻击成功率,忽略了修改后的APK是否仍保持原始功能。为解决这些问题,作者提出DROIDBREAKER框架,它是一个实用且功能完整的问题空间攻击框架,提供以下能力:(i) 仅操纵对目标模型最具影响力的APK组件,实现查询高效的白盒和黑盒攻击;(ii) 一组细粒度、构建安全(build-safe)的操作(包括注入和混淆API调用、应用模块、权限和URL),副作用最小;(iii) 语义保持的功能测试,通过比较原始APK与修改后APK的执行日志和API级轨迹来强制执行运行时等价性。在最新版安卓应用数据集上的实验表明,DROIDBREAKER在白盒和黑盒设置下均能以少量查询实现高逃避率,并显著降低VirusTotal上商业恶意软件扫描器的检测率。该工作揭示了当前安卓恶意软件检测器在面对刻意构造的对抗性样本时的脆弱性。
💡 推荐理由: 该研究展示了现有安卓恶意软件检测器在面对实用性对抗样本时的严重缺陷,对安全从业者理解检测模型鲁棒性、改进防御策略具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xingzhi Qian, Xinran Zheng, Yiling He, Shuo Yang 0011, Lorenzo Cavallaro
本文提出 LAMD(Context-Driven Android Malware Detection and Classification with LLMs),一个利用大语言模型(LLM)进行上下文驱动的安卓恶意软件检测与分类框架。针对现有检测方法难以应对演化攻击、数据集偏差和可解释性不足的问题,以及直接应用 LLM 时面临的上下文窗口限制(安卓应用包含大量支持代码,上下文超长)和结构复杂性(顺序推理难以处理代码间依赖)两大挑战,LAMD 设计了两阶段处理:首先,通过关键上下文提取(Key Context Extraction)隔离安全关键代码区域并构建程序结构;然后,采用层级代码推理(Tier-wise Code Reasoning)从低级指令到高级语义渐进分析应用行为,最终给出预测和解释。此外,框架在第一层级配备了事实验证一致性机制,以缓解 LLM 的幻觉问题。实验表明,LAMD 在真实场景中的性能优于传统检测器,为动态威胁环境下的 LLM 驱动恶意软件分析提供了可行基础。
💡 推荐理由: 该研究为 LLM 在恶意软件检测中的实际应用提供了一种解决上下文限制和结构复杂性的新思路,有望提升检测的可解释性和对未知威胁的泛化能力。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Fatima Qaiser, Bisma Tahir, Muhammad Abid Mughal, Nauman Shamim
恶意软件检测是网络安全的核心挑战之一。传统基于静态特征(如签名、熵)的方法容易受到加壳(packing)技术的干扰,而基于可视化的方法将二进制字节映射为灰度图像,利用视觉分类器进行检测,具有抗规避和无需反汇编的优势。然而,可执行文件加壳会生成高熵图像,破坏模型依赖的结构模式,且加壳在良性软件中也普遍存在(如压缩或版权保护),因此仅靠加壳状态无法可靠区分恶意性。现有方法未能在统一的监督框架下解决这一问题。为此,本文提出 ViPER(Vision-based Packing-Aware Encoder for Robust Malware Detection),一种基于视觉的、具有打包感知能力的鲁棒恶意软件检测模型。ViPER 采用 LoRA 微调的 ViT-B/14 骨干网络,并设计双头架构,同时学习恶意软件分类和打包检测任务。打包感知门控机制根据推断的打包状态调节恶意软件分类的决策边界,从而对加壳和未加壳样本采用不同的决策规则。针对训练中打包标签分布不均的问题,使用频率加权损失和联合类-打包层的分层采样。实验在 200,000 张 Windows PE 字节图图像上进行,ViPER 的平衡准确率达到 0.8521,ROC-AUC 为 0.9260,AUPR 为 0.9279,在所有主要指标上均优于现有基线,且打包检测 AUC 达到 0.9949。该研究表明,显式建模打包状态能够显著提升基于视觉的恶意软件检测的鲁棒性。
💡 推荐理由: 恶意软件加壳是实际攻防中常见的规避手段,该工作通过显式建模打包状态,提升了基于视觉的检测器在加壳场景下的鲁棒性,为安全运营中自动化恶意样本分诊提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianwen Tian, Wei Kong, Debin Gao, Tong Wang, Taotao Gu, Kefan Qiu, Zhi Wang 0014, Xiaohui Kuang
本文针对AI驱动的恶意软件检测器面临的多种挑战(包括投毒攻击、逃避攻击和概念漂移)提出了一种统一的解决方案。作者指出这些挑战的一个根本原因是数据稀疏性,即某些特征值在数据集中出现的频率极低。为解决稀疏性问题,论文设计了新的压缩技术来缓解稀疏性,并提出了一种密度提升训练方法来持续填充稀疏区域。该方法被应用于PE、Android和PDF恶意软件数据集(如EMBER、SOREL-20M、DREBIN和Contagio)进行实验。结果表明,该方法不仅增强了模型对抗各种攻击的鲁棒性,还提升了检测性能和时间可持续性。例如,在EMBER数据集上,后门攻击成功率从99.99%降至23.71%,F1分数从99.301%升至99.488%;在SOREL-20M数据集上,可持续性指标AUT从92.850%提升至95.135%。该方法与现有防御技术互补,并在多个数据集上验证了其一致性。
💡 推荐理由: 本文提供了一种同时提升恶意软件检测器性能、鲁棒性和可持续性的统一策略,解决了当前防御方案孤立处理问题的局限,对提升实际安全系统的防御能力有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tadiwa Vhito, Jakapan Suaboot, Warodom Werapun, Norrathep Rattanavipanon
本文提出一个名为FDM(决策框架)的框架,用于构建基于机器学习的恶意软件检测系统。选择机器学习配置是一个多准则优化问题,需要考虑模型选择、特征工程、更新机制等多种因素,且不同部署场景的约束各异。FDM通过加权配置兼容性得分(WCCS)将五个操作参数(平台约束、资源预算、响应延迟、更新频率、检测灵敏度)映射到九个配置维度的排序推荐,从而形式化选择过程。为了验证框架,作者在三个数据集上进行了四个实验:私有Windows API数据集、公开Malimg图像基准和Android静态API数据集。关键结果包括:(i) 在二分类中,XGBoost实现了最佳准确率与资源比(测试准确率97.46%,内存<70MB),优于LSTM/BiLSTM(消耗高达2.8GB);(ii) 多分类中,经典模型(XGBoost 79.03%)优于循环深度模型(BiLSTM 72.27%),与二分类结果相反;(iii) 使用EfficientNetB0的类增量学习在11个增量步骤中保持了99.13%的准确率,仅下降0.65个百分点;(iv) 迁移学习使图像型恶意软件数据训练时间平均减少2.14倍,且准确率无显著损失;(v) 自编码器预处理实现了14倍的训练加速,仅损失0.86个百分点的准确率。这些发现证实最佳ML配置依赖于上下文,验证了FDM的核心前提,并展示了其对安全从业者的实用价值。
💡 推荐理由: 该框架为安全团队提供了一种系统化的决策方法,用于在不同部署场景下选择最优的ML配置,减少试错成本,提升恶意软件检测系统的效能。
🎯 建议动作: 纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Parthajit Borah, Sakshi Singh, D. K. Bhattacharyya, J. K. Kalita
恶意软件检测是网络安全领域的关键挑战,因为恶意软件具有复杂结构和行为。现有的检测方法中,通过函数调用图(FCG)分析恶意软件的结构和行为模式是一种可靠的方法,但缺乏足够大且高质量的数据集来支撑对众多恶意软件家族的有效分类。本文提出了AMD-FCG,一个增强的函数调用图数据集,其中集成了恶意软件的拓扑特征。该数据集包含多种恶意软件样本和良性应用程序的FCG,旨在为安全专业人员提供无需动态分析和大量预处理的高效检测流程。AMD-FCG框架简化了工作流程,可支持开发和部署更创新、高效的恶意软件检测系统。实验部分(根据摘要推断)可能验证了数据集在分类准确性和鲁棒性上的优势。该研究贡献了一个标准化基准数据集,有助于推动基于图的恶意软件检测研究。
💡 推荐理由: 为恶意软件检测研究提供了高质量、带拓扑特征的函数调用图数据集,填补了现有公共数据集不足,有助于开发和评估基于图神经网络的检测模型,提升安全分析效率。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Akash Amalan, Georgios Smaragdakis, Tom J. Viering
恶意软件检测目前仍然主要依赖于被动反应:机器学习模型在已知样本上训练,但随着威胁演化,模型性能会下降。理解恶意软件家族之间的进化关系可以促进主动防御,但传统的逆向工程可能需要数月甚至数年才能揭示这种谱系关系。本文提出 MalTree 框架,该框架受生物信息学启发,大规模应用系统发育技术(UPGMA 和 Neighbor-Joining),利用结构、行为和图像特征自动建模恶意软件进化。作者引入了基于 VirusTotal 时间戳的时间验证,以评估推断出的进化树是否反映真实的出现顺序。MalTree 达到了 87% 的时间一致性,表明推断的进化关系与真实世界的时间线高度吻合。分析显示,某些家族的变异速度比其他家族快 10 倍以上,这表明检测策略应根据家族特定的进化速度进行定制。案例研究(包括 Mirai 僵尸网络)证实,从系统发育树推断出的关系与已有威胁情报记录一致。该框架为将恶意软件分析从基于样本的分类转向谱系感知的进化建模奠定了基础。
💡 推荐理由: 提出了一种全新的恶意软件家族进化关系自动推断方法,使防御者能够从时间维度理解威胁演变,针对变异速度快的家族提前调整检测策略,实现从被动响应到主动预测的转变。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Emmanuele Massidda, Diego Soi, Giorgio Giacinto
该论文提出了一种从设计上保护隐私的Android恶意软件检测流水线。现有检测方法普遍需要收集设备标识符、网络痕迹、运行时数据等敏感用户信息,尽管后续可采用匿名化、加密或联邦学习等技术保护隐私,但仍然要求用户高度信任拥有特权访问权限的系统。作者认为,这种信任依赖应该被消除而非管理。论文首先形式化了一套隐私设计(privacy-by-design)的检测需求,然后逐一实现。流水线首先执行静态分析,从APK中提取特征(遵循Drebin表示),经向量化后送入SVM分类器。分类器配备双拒绝阈值规则:若置信度足够则直接输出决策,否则将样本推迟到沙箱环境的动态分析阶段。这样,真实的用户信息永远不会进入分析循环。实验使用2024至2025年的时间序列分割数据集,结果表明:仅靠第一阶段静态分析即可达到0.87的F1分数,仅6.7%的测试样本需要进入第二阶段的动态分析。动态沙箱分析在不提取任何敏感数据的情况下,也能高置信度地识别恶意软件。这些结果证明,在不牺牲用户隐私的前提下,可以实现强劲的检测性能。该研究适合关注隐私保护、移动安全、以及对抗隐私与性能权衡的安全研究人员阅读。
💡 推荐理由: 该研究首次将隐私设计原则系统性地融入Android恶意检测全过程,在不损失检测精度的前提下彻底避免收集用户敏感数据,为隐私合规提供了可行的技术路径,且对监管日益严格的环境尤其重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Biagio Montaruli, Andrea Oliveri, Savino Dambra, Davide Balzarotti
尽管 macOS 在个人用户和企业系统中的普及度日益增长,但恶意软件研究长期聚焦于 Windows 和 Android,针对 macOS 的检测工作相对不足。操作系统自身的特异性以及 Mach-O 文件格式的独特结构,在未知样本分类中可发挥关键作用。本文首次在文献中提出利用 macOS 二进制文件的领域特定静态特征——包括嵌入式证书、权限(entitlements)、持久化技术及关键系统 API——来训练机器学习恶意软件检测器。研究者构建了一个包含 41,129 个样本(11,413 良性、29,716 恶意)的新数据集,并通过综合实验证明,所提方案达到了 98.50% 的检测率,平均比现有最优方法提升 16%,且经过特征重要性分析确认领域特定特征贡献显著。为进一步评估检测器的时间泛化能力,研究者使用 9,000 个全新 macOS 可执行文件进行真实环境测试,结果显示检测率高达 99.50%,相比当前最优方法提升 50%;当移除领域特定特征时,检测性能下降 15.92%,证实了这些特征对泛化到新型恶意样本至关重要。最后,作者将数据集公开给研究社区。该工作为 macOS 恶意软件检测提供了全新的特征视角,对安全社区具有重要参考价值。
💡 推荐理由: macOS 安全研究长期滞后,该工作首次系统引入 Mach-O 领域特定特征,显著提升了检测率与泛化能力,为蓝队和 macOS 安全产品提供了切实可行的特征工程思路。
🎯 建议动作: 研究跟进,评估将文中特征集纳入内部 macOS 安全检测管道的可行性与效果。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Suresh Kumar Amalapuram, Bikraj Shresta, Siva Ram murthy Chebiyam, Bheemarjuna Reddy Tamma, Sumohana S Channappayya
该论文针对基于机器学习的恶意软件检测器因概念漂移(即良性软件和恶意软件随时间演变导致检测模型过时)而性能下降的问题,提出了一种名为 SEED 的半监督持续恶意软件检测方法。现有方法(如使用层次对比损失 HCL 结合主动学习)依赖大量标注数据,但在安全领域获取标注数据困难且成本高昂。当仅有部分标注数据时,HCL 在检测未知恶意软件时性能显著下降,尤其是在缺乏强语义结构的 BODMAS 数据集上。SEED 通过结合定制的二元交叉熵目标、半监督持续学习和主动学习,在有限监督下实现有效检测。对于部分标注的已知任务,利用奇异值分解从先前数据构建表示空间,将未标注样本投影到该空间并与合适标注样本配对,以鼓励表示一致性。对于完全无标注的未知任务,在表示空间中利用余弦距离量化不确定性,选择最不确定的样本供分析师标注。在 Windows(BODMAS)和 Android(AndroZoo、APIGraph)数据集上的实验表明,仅使用20%的标注数据,SEED 在未知恶意软件检测的平均AUT(AUC曲线下面积随时间变化)相比半监督HCL*提高了40%(BODMAS)和14%(AndroZoo),在APIGraph上也具有竞争力。此外,SEED 引入延迟缓冲区更新策略以减少重放过程中的标签噪声传播,提高学习稳定性。该研究适合网络安全研究人员、恶意软件检测工程师以及关注持续学习和半监督学习在安全领域应用的从业者阅读。
💡 推荐理由: 解决了恶意软件检测中标注数据稀缺和概念漂移双重挑战,显著提升少量标注下的未知恶意软件检测性能,降低人工标注成本。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmed Sabbah, Mohammed Kharma, Radi Jarrar, Samer Zein, David Mohaisen
本文研究了在时间概念漂移背景下,Android恶意软件检测模型的对抗鲁棒性如何随时间演变。研究团队收集了跨越十多年的Android应用数据集,从模拟器和真实设备执行中提取静态和动态特征表示,并将数据按年份切片。他们设计了三种部署协议模拟真实世界的学习场景:(1) 同年训练和测试;(2) 跨年部署但不更新模型;(3) 扩展窗口重训练,利用累积的历史数据。在多种分类器家族上,使用FGSM和SPSA在可行性约束下生成对抗样本。实验测量了干净性能、对抗准确率(AA)、攻击成功率(ASR),并引入了三个时间链接指标——RobustDrop、ΔASR和对抗放大因子(AAF)——来量化分布偏移与鲁棒性退化之间的关系。结果表明,时间分离会降低基于特征迁移的对抗鲁棒性。随着训练-测试时间差距增大,干净准确率和对抗准确率均下降,而攻击成功率在某些配置下(特别是FGSM扰动和静态特征下)增加。扩展窗口重训练可以缓解但不能完全消除在持续分布演化下的鲁棒性损失。这些发现表明,在评估智能检测系统在演化数据分布下的长期鲁棒性时,应考虑时间漂移,并突出了在长期对抗环境中建立漂移感知鲁棒性评估框架的必要性。
💡 推荐理由: 首次系统量化了时间概念漂移对Android恶意软件检测对抗鲁棒性的影响,为长期部署的检测系统提供了关键的鲁棒性评估视角。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jan Dolejš, Martin Jureček, Róbert Lórencz
本文研究了针对现代恶意软件检测管道的灰盒投毒攻击模型。现代检测系统通常依赖持续数据摄入和机器学习来应对大量新型威胁。作者利用secml_malware框架,通过功能保留的操纵(具体为导入地址表IAT和节注入)生成问题空间对抗性二进制样本。他们评估了这些投毒样本被摄入到基于LightGBM的恶意软件检测模型训练集时的影响。实验结果表明,基于IAT的微妙扰动能够生成紧凑的投毒样本,显著降低检测召回率。这些发现揭示了在连续学习系统中开发低可视性对抗扰动同时保持高投毒效能的固有挑战。此外,作者评估了一种基于同质集成的防御机制,该机制能够成功识别并过滤高达95.6%的投毒尝试,同时保持对合法数据的高保留率。该工作强调了在生产管道中进行鲁棒的摄入前验证的必要性。本文适合安全工程师、对抗性机器学习研究人员以及恶意软件检测系统的开发人员阅读。
💡 推荐理由: 揭示了现代恶意软件检测管道在持续学习场景下面临的灰盒投毒威胁,并提出了实用的基于集成的防御方法,对保障检测系统鲁棒性具有重要意义。
🎯 建议动作: 研究跟进:将同质集成防御机制纳入内部恶意软件检测管道的预验证阶段。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ping He, Yifan Xia, Xuhong Zhang 0002, Shouling Ji
本文针对基于机器学习的Android恶意软件检测(AMD)方法,提出了一种名为AdvDroidZero的高效查询式攻击框架。当前对该类方法的对抗样本攻击大多依赖较强假设,如攻击者知晓特征空间、模型参数或训练数据集等知识,这在现实攻击场景中往往不成立。AdvDroidZero在零知识设置下运作,即攻击者无需提前了解目标模型的内部细节,仅通过黑盒查询即可生成对抗样本。该框架通过设计高效的查询策略和针对性扰动生成方法,显著降低了攻击所需的查询次数,同时保持了高攻击成功率。在多个主流基于机器学习的AMD方法(包括最新技术)以及真实世界反病毒产品上的广泛评估表明,AdvDroidZero能够有效规避检测,揭示了当前检测方法的脆弱性。论文分析了攻击成本与效果,并讨论了可能的防御方向。本研究对安全社区理解对抗性机器学习威胁具有重要意义,尤其针对移动安全领域的现实攻击场景。
💡 推荐理由: 该攻击在零知识条件下(更贴近真实攻击者能力)仍能高效绕过主流ML检测和真实反病毒产品,迫使安全团队重新评估现有Android恶意软件检测方案的稳健性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sk Tanzir Mehedi, Raja Jurdak, Chadni Islam, Abu Bakar Siddique Mahi, Gowri Ramachandran
eDySec 是一个基于深度学习的动态行为分析框架,旨在检测 PyPI 生态系统中的恶意包。随着下一代软件供应链攻击(如多阶段恶意软件执行、远程访问激活和动态载荷生成)的兴起,传统机器学习检测器因动态行为数据的高维稀疏性(包括系统调用、网络流量、目录访问模式和依赖日志)而性能下降、稳定性差且缺乏可解释性。本文利用 QUT-DV25 数据集(捕获包安装时和安装后行为)评估多种深度学习模型,并研究特征集以识别最具判别力的属性。框架整合了模型稳定性分析和可解释 AI 技术,提供稳定的透明决策。实验结果表明,eDySec 显著优于现有方法:将特征维度减半,误报率降低 82%,漏报率降低 79%,准确率提升 3%,并达到近乎完美的稳定性,每个包推理延迟仅 170 毫秒。研究还发现特征与模型选择至关重要,某些组合会降低性能。该工作深化了对动态分析应对下一代攻击的优势与局限的理解。
💡 推荐理由: 针对 PyPI 生态中日益复杂的供应链攻击,eDySec 提供了高精度、低延迟且可解释的检测方案,解决了传统 ML 方法在高维稀疏数据下的瓶颈。
🎯 建议动作: 研究跟进,评估该框架在内部环境中的适用性
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
提出一种使用决策树规则集的结构化方法,通过特征重要性、预测一致性等指标量化恶意软件分类中的概念漂移,并在EMBER2024数据集上验证了固定两月窗口和特征级Pearson相关的有效性。
💡 推荐理由: 恶意软件检测模型随时间演化易产生漂移,导致误报漏报;该方法无需标签即可检测漂移,为模型维护和主动更新提供依据,适合安全运维团队用于监测分类器时效性。
🎯 建议动作: 研究跟进
排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.5)