#malware-classification

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Xian Wu 0007, Wenbo Guo 0002, Jia Yan, Baris Coskun, Xinyu Xing 0001

恶意软件分类是网络安全中的重要任务,但实际数据集中常因标注人员缺乏专业知识而包含大量错误标签。以往研究表明,错误标签会严重影响机器学习模型的准确性。尽管在图像识别和文本挖掘领域,已有多种噪声学习方法被提出并取得显著效果,但它们在恶意软件分类场景下的有效性尚未被系统验证。本文首先将代表性及最新的噪声学习方法应用于真实世界的恶意软件分类任务,发现这些方法均无法有效减轻错误标签的影响。通过精心设计的实验,作者揭示出主要原因在于恶意软件数据集存在极端的数据不平衡以及极高的错误标签比例。为此,作者提出了一种名为MORSE的新型噪声学习方法。MORSE对最先进的半监督学习技术进行了定制和扩展,将可能的错误标签样本视为未标注数据,从而避免其负面作用。同时,MORSE集成了样本重加权方法,平衡训练数据中各类样本的使用,以应对数据不平衡挑战。文中在合成数据集和真实数据集上进行了评估,结果显示MORSE显著优于现有噪声学习方法,能最大限度地减少错误标签的影响。本文适合从事恶意软件检测、对抗性机器学习及数据质量研究的安全工程师和研究人员阅读。

💡 推荐理由: 恶意软件分类模型依赖高质量标签,但真实环境标签噪声普遍存在。MORSE方法首次验证了现有噪声学习方法在恶意软件场景中的失效,并提出针对性解决方案,有助于提升安全运营中自动化分类的可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Allyson Taylor, Prashanth BusiReddyGari

传统的恶意软件检测方法在面对混淆或未知威胁时泛化能力不足。本文提出 ThreatVisionAI,一种混合恶意软件家族分类框架,它集成了原始图像 CNN、基于小波的 CNN 和 Vision Transformer (ViT),以捕获恶意软件图像中的互补空间、频域和全局关系特征。原始图像 CNN 提取空间纹理模式,小波 CNN 捕获多尺度频率信息,有助于区分密切相关的家族,而 ViT 分支则建模图像中的长程依赖关系。在 Malimg 数据集上评估,ThreatVisionAI 达到 98.01% 的准确率和加权 F1 分数 0.9742,其中小波域特征在少数类和视觉相似家族上提供了可衡量的增益。这些结果证实,频率感知和基于 Transformer 的表示改进了基于图像的恶意软件家族分类。本文的主要贡献在于将小波变换与 ViT 结合,提升了细粒度分类性能,为恶意软件检测提供了一种新颖的多模态融合思路。

💡 推荐理由: 该研究展示了结合频域分析和 Transformer 架构在恶意软件图像分类中的有效性,为蓝队提供了一种可对抗混淆变种的检测思路,尤其适用于勒索软件或挖矿木马等需要精确家族归因的场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jithin S., Roshin Sleeba C., Anvin Mariya P. B., Asmitha K. A., Vinod P., Serena Nicolazzo, Antonino Nocera

恶意软件分类因二进制文件的异构性、加壳技术的存在以及恶意软件家族的多样化分布而极具挑战性。传统的单任务检测模型难以泛化到各类数据,尤其在面对混淆和稀有样本时性能下降严重。本文提出了一种基于混合专家(Mixture of Experts, MoE)架构的统一多任务恶意软件分析框架,能够同时执行三个关键任务:恶意软件家族分类、加壳与未加壳检测、恶意与良性识别。框架支持两种输入表示:高维EMBER特征集和从可移植可执行文件中提取的原始一维字节序列。通过将问题分解为多个专门化的专家网络,并采用自适应门控机制,模型实现了高效的任务特定学习,同时保持整体可扩展性。作者研究了多种架构变体,包括同构MoE、异构MoE和多门MoE(MMoE),并在标准环境和对抗性环境下(使用原始样本和变异样本)评估性能。实验结果表明,多门MoE模型表现最佳,综合检测率达到0.9744,失败率仅为2.56%。此外,该配置在突变引起的分布偏移下展现出更强的鲁棒性。研究强调专家专业化和任务特定路由在处理复杂恶意软件分布中的有效性,为构建可扩展且鲁棒的恶意软件检测系统提供了有前景的方向。

💡 推荐理由: 该框架通过多任务学习和MoE架构同时解决家族分类、加壳检测和恶意识别,显著提升了对混淆和稀有样本的检测能力,为防御方提供了更全面、鲁棒的恶意软件分析方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
推荐 5.5
Conf: 50%
👥 作者: Bercan Turkmen, Vyas Raina

本论文探讨了在缺乏源代码的情况下,利用大语言模型(LLM)对恶意软件进行二进制代码分类的问题。传统方法通常依赖单一反编译器生成的伪C代码作为LLM输入,但反编译器是有损的启发式工具,不同反编译器可能揭示同一二进制文件的不同特征。为此,作者构建了一个包含良性工具和恶意程序的基准测试集,覆盖多种威胁行为。每个样本分别使用Ghidra和RetDec进行编译和反编译,生成匹配的伪C视图。实验采用多个主流LLM家族(如GPT、LLaMA等),结果表明提供两种反编译器视图能够提升恶意类别的F1分数,主要归功于恶意样本召回率的提高。一致性分析进一步显示,Ghidra和RetDec产生的错误部分不同,表明两者提供互补信息。论文核心贡献是提出了一种简单、无需训练的多反编译器提示方法,可有效提升基于LLM的恶意软件分类在实际场景中的性能。

💡 推荐理由: 该方法无需额外训练或修改模型,仅通过输入多个反编译器视图即可提升LLM恶意软件分类的召回率,有助于安全分析师更准确地在海量样本中筛选出恶意程序,降低漏报风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ratun Rahman, Hassan Jalil Hadi, Christopher Gabriel Pedraza Pohlenz, Ali Shoker

本文针对恶意软件家族分类这一网络安全关键挑战,提出了一种可扩展的基于量子核的机器学习(QKML)框架。传统机器学习模型在面对结构相似且混淆的恶意软件样本时,多分类准确率较低且难以大规模部署。该框架首先从可执行文件中提取结构特征,通过监督线性判别分析(LDA)投影生成紧凑且类别感知的表示,适合量子处理。随后,利用参数化量子电路构建基于保真度的量子核,捕捉恶意软件家族间的非线性关系。为降低计算开销,采用Nyström近似方法获得量子核的低秩近似,从而通过岭回归实现高效的多分类,避免完整核矩阵构造的二次计算成本。在包含18,836个样本、覆盖23个恶意软件家族的大规模数据集上进行实验,该模型达到80.88%的分类准确率,优于相同特征和数据划分下的经典机器学习基线。结果表明,可扩展的量子核机器学习在实际恶意软件家族分类任务中具有可测量的性能优势。

💡 推荐理由: 该研究探索了量子机器学习在网络安全中的应用潜力,为大规模恶意软件分类提供了新的高效方法,可能推动下一代恶意软件检测系统的性能提升。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Raja Khurram Shahzad, Muhammad Mustaqeem, Haroon Elahi

随着恶意软件(包括变种和新型)数量快速增长,恶意软件的检测与缓解成为一个复杂问题。传统的恶意软件检测方法虽然能识别恶意软件,但无法将其归类到具体的家族,这阻碍了后续的针对性和有效响应。针对这一挑战,本文提出了一种混合方法,用于自动化恶意软件检测与家族分类。该方法首先提取多种相关特征,包括API调用序列以及固定长度和可变长度的n-gram,并结合一种自定义的特征选择方法进行特征融合。在预测模型部分,提出了一种基于投票的算法融合策略,将多个分类器的输出进行集成。实验评估使用微软提供的恶意软件数据集,分别进行了二分类(恶意/良性)和多分类(具体家族)任务。结果表明,该方法在AUC达到0.989,准确率达到99.72%,对数损失仅为0.01,显著优于现有技术水平。该工作为安全运营中自动、准确地进行恶意软件家族分类提供了一种有效途径,有助于提升针对不同类型恶意软件的差异化防御能力。

💡 推荐理由: 该研究提出一种高效的特征融合和算法融合方法,能够高准确率地将恶意软件分入具体家族,有助于安全团队快速定位攻击意图并采取针对性响应。

🎯 建议动作: 研究跟进,评估其方法在自身恶意软件检测与分类场景中的可迁移性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)