推荐 3.5
Conf: 50%
该论文针对二进制程序聚类任务,首次系统性地研究了自监督学习(SSL)和表格表示学习(TRL)方法在该场景下的表现。恶意软件聚类是网络安全中威胁发现和家族演化分析的关键步骤,但以往SSL/TRL方法在此领域的研究几乎空白。作者在公开的Ember和Bodmas数据集上进行了两阶段实验:第一阶段,将视觉领域的主流SSL模型(BYOL、SimSiam、Barlow Twins、VICReg)改造为适用于表格数据,并采用监督式样本对生成方式,构建了性能上限基准,发现BYOL和SimSiam能达到与全监督模型相当的性能,而Barlow Twins和VICReg则明显不足。第二阶段,评估纯无监督的TRL方法,并与PCA、Autoencoder、UMAP等强基线对比,结果表明VIME在二进制程序聚类上达到了新的最优状态。基于这些发现,作者提出VIME-R,即VIME的检索增强扩展,用基于检索的增强替换随机边际分布损坏,以生成更具信息量的训练对。VIME-R在两个数据集上均进一步提升了VIME的性能,同质性指标(Homogeneity)提高了2.7%至5.8%。研究结论指出,检索增强的表格表示学习是提升自动化恶意软件分析能力的一个有前景的方向。代码将公开发布。该研究主要面向恶意软件分析、威胁情报和机器学习交叉领域的研究者与安全工程师,为二进制程序的无监督聚类提供了新的方法论和实证基准。
💡 推荐理由: 该研究为二进制程序聚类提供了首个SSL/TRL系统性基准,验证了检索增强方法可显著提升无监督恶意软件聚类效果,为蓝队自动化威胁分析提供了可落地的技术方向,有助于在不依赖标注样本的情况下发现新兴恶意软件家族。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)