#data-augmentation

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Harshil Patel, Himanshu Garg, Aswani Kumar Cherukuri

该论文针对加密流量分析中的两大核心挑战展开研究:一是加密通信导致数据包内容可见性有限,使得传统深度包检测方法失效;二是可用数据集中异常流量样本极度不平衡,导致模型训练效果不佳。为应对这些问题,作者提出利用生成式人工智能(GAI)技术来构造逼真且类别平衡的合成加密流量数据集。具体方法包括三个关键步骤:首先对真实流量数据进行特征分析,提取关键统计属性和特征相关性;然后使用聚类方法辅助生成数据,确保合成样本在特征空间中合理分布;最后通过训练分类器对合成数据质量进行综合评估。实验结果表明,使用精心生成的合成数据训练的分类器,其性能可达到基于真实数据训练模型的93%,证明合成数据能够有效补充真实数据集,缓解异常流量代表性不足的问题。该方法的贡献在于保留了原始数据的统计特性与特征间相关性,同时能够构建平衡数据集,从而提升加密流量分析模型的鲁棒性。此外,作者公开了完整的编程代码,便于其他研究者复现和扩展。本文适合网络安全研究人员、数据科学家以及从事流量分析、异常检测和AI数据增强工作的工程师阅读,尤其对解决数据稀缺和不平衡问题有参考价值。

💡 推荐理由: 加密流量分析是蓝队监控的核心难点,数据不平衡会严重削弱异常检测能力;该方法用GAI生成高质量合成数据,为缓解数据稀缺问题提供了可行思路,值得安全数据科学团队关注。

🎯 建议动作: 研究跟进,评估合成数据方法在内部安全分析场景的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Taya Ambrose, Sergio Valderrama, Younghee Park, Alvaro A. Cárdenas

该论文提出 DART(Data Augmentation of Rare ATT&CK Techniques Using LLM Agents)框架,旨在解决网络安全数据分析中罕见 ATT&CK 技术样本不足的问题。由于真实环境中某些攻击技术出现频率极低,导致基于机器学习的威胁检测模型难以有效训练和评估。DART 利用大语言模型(LLM)智能体生成高质量的合成数据,对稀有技术进行数据增强,从而扩充训练集。论文详细描述了 DART 的系统架构,包括如何使用 LLM 智能体模拟攻击行为、生成符合 ATT&CK 技术特征的文本序列或日志数据,并通过迭代优化确保数据的真实性和多样性。实验部分(基于摘要推断)验证了 DART 在增强下游检测模型性能方面的有效性,表明该方法能够显著提升对稀有攻击技术的检测能力。该研究的核心贡献在于提出了一种新兴的数据增强范式,将 LLM 的生成能力与安全领域知识相结合,为数据稀缺条件下的威胁检测提供了可行方案。适合安全数据科学家、机器学习工程师以及关注 ATT&CK 框架的蓝队研究人员阅读。

💡 推荐理由: 针对稀有 ATT&CK 技术的训练数据稀缺是实际检测系统落地的关键瓶颈,DART 提供了一种利用 LLM 智能体进行数据增强的新思路,可帮助蓝队提升对低频攻击的覆盖能力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Marwan Lazrag, Badis Hammi, Lorena Gonzalez-Manzano, Joaquin Garcia-Alfaro

该论文系统评估了针对增强3D点云公共数据集的投毒攻击的操作性影响。随着自动驾驶和联网汽车的发展,3D点云数据被广泛用于训练感知模型,但公共数据集可能遭受投毒攻击,导致分类错误或后门注入。传统观点认为数据增强技术(如旋转、缩放、噪声添加)可以降低投毒攻击的成功率,因为增强过程会稀释恶意样本。然而,该研究通过使用生成对抗网络(GAN)作为数据增强的具体案例,发现投毒攻击能够有效规避增强的净化效应:投毒样本在增强后仍保留恶意特征,并能够传播至整个增强数据集,最终干扰通用分类器的决策。实验基于公开数据集和工具,验证了投毒攻击在增强环境下的持久性和有效性。主要贡献包括:1)明确数据增强并非投毒攻击的绝对防御;2)揭示了GAN增强可能反而助长投毒扩散;3)提供可复现的实验材料。该研究对于自动驾驶感知系统的数据安全具有重要警示意义。

💡 推荐理由: 该研究打破了'数据增强可天然防御投毒'的假设,揭示了自动驾驶3D感知数据管道中的新攻击面,对依赖公共数据集的ASV系统安全有重大警示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuo Wang 0012, Hongsheng Hu, Jiamin Chang, Benjamin Zi Hao Zhao, Minhui Xue 0001

该论文提出了一种名为 LACMUS(Latent Concept Masking for Robustness)的通用鲁棒性增强方法,旨在提升深度神经网络(DNN)对对抗攻击和分布偏移的鲁棒性。作者认为,DNN 对对抗扰动和分布漂移的敏感性源于模型过度拟合数据集中的非共同概念(non-common concepts),导致依赖特定学习实例而增加脆弱性。LACMUS 通过将高维数据映射到潜在概念空间,识别并导航“非共同概念”的模式,然后应用概念掩蔽策略选择性遮蔽数据特征,迫使模型基于更广泛的信息进行决策,从而增强决策鲁棒性。该方法是一种攻击无关(attack-agnostic)的框架,采用概念级增强(concept-wise augmentation)来提升模型对多种对抗、语义和分布挑战的鲁棒性。论文贡献包括:开发了鲁棒性增强工具、提供了将数据映射到潜在概念空间的机制、识别概念级误分类模式的策略、以及利用潜在概念的新颖数据增强模块。实验在 MNIST、CIFAR-10、ImageNet 和 CelebA 数据集上进行,验证了 LACMUS 在增强模型弹性和泛化能力方面的有效性,即使训练数据稀缺时也有效。此外,论文向研究社区提供了增强后的数据集,以支持模型鲁棒性训练。

💡 推荐理由: 该方法提供了一种通用、攻击无关的 DNN 鲁棒性增强技术,无需先验对抗知识,可提升模型对多种扰动和分布变化的防御能力,对安全防御中模型加固具有潜在价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)