该论文提出 DART(Data Augmentation of Rare ATT&CK Techniques Using LLM Agents)框架,旨在解决网络安全数据分析中罕见 ATT&CK 技术样本不足的问题。由于真实环境中某些攻击技术出现频率极低,导致基于机器学习的威胁检测模型难以有效训练和评估。DART 利用大语言模型(LLM)智能体生成高质量的合成数据,对稀有技术进行数据增强,从而扩充训练集。论文详细描述了 DART 的系统架构,包括如何使用 LLM 智能体模拟攻击行为、生成符合 ATT&CK 技术特征的文本序列或日志数据,并通过迭代优化确保数据的真实性和多样性。实验部分(基于摘要推断)验证了 DART 在增强下游检测模型性能方面的有效性,表明该方法能够显著提升对稀有攻击技术的检测能力。该研究的核心贡献在于提出了一种新兴的数据增强范式,将 LLM 的生成能力与安全领域知识相结合,为数据稀缺条件下的威胁检测提供了可行方案。适合安全数据科学家、机器学习工程师以及关注 ATT&CK 框架的蓝队研究人员阅读。
💡 推荐理由: 针对稀有 ATT&CK 技术的训练数据稀缺是实际检测系统落地的关键瓶颈,DART 提供了一种利用 LLM 智能体进行数据增强的新思路,可帮助蓝队提升对低频攻击的覆盖能力。
🎯 建议动作: 研究跟进