该论文提出 DrSec 系统,针对端点安全领域日益复杂的攻击以及现有安全产品(如 EDR)的碎片化问题——应用独立开发、误报率高、漏报、缺乏高质量标签——采用自监督学习预训练基础语言模型(LM)来处理事件序列数据。DrSec 输入进程的事件序列,输出进程的分布式表示(嵌入向量)。预训练后,LM 可通过少量或者无监督方式适配多种下游任务,统一当前分裂的应用生态。作者在包含约9100万进程和25.5亿事件的真实数据集上训练了两种 LM 架构,并在三个应用域(无监督进程识别、告警分诊、专家规则学习)中评估。实验表明:DrSec 能够准确进行无监督进程识别;在告警分诊任务上显著优于领先方法(例如精确率-召回率曲线下面积 75.11% vs. ≤64.31%),有效减少告警疲劳;还能准确学习专家开发的规则,从而允许调整事件检测器的误报和漏报率。论文的核心贡献在于证明了大规模自监督预训练能够生成通用且高效的进程表示,并促进端点安全中多种分析任务的一体化,减少对人工标注的依赖。
💡 推荐理由: DrSec 展示了如何用自监督语言模型统一多个端点安全应用,显著提升告警分诊效果,为 EDR 系统提供减少误报/漏报的新范式,值得安全运营团队和研究机构关注。
🎯 建议动作: 研究跟进