该论文关注基于溯源图(provenance graph)的入侵检测系统(PIDS)在检测高级持续性威胁(APT)时的统计偏差问题。现有 PIDS 方法普遍把系统调用/系统交互形成的各类关系(relation)同等对待,忽略了关系之间巨大的统计异质性——作者指出在 CADETS 数据集中,不同关系类型的出现频率差异可达约 14 万倍。这种极端不平衡带来两个后果:一是模型训练时会被高频关系主导,稀有但往往更具判别力的交互模式被淹没;二是不同关系上正常(良性)行为本身的误差分布本就不同,模型却用同一把尺子衡量重建误差,导致阈值判定失真,既抬高误报率(FPR),又增加漏报风险。针对这一问题,作者提出 RECAL,一个无监督框架。其核心有两点:第一,采用关系平衡的掩码图学习(relation-balanced masked graph learning),在自监督重建任务中平衡各关系类型的贡献,使模型能够更好地刻画和捕获稀有交互模式;第二,对重建误差按关系类型各自的良性误差分布进行校准(calibration),把不同尺度、不同方差的原始误差映射为可相互比较的异常证据,从而更可靠地区分攻击行为与良性行为,降低误报。作者在三个 DARPA E3 数据集上进行了评测:RECAL 的 F1 分数分别达到 99.99%、99.93% 和 99.99%,相较各数据集上最佳基线分别提升 0.88、0.82 和 0.42 个百分点;与报告中 FPR 最低的基线相比,平均 FPR 分别降低约 105 倍、4 倍和 41 倍。整体贡献可概括为:揭示了关系频率不平衡与误差尺度不一致对 PIDS 的负面影响,给出了一种无需攻击标签的关系平衡+误差校准的无监督检测方案,并在标准 APT 数据集上显著改善了误报与检出性能。该工作适合主机侧威胁检测、溯源图分析、EDR/审计日志异常检测方向的研究与工程人员阅读。
💡 推荐理由: 溯源图检测长期被高频关系主导、误报偏高。该工作指出现有误差度量在不同关系上不可比,并给出无监督的关系平衡与误差校准方案,在 DARPA E3 上大幅降低 FPR,对提升主机侧 APT 检测的可用性有直接参考价值。
🎯 建议动作: 研究跟进,纳入内部溯源图检测评估