本文针对网络物理系统(CPS)异常检测器的评估方法提出批评与改进。当前领域普遍使用精确率、召回率或 F1 分数在单一工作点(operating point)上比较不同架构的检测器,例如深度神经网络、不变式模板等。作者指出,这些指标混淆了两个独立环节:一是检测器对物理过程的表示能力(residual 生成),二是报警阈值设定的好坏。为此,本文提出将 CPS 异常检测器视为两阶段流水线:第一阶段将观测映射为残差(residual),第二阶段将残差映射为报警。作者主张直接评估第一阶段,使用归一化残差能量(normalized residual energy),该指标与训练正常参考分布的 Kullback-Leibler 散度具有精确数学联系,且不依赖特定报警规则。该评估可独立衡量攻击分离度、训练-测试差距下的稳定性,以及检测器对物理过程的编码紧凑性。作者在不做任何逐检测器调参的情况下,对五种检测器(GDN, FuSAGNet, TranAD, NSIBF, GeCo)在三个 CPS 基准(SWaT, WADI, HAI)上进行了评估。结果显示,尽管这些检测器在 SWaT 上的 ROC-AUC 值相近,但在共同误报率下性能相差超过一个数量级;且排名随测试床变化——TranAD 在 HAI 上第一但在 SWaT 上垫底,NSIBF 在 WADI 上第一但在 HAI 上垫底。在 WADI 上,局部攻击可以逃避跨通道汇总证据的检测器,这解释了 NSIBF 为何优于在其他基准上表现良好的方法。研究表明,检测失败可能源于不同原因:表示能力弱、阈值校准差、或攻击本身物理影响很小。不依赖决策规则的分析有助于区分这些原因。
💡 推荐理由: 该研究提供了一种不依赖报警阈值的 CPS 异常检测器评估方法,能帮助安全团队准确定位检测失效的根源(表示能力 vs 阈值 vs 攻击影响),避免被单一 F1 分数误导,对工业控制系统安全评估与选型具有直接参考价值。
🎯 建议动作: 研究跟进