推荐 3.5
Conf: 50%
本文针对物联网入侵检测中的机器学习模型,指出已有研究通常只强调预测精度,而将解释性分析(如SHAP)视为零计算成本的附加步骤,忽视了实际部署中的资源约束和解释成本。作者联合评估了预测性能、解释计算开销、局部解释稳定性以及选择性解释(即仅对关键样本生成解释)四个维度,并构建了一个避免数据泄漏的CICIoT2023数据集。数据处理上采用精确39特征哈希、非有限值处理、精确特征去重、保守的标签冲突移除和哈希级确定性划分,并基于自然分布与均衡分布两种测试集评估了逻辑回归、决策树、随机森林和梯度提升树(XGBoost)四类模型。实验显示,XGBoost整体预测能力最强,随机森林假阳性率最低。在5000个样本上计算TreeSHAP时,随机森林耗时700.759秒,而XGBoost仅需1.471秒,表明不同模型的解释成本差异悬殊。稳定性方面,随机森林的解释变化最小,XGBoost能保持较高排名和方向一致性,但top特征更替更频繁且属性幅度漂移更大。在均衡测试集上,利用约90%假阴性覆盖率的策略可节省28-32%的解释计算资源,95%覆盖率可节省15-23%;而在攻击密集的自然分布下,节省量大幅缩小。结果表明,实际可用的可解释物联网入侵检测系统应同时考虑预测质量、解释成本、局部稳定性、攻击样本预valence和选择性调用机制,而非仅依赖检测精度。该研究为资源受限环境下的可解释AI部署提供了量化评估基准。
💡 推荐理由: 为物联网入侵检测的可解释AI部署提供了成本与稳定性的量化洞察,打破了“解释免费”的假设,帮助安全团队在设计检测流程时合理分配计算资源,并理解模型解释在不同分布下的可靠性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)