#explainable-AI

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Yuge Zhang, Yuanxing Zhang, Yichao Jin, Khairul Amsyar Mohd Razis, Nicholas Qi An Choo, Kai Yin Anders Wong, Xinyan Tang, Kenneth Zhu Ke, Wee Keong Dennis Lee, Jingyuan Zhao

论文提出一个端到端的可解释钱骡账户检测管道,解决大规模金融欺诈中恶意账户识别的难题。管道分为三个阶段:首先,基于280个手工特征(涵盖交易模式、账户人口统计、网络拓扑和时间行为)训练LightGBM分类器进行初始检测;其次,利用TreeSHAP对每个预测进行特征归因分解,生成贡献度向量;最后,通过大语言模型(LLM)模块将SHAP归因结果转化为面向分析师的自然语言叙事。研究评估了三个开源LLM系列,并通过分析师反馈评价解释质量。在真实生产部署中,系统 yield rate 从基于规则的61%提升至89%,月度告警量从211增至302,表明真阳性覆盖范围扩大而非噪声增加。新增告警中60%为现有审查流程未发现的恶意行为。定性反馈表明,LLM生成的叙事降低了告警分类的认知负荷。论文进一步讨论了在监管金融环境中部署LLM增强可解释性的影响。主要贡献在于提出了首个结合机器学习、可解释性与生成式人工智能的端到端钱骡检测方案,并验证了其在真实环境中的有效性。适合金融安全分析师、欺诈检测工程师及可解释AI研究者阅读。

💡 推荐理由: 钱骡账户是金融欺诈的关键环节,传统规则方法识别率低。本工作将机器学习可解释性与LLM结合,显著提升检测覆盖率和分析师效率,适合金融行业蓝队参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Mohamed Aly Bouke, Md Shohel Sayeed, Swee-Huay Heng, Azizol Abdullah, Mohamed Othman

机器学习的网络入侵检测系统(IDS)通常依赖于聚合流统计数据,这丢弃了分布结构信息。传统的熵度量需要原始数据包序列,而在预先聚合的流数据集中不可用。本文提出多级分布熵(MDE),一个分析框架,直接从流级汇总统计量中推导出可解释的熵特征,包括三个层次:流内高斯微分熵、交叉方向Jensen-Shannon散度(JSD)以及TCP标志模式香农熵,无需原始数据包访问或训练数据。在四个基准数据集(NSL-KDD, CICIDS-2017, CICIDS-2018, UNSW-NB15)上,采用无泄漏的折内管道,仅使用熵特征实现了加权F1分数在0.708-0.989之间,与使用常规特征的性能相当。然后,完整的操作指标报告揭示了聚合F1所掩盖的失败模式:在CICIDS-2018上,F1=0.74掩盖了检测率(DR)仅为0.48;在未见过的攻击家族上,F1超过0.998但DR降至零。在时间漂移下,对703K条流的伪实时回放显示阈值排序分歧:得分排序保持良好(AUC=0.87),但固定阈值崩溃(DR=0.082),且重新校准无法恢复。SHAP折稳定性分析(Spearman rho=0.80-0.95)证实熵归属在不同异构环境中具有可重复性和领域一致性。论文的核心贡献在于:1)提出了一种无需原始数据包即可从聚合流统计数据中提取可解释熵特征的方法;2)通过全面的指标报告揭示了传统聚合性能指标在评估IDS时的局限性,尤其是检测率在不同场景下的显著下降;3)验证了熵特征的可解释性和稳定性。该研究适合网络安全管理者和IDS开发人员阅读,以理解细粒度性能评估的重要性。

💡 推荐理由: 本文提出的MDE方法提供了一种无需原始数据包的可解释IDS特征,并且通过细粒度指标暴露了传统评估的盲区,对于提升入侵检测系统的鲁棒性和透明性具有重要参考价值。

🎯 建议动作: 纳入内部评估,在自有数据集上验证熵特征效果,并关注细粒度检测指标。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jaehong Kim, Hyeonseung Kim, Jiseon Kim, Alice Oh, Thorsten Holz, Wonjae Lee, Meeyoung Cha

该论文针对国家层面的协调性信息操纵(即网络水军/巨魔)问题,提出了一种可解释的机器学习框架,用于检测和纵向分析疑似境外势力在韩国在线新闻评论区的活动。研究背景是外国影响力行动对线上平台构成日益严重的威胁,但检测国家关联的巨魔账号并追踪其演变仍充满挑战。核心方法是设计了一个分层分类模型,从三个关键维度对评论进行标注:境外来源、道德-情感框架以及目标国家。模型还能提取短文本级别的证据片段,提供人工可理解的解释依据。研究基于近20年(约112M条韩国新闻评论,涉及400万用户)的大规模数据集,识别出23,998个表现出协调操纵行为的账号。分析发现,这些账号主要依赖道德谴责式言论而非直接推广亲外部叙事;此类言论获得了显著更高的用户参与度。在高参与度评论中,道德谴责最常指向国内政治人物(如总统或政党领袖),且左右翼目标均有涉及,可能加剧社会极化。该框架支持透明、基于证据的平台治理,使平台能够优先防御并干预有害叙事-目标组合,避免其广泛传播。主要贡献在于提出了一种可解释的检测方法,并揭示了韩国语境下信息操纵的具体特征模式。适合安全运营人员、平台治理团队及研究信息操纵的学者阅读。

💡 推荐理由: 揭示了韩国语境下长期、隐蔽的境外信息操控活动模式,提供了可解释的检测思路,对平台对抗协调性虚假信息具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)