本文提出了一种名为拓扑归因距离(Topological Attribution Distance, TAD)的新方法,用于解决大语言模型(LLM)在网络安全运营中输出证据归因与溯源的问题。随着LLM和Agentic AI被集成到安全运维系统中,模型生成的决策必须可信任、可追溯;当自主智能体做出正确或错误决策时,团队需要能够回溯决策链,定位究竟是哪一段输入数据导致了模型输出。现有归因方法在区分复杂且高度相似的证据源(如网络事件日志)时存在困难,无法充分捕捉检索证据与生成响应之间的整体几何关系。TAD受拓扑学启发,通过刻画模型输出在嵌入空间中的全局几何形状,并测量特定日志嵌入改变该几何形状的程度,来判断该日志是否为关键归因源。该方法采用段级消融归因(segment-level ablation attribution),对真实网络攻击事件日志进行分析,能够自适应地找出对LLM输出影响最大的日志片段。TAD利用每个LLM的隐藏状态,提供可解释、可信任的溯源能力,帮助理解几何上不同的检索日志如何影响模型生成,为网络安全和Agentic-AI工作流提供证据验证手段。实验部分展示了TAD在实际攻击日志上的有效性,表明其能准确识别关键归因日志。本文的主要贡献包括:提出基于拓扑的归因距离度量,引入段级消融归因机制,以及将几何形状变化与证据溯源相结合,弥补现有方法在复杂相似证据区分和全局几何关系捕捉上的不足。适合AI安全研究人员、LLM可解释性研究者、以及负责安全运营自动化的工程师阅读。
💡 推荐理由: 该研究为LLM输出提供了可解释的溯源方法,帮助安全团队定位导致模型决策的关键日志,增强Agentic AI在安全运营中的可信度,对证据验证和事件调查有直接价值。
🎯 建议动作: 研究跟进