#evidence-grounded

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

本文提出 DiagChain,一个面向大语言模型(LLM)智能体的诊断性基准测试,用于评估其在证据支撑下的攻击链重建能力。攻击链重建是网络安全中的关键任务,要求智能体从异构遥测数据中检索并解释证据,推断出有序的攻击者行为。现有基准大多只评估最终输出或聚合准确率,难以定位推理中间阶段出现的错误及其传播方式。DiagChain 的核心贡献包括:1)MAIN-69 场景集,包含 69 个跨多个操作系统、不同证据噪声等级和不同攻击链长度的场景,覆盖 849 个参考步骤;2)提出证据中心检索增强生成(ECRAG)方法,将证据检索与重建链的演化结构化表示相结合,使证据能够动态融入推理过程;3)引入五个互补的评估指标,分别对应重建流程的不同阶段,支持系统性故障诊断。作者基于 6 个 LLM 进行评测,结果显示即使最强的配置也仅在 MAIN-69 中 849 个参考步骤上达到 39.6% 的成功率。进一步分析表明,较小模型难以完成将检索到的证据纳入输出的基础任务,而较大模型虽能推进到后续步骤,但在证据的合理排序上成为主要瓶颈。这些结果验证了超越端到端准确率的诊断性评估的重要性,并为改进基于证据的网络安全智能体提供了可操作的见解。本文适合 LLM 安全研究员、网络安全自动化工具开发者以及关注 AI 智能体可靠性的蓝队人员阅读。

💡 推荐理由: 攻击链重建是安全运营的核心环节,LLM 智能体有望自动化该过程。DiagChain 首次提供阶段级诊断视角,帮助识别模型在证据检索、纳入与排序等环节的具体薄弱点,对构建可信的 AI 安全助手有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Baichao An, Pei Chen, Geng Hong, Yueyue Chen, Mengying Wu

本文提出了 FlowGuard,一个基于证据的 MCP(模型上下文协议)安全检测系统。MCP 允许 LLM 代理与外部工具交互,但现有安全扫描器主要依赖语义信号(如字符串模糊匹配)而非实际执行行为,导致误报。例如,看似凭证的字符串可能只是占位符,并非真实泄露。FlowGuard 填补了这一空白,通过组合语义风险分类、重定向引导的载荷缩减、模式验证的探针生成、证据评估和历史引导的细化,实现了对执行相关风险的运行时证据验证,以及对工具元数据和返回内容中语义风险的检测。系统在包含 1880 个 MCP 案例的可执行基准测试上评估,覆盖五种漏洞类别。在命令注入和文件系统访问类别上,F1 分数分别达到 0.879 和 0.942。与现有动态扫描器相比,端到端延迟降低了最多 2.23 倍。在实际评估中,FlowGuard 在 326 台服务器上报告了 523 个发现。结果表明,基于证据的检测可以同时评估 MCP 交互中的执行相关风险和语义风险。

💡 推荐理由: FlowGuard 首次提出基于运行时证据的 MCP 安全检测方法,解决了现有扫描器仅依赖语义信号导致的误报问题,对 LLM 代理的运行时安全防护具有重要价值。

🎯 建议动作: 研究跟进,评估将 FlowGuard 集成到现有 LLM 安全框架中的可行性。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)