随着大型语言模型(LLM)智能体的快速发展,其已被广泛应用于各类真实世界任务。为了标准化LLM智能体与外部环境之间的交互,模型上下文协议(MCP)工具应运而生,并成为事实上的标准,被广泛集成到这些系统中。然而,MCP工具的使用也引入了新的安全风险,因为LLM智能体可能被诱导执行恶意或未经授权的操作。尽管已有工作提出了针对LLM智能体工具使用的防御措施,但大多数方法依赖静态分析(即检查提示词和生成的输出),这限制了防御的有效性和鲁棒性。为了克服这些局限,本文提出了MTGuard,一种基于混合分析的防御框架,通过生命周期感知的静态-动态协同分析来保护LLM智能体中MCP工具的安全使用。广泛的评估表明,MTGuard能够有效缓解不同LLM智能体上多种类别的有害工具使用,同时保持良性用户任务的性能。该研究的核心贡献包括:提出了首个结合静态与动态分析的MCP工具安全防御框架;引入生命周期感知的概念,覆盖工具调用的完整过程;通过实验证明了其在多个智能体上的有效性和通用性。该论文适合LLM安全研究人员、智能体平台开发者以及关注AI供应链安全的安全工程师阅读。
💡 推荐理由: MCP已成为LLM智能体与外部工具交互的标准,但其安全风险尚未得到充分解决。MTGuard提出的混合分析思路突破了传统静态检测的局限,为蓝队防护AI智能体提供了新的技术参考。
🎯 建议动作: 研究跟进