👥 作者: Zhiyang Ding, Yang Luo, Guangpu Chen, Qingni Shen, Zhonghai Wu
该论文聚焦远程模型上下文协议(MCP)服务中大型语言模型(LLM)代理调用外部工具时的安全信任问题。传统OAuth授权只能证明调用方有权限,但无法确保后续工具调用确实由依赖方意图信任的提供方工作负载执行。作者称之为“授权后执行信任差距”:即使授权仍有效,执行可能已被切换到替代工作负载,或依赖过时的评估状态,或重用其他发送者转移的权限,甚至经过未声明的下游组件。为弥补这一差距,论文提出ACLE-MCP——一种调用级(invocation-scoped)架构,将委托授权、工作负载评估和资源侧执行准入相结合。对于受保护调用,ACLE-MCP签发短时且绑定发送者的“能力租约”(capability lease),该租约内嵌期望工作负载、新鲜度要求、操作、对象与参数边界、下游约束以及接收回执义务。在提供方,执行门(Execution Gate)会在受保护工具逻辑开始前立即验证并消费该租约。作者实现了可运行原型,集成Keycloak/OIDC验证、MCP Python SDK服务器,以及可选vTPM引用验证后端。受控安全实验表明,相比弱授权或仅连接时认证模式,完整ACLE-MCP能够阻止所有被评估的授权后攻击家族,同时保留良性任务不受影响。在一项本地模拟代理扩展测试中,完整设计相对仅OAuth使正常允许请求的聚合p95延迟增加25.7%。结论是:将调用权威与当前工作负载状态进行运行时绑定,是对OAuth保护远程工具使用的一种实用补充方案。
💡 推荐理由: 为依赖MCP远程工具调用的LLM应用提供了一种防范授权后执行篡改的机制,弥补OAuth静态授权的盲区,对保障企业级AI代理工作流完整性有直接意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arpan Kumar Mahapatra
该研究针对一个实际安全评估盲区: 当同一个智能体(Agent)同时使用 MCP 工具调用和 A2A 委托时,单独对每一层评估的安全性可能无法描述组合行为。作者构建了一个受控测试床: 一个真实模型主机通过本地 MCP 访问工具,再经本地 A2A 将消息传递给另一个代理,形成有序事件轨迹,并使用确定性规则进行精确计分,而不是依赖 LLM 裁判。实验采用冻结的三臂设计,包含 10 个记录场景,每个场景分别施加 "CONFIDENTIAL" 标头、无标头和 "PUBLIC - OK TO SHARE" 标头,但六个实质性记录字段的值在三种条件下字节完全相同。配置为 4 个模型 × 3 个条件 × 4 次重复,共 480 次试验。结果显示: 带 CONFIDENTIAL 标头与无标头之间的外发差异没有明确结论,且在所有模型中均接近下限;而增加 PUBLIC - OK TO SHARE 标头相对无标头会带来更高的逐字字段外发频率,但模型依赖性很大——Claude Sonnet 5 上效果强且一致(公开发送相对无标头的平均增加 0.800,所有 10 个场景均如此),GPT-5.6 的某一档中等但受到下限限制,另一档中位数增量为 0,还有一档完全没有效果。作者强调这是单一配置下的相关性而非因果关系。研究已公开代码、字节级轨迹和分析流水线,便于复现。对安全从业者的启发是: 在多协定的智能体链路中,简单的标签条件可能改变数据外发行为,不能依赖标签本身作为数据防泄漏控制,需要跨组件监督出站内容的逐字泄露。
💡 推荐理由: MCP 与 A2A 组合使敏感字段在代理间流动时可能突破单层 DLP;公开分享标签可能意外提升逐字外发风险,值得蓝队监控多智能体链路。
🎯 建议动作: 纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mehrdad Rostamzadeh, Sidhant Narula, Mohammad Ghasemigol, Daniel Takabi
本文提出并系统研究了模型上下文协议(MCP)服务器端的一种新型时间性信任攻击——TrustShift。MCP 已成为大语言模型(LLM)智能体连接外部工具后端的标准协议层,但其开放性引入了严重的服务器端威胁。TrustShift 攻击的核心机理是:被攻陷的 MCP 服务器在初始条件阶段保持良性行为,建立操作依赖并抑制智能体的怀疑,直到达到某个交互阈值后才切换到对抗性载荷。这种规避是时间维度的而非语法层面的:部署时表现为良性,因此可绕过部署前的静态分析;其切换后的载荷涵盖从明显的结构违规到保持协议合法性的模式有效操作,后者可规避运行时中间件过滤器。攻击通道是服务器控制的工具通道,而非用户提示(不同于间接提示注入)或传输层(不同于中间人攻击),对抗者本身就是被信任的服务器端点。作者提出了 TrustShiftProbe 评估与防御框架,包含四项贡献:(1)构建了智能体-服务器生命周期的状态化时间威胁模型,将生命周期建模为良性条件阶段与信任视界后的对抗性背叛阶段;(2)实现了一个语言无关的攻击引擎,可在四个生产域中实例化每种变体为受损的 MCP 服务器;(3)提出了 SHIELD,一种部署在 MCP 传输边界的多层级、零预言机运行时防御,利用干净信任窗口期学习的行为基线来审计服务器载荷;(4)建立了九种 TrustShift 变体的分类体系,涵盖三种执行机制(结构违规、语义破坏、范围扩展)和三种对抗目标(破坏、窃取及其组合)。实验覆盖前沿专有和开源模型,TrustShift 攻击的平均成功率为 69.5%,SHIELD 可将其降至 42.7%。该研究揭示了 MCP 生态中服务器端信任关系的脆弱性,为 LLM 智能体安全提供了新的威胁建模视角和防御思路。适合 LLM 安全研究者、智能体平台开发者及安全运营人员阅读。
💡 推荐理由: MCP 已成为 LLM 智能体与工具交互的标准,TrustShift 利用服务器被攻陷后的时间性行为切换,严重威胁智能体系统的可信边界。该研究首次系统化定义并防御此类攻击,对构建安全的 MCP 基础设施具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shriti Priya, Teryl Taylor, Frederico Araujo
本文提出 AEGIS,一个针对 Model Context Protocol(MCP)的跨域资源滥用防护策略执行组件。MCP 是一种开源的 JSON-RPC 协议,用于标准化大语言模型(LLM)与外部系统之间通过工具(tools)进行的交互。攻击者或恶意代理可以利用 MCP 工具的某些模态(modality)来降低基于代理的应用程序的整体服务质量,例如,代理可能请求过大的搜索半径或过长的视频,从而过载后端系统,导致响应缓慢甚至拒绝服务。文本、图像、视频和位置等每种模态都会引入不同的资源滥用向量,使得制定一致的缓解策略变得困难。此外,多模态和跨域工具暴露了多样的请求模式和参数,这给定义既通用又精确、能够执行有意义资源约束的策略带来了挑战。AEGIS 允许管理员针对异构 MCP 工具和模态定义细粒度的防护策略,以防范资源滥用。其核心方法是利用大语言模型的推理能力来分析、分类和规范化各种工具调用,将其转换为统一、策略友好的表示形式,便于安全从业者理解和使用。AEGIS 与 Open Policy Agent 及 ContextForge AI Gateway 集成,能够检测和缓解滥用行为,同时保留基于 MCP 的代理生态系统的灵活性。本文的主要贡献包括:提出了一种跨模态、跨域的资源滥用防护架构,利用 LLM 进行工具调用的语义理解和规范化,并通过策略引擎实现细粒度控制。适合关注 LLM 代理安全、MCP 生态安全、策略引擎设计与部署的安全研究人员、AI 基础设施工程师和蓝队成员阅读。
💡 推荐理由: MCP 作为 LLM 与外部系统交互的关键协议,正被广泛采用,但其工具调用的资源滥用面缺乏系统防护。AEGIS 为 SOC 团队提供了可落地的策略执行参考,能有效缓解 LLM 代理引发的 DoS 类风险。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rabimba Karanjai, Yang Lu, Nour Diallo, Wujie Xiong, Lei Xu, Weidong, Shi
该论文是一篇面向AI代理(AI Agent)在Web3环境中攻击面的系统性综述。研究背景是:AI代理正从“只读”转向“执行”,在模型上下文协议(MCP)生态系统中,能够修改外部状态的工具调用占比已从27%升至65%。当代理通过MCP、技能(skills)和工具调用(tool calling)在公链上行使这种权限时,攻击的后果不再遵循传统软件安全假设,而是由区块链执行层决定。论文提出区块链执行层的四个核心属性——不可逆性(irreversibility)、签名权威(signing authority)、持续自主性(continuous autonomy)和序列级组合(sequence-level composition)——会从根本上改变威胁模型,使得通用代理安全中原本可恢复的失败,变成长期的、不可逆的资产损失。作者将碎片化的MCP安全文献整合为一个攻击面分类体系,并贡献了一个Web3风险映射矩阵:将每类攻击与放大后的影响、责任放大器、代表性缓解措施以及剩余缺口对应起来。随后,论文综合了现有防御手段,包括新兴的基于区块链的机制,并发现这些防御虽在进步但仍不充分:已有防护手段只能阻止不到30%的攻击,而模型级安全拒绝率不足3%。最后,作者将工作与相邻综述对比,并根据矩阵中未闭合的单元推导出未来研究议程。该研究适合关注AI代理安全、区块链安全、Web3基础设施防护的研究人员、安全架构师和蓝队工程师阅读,有助于理解AI代理在链上行动时的新风险维度。
💡 推荐理由: AI代理正在获得链上资产处置权,传统软件安全假设在不可逆、可自主签名的区块链环境下失效。本文首次系统梳理MCP攻击面并量化防护缺口,为蓝队评估代理类威胁提供框架。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Suraj Kumar, Amy Wang, Srinivasan Manoharan
本文报告了一种面向 Model Context Protocol (MCP) 的企业级网关认证架构。MCP 已成为将 LLM 代理连接到企业工具的事实标准接口,但其快速采用带来了治理危机:大型组织在一年内从零部署到数十个内部 MCP 服务器,而每个团队独立实现认证方式,有的无认证,有的使用 API key,有的实现完整 OAuth,导致认证体系碎片化,无法统一授权调用者、追踪用户操作或对离职员工进行跨系统账号回收。为应对这一挑战,作者提出了一个集中式 MCP 网关,作为所有下游 MCP 服务器的统一聚合、治理和认证层。论文基于生产环境经验贡献了四个核心内容:第一,一个双轴认证模型,将角色(交互式用户 vs. 自动化非用户)与凭证类型(无认证、静态/动态 API key、PKCE、客户端凭证、平台应用上下文)进行交叉组合;第二,一个网关认证层,支持三种企业单点登录授权类型和三种令牌供应模式:自带令牌(BYOT)、生成令牌(GYOT)以及通过 RFC 8693 令牌交换的委托 OAuth;第三,三个端到端身份流——用户到 OAuth2、非用户到服务账号、用户到服务账号——组合了客户端、网关和服务器;第四,部署演进路径,从 CDN/WAF/边缘边界到私有 MCP 隧道和企业级连接器。该架构已在生产环境中运行,覆盖 Web、桌面、自定义 SDK 和低代码客户端等数十个 MCP 服务器。本文对负责 MCP 安全架构设计、企业身份治理和 LLM 代理安全集成的研究者与安全工程师具有重要参考价值。
💡 推荐理由: MCP 在企业的快速普及导致认证碎片化,本文提供了一个经过生产验证的集中式网关方案,可指导企业统一 LLM 代理访问控制、身份委托和账号生命周期管理,对 SOC 与 IAM 团队有直接参考意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gautam Bharti
本文针对Model Context Protocol (MCP) 注册表描述的安全审计时效性问题展开研究。现有MCP安全研究通常基于单一时点的静态审计,未考虑注册表描述随时间变化的情况,导致审计结论可能迅速过时。作者通过88.6天对官方MCP注册表进行120次观测,覆盖19,099个不同的服务器(从3,510增长至18,966),重建了描述演变的完整面板数据。核心发现是:如果按历史漂移程度排序选择前5%的服务器进行重新审计,在持有期内只能捕捉到约20%的此前观察过的、描述发生变化的服务器,以及约10%的全部描述变更者,远低于使用描述符漂移整体排序所能达到的27%覆盖率。尽管该排名仍能带来约4倍的提升,但由于描述变更的稀疏性(仅8.6%的服务器曾重写过描述,而描述符为24.8%),且约一半的变更发生在历史排名无法覆盖的新增服务器上,导致同样的提升只能获得较少覆盖率。为此,作者提出内容绑定(content-binding)策略,即在描述哈希变化时立即重新验证,并配合定期全量扫描;历史漂移排名可作为补充但无法应对新条目。文章还描述了描述变更的分布:在至少观察10次的服务器中,四分之三从未变化,最活跃的5%产生了61%的变更事件,30天内11.9%的描述变更,而朴素复合预测为35.8%,显示重尾分布,但该预测仅用于诊断。作者开源了面板数据、图表生成器和分析代码。该研究为MCP生态的安全审计提供了量化依据,强调动态监控的重要性,适合安全审计工具开发者、AI代理安全研究者和注册表维护者阅读。
💡 推荐理由: MCP注册表描述是AI代理集成与安全评估的重要依据,过时描述可能导致错误风险判断。该研究揭示静态审计的必然失效,为实施持续验证和动态监控机制提供了量化证据。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nicolás Padilla
本文首次对互联网上暴露的 Model Context Protocol (MCP) 服务器进行大规模动态安全评估。MCP 自 2024 年 11 月发布以来迅速普及,公共互联网上可检测到超过 21,000 个服务器实例。作者结合被动发现与主动动态测试:被动发现覆盖 crt.sh、HuggingFace、GitHub、npm、Smithery、PyPI、Censys、FOFA、Shodan、glama.ai 和 pulsemcp.com 共 11 个数据源;主动测试使用自研框架 Corvus,包含 34 个测试模块,覆盖 10 类 MCP 特有漏洞。在 2026 年 7 月进行的四轮测量中,确认了 640 个生产 MCP 服务器,并对其中的 414 个进行了动态审计,发现 68 个可报告漏洞,涉及 SQL 注入、针对云元数据服务的 SSRF、提示词模板注入以及通过游标操作实现的路径遍历。审计发现 91.8% 的服务器未启用 OAuth 认证,687 个工具实例暴露 shell 执行能力且无访问控制,41.6% 的确认服务器在连续测量间隔三天内消失,表明快速部署且缺乏安全审查。作者还介绍了负责任披露流程,并将 Corvus 作为开源框架发布,用于 MCP 安全评估。该研究填补了 MCP 安全动态评估的空白,对理解 AI 代理基础设施的暴露面有重要价值。
💡 推荐理由: MCP 服务器作为 AI 代理的关键基础设施,其暴露面可能被利用来操纵模型行为或访问敏感资源。该研究揭示了大范围缺乏认证和漏洞存在,为蓝队评估自身 MCP 部署提供了基线和方法。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji
随着大型语言模型(LLM)智能体的快速发展,其已被广泛应用于各类真实世界任务。为了标准化LLM智能体与外部环境之间的交互,模型上下文协议(MCP)工具应运而生,并成为事实上的标准,被广泛集成到这些系统中。然而,MCP工具的使用也引入了新的安全风险,因为LLM智能体可能被诱导执行恶意或未经授权的操作。尽管已有工作提出了针对LLM智能体工具使用的防御措施,但大多数方法依赖静态分析(即检查提示词和生成的输出),这限制了防御的有效性和鲁棒性。为了克服这些局限,本文提出了MTGuard,一种基于混合分析的防御框架,通过生命周期感知的静态-动态协同分析来保护LLM智能体中MCP工具的安全使用。广泛的评估表明,MTGuard能够有效缓解不同LLM智能体上多种类别的有害工具使用,同时保持良性用户任务的性能。该研究的核心贡献包括:提出了首个结合静态与动态分析的MCP工具安全防御框架;引入生命周期感知的概念,覆盖工具调用的完整过程;通过实验证明了其在多个智能体上的有效性和通用性。该论文适合LLM安全研究人员、智能体平台开发者以及关注AI供应链安全的安全工程师阅读。
💡 推荐理由: MCP已成为LLM智能体与外部工具交互的标准,但其安全风险尚未得到充分解决。MTGuard提出的混合分析思路突破了传统静态检测的局限,为蓝队防护AI智能体提供了新的技术参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Baichao An, Pei Chen, Geng Hong, Yueyue Chen, Mengying Wu
本文提出了 FlowGuard,一个基于证据的 MCP(模型上下文协议)安全检测系统。MCP 允许 LLM 代理与外部工具交互,但现有安全扫描器主要依赖语义信号(如字符串模糊匹配)而非实际执行行为,导致误报。例如,看似凭证的字符串可能只是占位符,并非真实泄露。FlowGuard 填补了这一空白,通过组合语义风险分类、重定向引导的载荷缩减、模式验证的探针生成、证据评估和历史引导的细化,实现了对执行相关风险的运行时证据验证,以及对工具元数据和返回内容中语义风险的检测。系统在包含 1880 个 MCP 案例的可执行基准测试上评估,覆盖五种漏洞类别。在命令注入和文件系统访问类别上,F1 分数分别达到 0.879 和 0.942。与现有动态扫描器相比,端到端延迟降低了最多 2.23 倍。在实际评估中,FlowGuard 在 326 台服务器上报告了 523 个发现。结果表明,基于证据的检测可以同时评估 MCP 交互中的执行相关风险和语义风险。
💡 推荐理由: FlowGuard 首次提出基于运行时证据的 MCP 安全检测方法,解决了现有扫描器仅依赖语义信号导致的误报问题,对 LLM 代理的运行时安全防护具有重要价值。
🎯 建议动作: 研究跟进,评估将 FlowGuard 集成到现有 LLM 安全框架中的可行性。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pei Chen, Baichao An, Mengying Wu, Binwang Wan, Geng Hong, Jinsong Chen, Xudong Pan, Jiarun Dai, Min Yang
本文针对模型上下文协议(MCP)的安全性问题进行了大规模实证研究。MCP已成为基于LLM的代理与外部工具及服务交互的标准接口,随着其被广泛应用于安全敏感操作,理解其真实世界风险变得至关重要。然而,由于缺乏大规模运行时MCP服务器,现有安全评估主要依赖对少量案例的扫描,但这些评估的可靠性尚不明确。为此,作者提出了MCPZoo——目前最大的用于动态分析的MCP服务器集合。MCPZoo通过一个多智能体框架构建,该框架模拟人类专家构建、诊断和迭代修复部署与运行时缺陷的过程,结合环境推理与反馈驱动的改进,将现实中的静态仓库转换为动态服务。为确保运行时交互性,服务器通过真实协议交互进行验证。最终,MCPZoo包含64,611个独立MCP服务器(总计113,927个),其中超过37,288个支持动态分析。基于MCPZoo,作者进行了首次生态系统规模的MCP服务器及对其进行分析的扫描器的测量。结果发现,现有扫描器报告96.89%的服务器存在风险,但这些信号并不可靠。具体而言,手动验证显示不到50%的采样告警为真阳性,且不同扫描器的输出存在明显不一致。总之,MCPZoo实现了大规模、可复现的MCP服务器安全测量,并暴露了当前扫描实践的限制。作者还发布了公共查询接口以支持MCP服务器的实际风险评估。
💡 推荐理由: 揭示了当前MCP安全扫描工具的可靠性问题,指出高误报率和不一致性,为蓝队和安全工程师正确评估MCP风险提供了关键警示,避免盲目信任扫描结果。
🎯 建议动作: 纳入内部评估:建议安全团队重新审视现有MCP扫描工具的有效性,并参考MCPZoo的方法进行更可靠的动态分析。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Mohammadreza Rashidi
该论文系统化整理了2023-2026年间关于AI编码代理执行安全性的39篇论文,将其分为17个类别,并直接验证了每个类别与原始来源的一致性。研究背景是AI编码代理可以读取仓库、调用工具和执行shell命令,但缺乏足够的人类监督,因此其执行层的安全性成为关键问题。现有文献分散在不同子领域(如沙箱隔离、能力与访问控制、策略执行、TOCTOU竞争、MCP威胁、身份委托、执行溯源、网络出口控制和代理生成代码的静态分析),彼此很少互相引用。论文通过系统化梳理,发现了五个跨领域的缺口:(1)隔离架构和能力模型几乎从未在共享基准上相互评估;(2)策略执行研究报告的真实拒绝列表失败率高达69%-98%,但没有隔离论文在该对抗设置下重新评估自身的防御;(3)TOCTOU和MCP威胁被视为独立的文献,尽管它们都是同一个状态验证问题的实例;(4)所有执行机制假设策略作者诚实,未解决策略编写错误本身;(5)在真实提示下,良性但超出范围的代理动作发生率高达17.1%,但没有任何访问控制或能力论文处理此问题。此外,论文还确认了四个直接影响生产代理框架的已披露并修补的CVE。最后,论文针对这五个缺口提出了未来的研究议程。该论文适合AI安全研究人员、系统安全工程师以及开发AI编码代理平台的团队阅读。
💡 推荐理由: 首次系统化梳理AI编码代理执行安全领域,清晰指出现有研究的碎片化问题和关键缺口,为后续研究和实践提供了明确方向。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ting Liu
本文研究MCP(Model Context Protocol)风格的代理运行时的安全不变性。MCP为语言模型应用提供了工具、资源、提示和传输的连接层,但随着代理从连接向执行推进,安全决策分散在客户端、服务器、提示、批准对话框、OAuth部署和日志中,缺乏统一的执行层安全保证。作者定义了八个关键安全不变性:元数据非权威性、授权支持的批准、规范化资源、主体绑定、范围化能力调用、源和目标数据流授权、拒绝路径审计以及显式协议状态。为实现这些不变性,提出了HCP(Handle-Capability Protocol)参考运行时,其架构包括主体、资源、授权、能力、句柄、策略决策、数据管道检查和审计条目等元素。实验设置包括两个基线:一个简单的连接层运行时和一个实践指导的缓解基线(包含元数据检查、会话检查和每次调用批准)。在10个基准攻击案例中,简单基线允许所有攻击,缓解基线允许6个,HCP阻止全部10个并提供审计证据。消融实验表明哪些运行时组件阻止了攻击并保留了取证证据。本地微基准测试显示策略执行、调用、窥视和管道操作的平均延迟低于1毫秒。此外,对GitHub README的筛选示例提供了生态系统信号而非漏洞发现。结论是MCP风格的代理系统需要在连接层约定之外增加执行控制层,以实现显式可测试的安全不变性。本文适合代理安全架构师、LLM安全研究人员以及运行时开发者阅读。
💡 推荐理由: MCP代理正成为LLM应用的关键基础设施,但其执行层安全缺乏系统化定义。本文提出的8个不变性和HCP运行时为代理安全提供了可测试的参考架构,有助于防御者理解并防范执行层攻击。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Biwei Yan, Minghui Xu, Yijun Yang, Boyang Ma, Xuelong Dai, Jingku Li, Yue Zhang
随着大语言模型(LLM)的广泛部署,模型上下文协议(MCP)已成为连接LLM与外部资源的事实标准。然而,MCP协议本身引入了一类隐私泄露风险,现有工具难以检测。与传统的显式数据泄露不同,MCP服务器中的泄露主要是协议诱导的:凭据、API密钥和个人身份信息(PII)仅通过被返回、记录或在工具处理程序中抛出,即可跨越本地/LLM边界,而源代码中不存在显式的出站请求。本文提出MCPPrivacyDetector,一种上下文感知的跨语言静态分析框架,用于检测多语言MCP服务器中的此类泄露。该框架首先将不同编程语言(如Python)实现的异构代码提升为统一程序表示,然后应用上下文感知语义过滤以隔离真正敏感的值和协议特定的隐式汇点(例如@mcp.tool处理程序),最后执行污点分析以枚举可行数据流。通过对10,655个真实MCP服务器进行分析,MCPPrivacyDetector发现泄露率超过10%。案例研究证实了具体暴露,包括泄露的Bearer令牌、传播的API密钥和明文认证凭据。这项工作论证了在新兴的LLM智能体工具链中需要系统性的、协议感知的安全防护。
💡 推荐理由: MCP作为LLM智能体生态的关键协议,其隐私泄露风险直接影响企业和用户的数据安全。该研究首次系统性地检测协议诱导的泄露,为蓝队和安全工程师提供了评估LLM工具链安全性的新视角。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Harshil Patel, Kunal Pai
本文研究了Model Context Protocol (MCP) 标准化自主智能体工具调用时引入的一个被忽视的攻击面:错误处理循环。作者假设工具的错误消息具有隐含权威,会触发智能体的纠正性推理模式,从而绕过标准安全启发式。为此,他们提出了VATS(Vulnerability Analysis of Tool Streams)框架,这是一个基于系统性突变的测试框架,能够沿着七个结构性和语言学维度生成对抗性载荷。通过在Gemini 3.1 Pro、GPT-5.5、GLM-5.1和Qwen3-Coder四个前沿模型上的评估,实验表明,错误路径注入能使标准间接提示注入(IPI)的成功率提高三倍,在受控评估中最高达到100%的遵从率。研究进一步发现,结构性定位(即在错误上下文中夹带指令)是跨所有测试模型的最有效利用向量。虽然生产框架的护栏可以缓解这些漏洞,但模型层的固有脆弱性对定制化智能体工作流构成了系统性风险。本文的主要贡献包括:识别并系统化了一个新攻击面,提出了一种自动化突变驱动测试方法,并通过大量实验验证了攻击的有效性和迁移性。适合AI安全研究员、智能体框架开发者及安全运营团队阅读。
💡 推荐理由: 揭示了MCP协议下自主智能体错误处理机制的安全漏洞,攻击成功率极高,直接影响依赖工具调用的AI系统的安全性。
🎯 建议动作: 研究跟进,将错误路径注入纳入威胁模型并进行针对性评估
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yutao Shi, Xiaohan Zhang, Xiangjing Zhang, Xihua Shen, Hui Ouyang, Huming Qiu, Mi Zhang, Min Yang
本文针对模型上下文协议(Model Context Protocol, MCP)服务器中普遍存在的描述-代码不一致(Description-Code Inconsistency, DCI)问题进行了系统性研究。MCP是大语言模型(LLM)调用外部工具的关键标准,其工作流程中,LLM依赖MCP服务器提供的自然语言描述来选择和执行函数。这一交互隐含地假设工具描述忠实反映底层实现,但实际中该假设并未得到强制验证。本文首先正式定义了DCI问题,并提出了一个全面的分类体系,涵盖功能不一致和未声明的副作用。基于该分类,开发了自动化框架DCIChecker,该框架结合结构感知的静态分析和直接-反向-仲裁(Direct-Reverse-Arbitration)提示方法,对工具描述与实际代码实现进行交叉验证。研究人员将框架应用于包含2214个真实MCP服务器中19200个描述-代码对的大规模数据集。测量结果表明DCI普遍存在,9.93%的对存在不一致。进一步分析显示DCI会造成关键防御盲区,可能引发从操作失败到隐蔽恶意行为等多种风险。最后,本文提出了强制语义一致性的缓解策略,以增强新兴代理生态系统的可靠性。该研究适合AI安全、LLM应用安全、软件工程等领域的从业者阅读。
💡 推荐理由: MCP是LLM调用外部工具的关键协议,描述-代码不一致可能被攻击者利用,导致LLM执行未预期的危险操作,是新兴AI供应链安全的重要盲区。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Pengyu Sun, Qishu Jin, Enhao Huang, Zifeng Kang, Xin Liu, Dakun Shen, Song Li
本文提出了VIPER-MCP,这是首个针对MCP(模型上下文协议)服务器的端到端自动化漏洞审计框架。MCP已成为连接LLM代理与外部工具的标准接口,由于MCP服务器暴露特权操作(如shell执行、网络访问、文件系统操作),其工具处理程序中的实现缺陷可导致从自然语言输入到安全敏感接收器的直接路径,进而引发远程代码执行或系统完全沦陷。现有方法要么产生未经验证的静态告警,要么依赖缺乏代码级指导的固定模板库,无法触发需要特定参数形状或多步污染路径的漏洞。VIPER-MCP引入两种新技术:(1)两遍静态分析中的锚点-查询遍,通过函数级结构上下文增强标准污染告警,将文件级静态工件解析为具体的MCP工具处理程序,并生成以漏洞为锚点的调用链;(2)反馈驱动的提示进化机制,采用双变异器调度,独立校正工具选择漂移并加深参数渗透,结合适应度评分的种子选择,迭代优化自然语言提示以触发漏洞。在39884个真实开源MCP服务器仓库的大规模扫描中,VIPER-MCP发现了106个0-day漏洞,均通过端到端利用轨迹确认,迄今已分配67个CVE ID。所有发现的漏洞均已负责任地披露给受影响的开发者,并协调CVE分配。
💡 推荐理由: MCP正成为LLM代理生态的关键组件,其安全漏洞可能被攻击者利用自然语言提示远程控制主机。VIPER-MCP提供了首个自动化审计方案,可帮助防御者提前发现并修补此类高危漏洞。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rohith Uppala
本文研究了大型语言模型(LLM)作为自主代理时,其工具调用权限控制的安全缺陷。作者指出,当未授权工具出现在代理的上下文窗口中时,即使模型被明确指示禁止调用,在对抗性场景下仍可能被选中。现有基于提示(prompt)的约束方法效果有限,只能将未授权调用率(UIR)降低11-18个百分点,存在显著的残余风险。为此,本文提出了一种受治理的MCP(Model Context Protocol)代理,在工具发现和工具调用两个阶段强制实施基于属性的访问控制(ABAC):在工具发现阶段,从模型的上下文窗口中移除未授权工具;在工具调用阶段,进行二次检查以阻止任何未授权调用。通过在三个模型(Qwen 2.5 7B、Llama 3.1 8B、Claude Haiku 3.5)上执行150项覆盖四种攻击类别的对抗性任务,实验表明该架构强制方法将未授权调用率降至0%,且中位数延迟增加不超过50毫秒。研究结论认为,在部署的代理系统中,可靠的工具访问控制必须依赖架构强制而非提示工程。本文适合LLM安全研究员、AI代理开发者和系统安全工程师阅读。
💡 推荐理由: 揭示了基于提示的LLM工具权限控制不可靠,首次提出通过代理层进行架构强制,为Agent系统提供可落地的安全方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)