该论文是一篇面向AI代理(AI Agent)在Web3环境中攻击面的系统性综述。研究背景是:AI代理正从“只读”转向“执行”,在模型上下文协议(MCP)生态系统中,能够修改外部状态的工具调用占比已从27%升至65%。当代理通过MCP、技能(skills)和工具调用(tool calling)在公链上行使这种权限时,攻击的后果不再遵循传统软件安全假设,而是由区块链执行层决定。论文提出区块链执行层的四个核心属性——不可逆性(irreversibility)、签名权威(signing authority)、持续自主性(continuous autonomy)和序列级组合(sequence-level composition)——会从根本上改变威胁模型,使得通用代理安全中原本可恢复的失败,变成长期的、不可逆的资产损失。作者将碎片化的MCP安全文献整合为一个攻击面分类体系,并贡献了一个Web3风险映射矩阵:将每类攻击与放大后的影响、责任放大器、代表性缓解措施以及剩余缺口对应起来。随后,论文综合了现有防御手段,包括新兴的基于区块链的机制,并发现这些防御虽在进步但仍不充分:已有防护手段只能阻止不到30%的攻击,而模型级安全拒绝率不足3%。最后,作者将工作与相邻综述对比,并根据矩阵中未闭合的单元推导出未来研究议程。该研究适合关注AI代理安全、区块链安全、Web3基础设施防护的研究人员、安全架构师和蓝队工程师阅读,有助于理解AI代理在链上行动时的新风险维度。
💡 推荐理由: AI代理正在获得链上资产处置权,传统软件安全假设在不可逆、可自主签名的区块链环境下失效。本文首次系统梳理MCP攻击面并量化防护缺口,为蓝队评估代理类威胁提供框架。
🎯 建议动作: 研究跟进