该论文研究了一种针对智能体AI(Agentic AI)的新攻击面——动态恶意技能(Dynamic Malicious Skills)。技能是智能体AI的核心组成部分,通过自然语言文档(如SKILL.md)定义,允许代理动态加载和执行代码。攻击者可以在这些文档中嵌入恶意指令,诱导智能体在运行时将恶意逻辑注入到原本良性的技能中,从而绕过传统的静态安全检测。作者在OpenHands和Claude Code等主流智能体框架上评估了该攻击,实验表明动态恶意技能能够以较高的成功率引入多种恶意行为,包括数据泄露、权限提升和拒绝服务。为了防御,论文提出了一种系统级防护方案:利用操作系统内核强制实现的只读挂载(read-only mounts)来阻止技能的动态修改。评估显示该防御能有效阻断动态恶意技能,同时不影响良性技能的正常功能。该工作揭示了技能机制中存在的安全隐患,为智能体AI安全提供了新的研究方向和防御思路。适合关注AI安全、智能体系统安全的研究人员和工程人员阅读。
💡 推荐理由: 首次系统性地提出并演示了针对智能体技能机制的动态注入攻击,揭示了当前技能文件缺失运行时完整性验证的严重风险,对OpenHands、Claude Code等主流框架具有普遍威胁。
🎯 建议动作: 研究跟进