该论文提出 SkillSentry,一个针对大型语言模型(LLM)智能体外部技能(Agent Skills)的动态安全测试框架。研究动机在于:外部技能在扩展智能体能力的同时,引入了执行时攻击面——一个静态检查看似良性的技能,只有在特定环境状态、资源或交互历史条件下才会暴露有害行为。传统扫描器主要依赖静态分析、预定义规则或一次性语义判断,难以有效诱发和归因这类条件性行为。SkillSentry 的核心方法包括三个步骤:首先,推断技能预期的能力边界;其次,构建由 LLM 模拟的环境,并设置受控的诱饵资源;最后,自适应地生成任务来探索技能的行为状态。它通过对比启用技能与匹配的无技能执行轨迹,将可疑行为定位到源代码和已验证的执行轨迹上,从而做出最终判断。实验部分,作者在七个扫描器配置上评估了 SkillSentry,在标准基准上达到 99.50% 的召回率和 96.26% 的平均 F1 分数;面对语义保持性规避攻击时,平均 F1 为 92.95%,而最强基线仅为 80.07%。代码已开源。该框架代表了从静态分析向动态、自适应安全测试的转变,为检测智能体技能的条件性恶意行为提供了新思路。适合关注 LLM 智能体安全、安全测试工具开发以及 AI 供应链安全的研究人员与蓝队工程师阅读。
💡 推荐理由: LLM 智能体插件/技能的安全评估是实际部署中的关键环节。SkillSentry 提出的动态测试方法能更有效地捕捉静态分析漏报的条件性有害行为,对构建安全的智能体生态具有直接参考价值,蓝队可借鉴其思路强化对第三方技能的审查能力。
🎯 建议动作: 研究跟进