#skill-extraction

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.6
Conf: 50%
👥 作者: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

本文提出了一种针对自进化智能体(self-evolving agents)的新型攻击方法 SkillJack。自进化智能体会将交互历史转化为可复用的技能(skills),这些技能可以跨任务持久保存。以往研究关注的是记忆与检索投毒,但此类攻击仅在恶意记录被检索为上下文时才会生效。本文发现了更根本的风险:被投毒的经验可能被智能体自身转化为持久的行为工件。SkillJack 首次利用自进化智能体的经验-技能转换管道(experience-to-skill pipeline),通过劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中,而不是直接操纵运行时上下文。作者识别出该攻击的三个关键特性:净化洗白(sanitization whitewashing),即恶意意图在技能提取过程中被掩盖;跨层提升(cross-layer promotion),即瞬态经验成为持久能力;持久性隔离(persistence isolation),即攻击能在删除原始源记录后继续存活。作者在 SkillX 和 Anything2Skill 两个代表性系统上进行了评估,使用包含 150 条轨迹的共享数据集,覆盖四类政策风险。结果表明,技能提取显著降低了攻击的可检测性:在 SkillX 中,安全检测率从针对被投毒轨迹的 98.5% 降至针对提取技能后的 11.4%,Anything2Skill 也呈现类似效果。同时,植入的技能仍然有效,在两个系统上的攻击成功率分别达到 56.2% 和 89.2%。此外,80.0% 的经由技能介导的攻击在删除原始被投毒记录后仍然存在,部分技能还会在良性查询上意外激活。这些发现揭示了技能演化是一个新的攻击面,并提出了对技能生命周期进行来源感知保护的需求。代码已开源。

💡 推荐理由: 首次揭示自进化智能体的技能提取管道可被投毒,且攻击具有持久性和隐蔽性,威胁持久化能力远超传统上下文注入,对AI代理安全防护提出全新挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)