本文提出了一种名为 SkillWatermark 的新型攻击方法,针对大语言模型(LLM)智能体的技能模块。LLM 智能体的技能(skill)被广泛部署在各种应用场景中,但作者观察到,这些技能在执行过程中会产生特定的流量模式。基于此,他们设计了一条流水线,通过向原始技能描述中插入精心设计的提示约束条件(称为水印),使得被动网络攻击者能够在多轮对话的可见流量中建立一个隐蔽信道,从而编码并传输用户的隐私信息。具体而言,水印被嵌入到技能描述中,用户原始提示中的关键信息会被这些水印触发,进而产生可观察的流量编码。攻击者只需解码这些流量模式即可恢复被编码的信息。作者强调,这种修改是“良性”的——它不直接窃取任何私有数据,也不执行任何恶意指令,因此能够绕过现有基于 LLM 的安全审计工具。大量实验表明,所提出的水印能够产生高度一致且可区分的流量模式,并且转换后的技能能够通过现有安全审计。该研究揭示了生成特定流量模式可被利用为一种新型攻击面,并为未来的安全加固提供了重要见解。适合关注 LLM 智能体安全、隐蔽信道、流量分析和 AI 安全审计的研究人员阅读。
💡 推荐理由: 该研究揭示了一种隐蔽且难以察觉的隐私泄露攻击面,绕过了基于内容的安全审计,提醒防御者仅依赖内容检测不足,需重视流量侧信道风险。
🎯 建议动作: 研究跟进