该论文提出了一种名为 Daydreaming 的黑盒攻击方法,用于窃取多文件形式的 AI Agent 技能。所谓 Agent 技能通常包含指令、参考数据和可执行辅助文件,使通用 Agent 能够执行特定任务。技能托管方可以将这些文件保密,仅按次出售任务结果,因此技能本身具有极高商业价值。现有的防泄露机制可以拦截直接询问技能内容或要求复现文本的请求,但无法阻止用户提交服务原本要完成的普通任务。Daydreaming 是一种仅基于执行结果的攻击,通过自适应构造任务来探测隐藏技能的行为。攻击者不要求受害者泄露技能文件,也不要求其对重建结果评分,而是通过黑盒交互逐步区分可能的隐藏行为。具体而言,方法会测试每个行为单元,利用攻击者控制的影子 Agent 选择设计方案,并通过存储的受害者结果和本地执行校验最终完成每个文件的恢复。论文形式化定义了三级访问威胁模型:Differential、Trace 和 Output,重点研究最严格的 Output 级别——攻击者只能看到最终响应和返回的文件。实验覆盖 7 种技能和 4 个受害者模型,Daydreaming 在 Output 级别能恢复原始技能 86.8% 的能力,比 SigLeak 方法几乎提升 4 倍。即便在启用了泄露防御的情况下,恢复一个可安装技能仅需中位数 32 次受害者调用。这些结果证明,仅隐藏技能文件和过滤直接泄露请求并不能防止通过正常使用进行的功能性重建。该研究面向 AI 安全研究人员、Agent 平台设计者和防御方,揭示了现有保护措施的不足。
💡 推荐理由: 该研究证明即使隐藏技能文件并阻止直接泄露,攻击者仍可通过普通任务交互重构 Agent 技能,直接威胁技能托管商业模型。对使用 Agent 技能的服务商,必须重新审视保护策略,不能仅依赖文件级保密。
🎯 建议动作: 研究跟进,评估自身 Agent 技能托管方案是否受此类攻击影响,并测试防护措施。