计算机使用代理(CUA)系统将大型语言模型(LLM)转化为可持久执行的智能体,能够生成、存储并复用技能(skills)和记忆条目(memory entries)等工件。然而,现有安全防御大多将攻击视为外部触发或时间有限的过程,未能有效应对恶意影响如何通过代理自身的持久状态进行内部传播。本文揭示了恶意影响可以被隐蔽地嵌入到自主合成工件的结构冗余之中,从而在内部状态更新时存活,并绕过常规的审查机制。为了形式化这一威胁,作者提出了 SynChain,一种自合成的攻击范式,利用持久性感知的定向监督微调(persistence-aware directed supervised fine-tuning),诱导代理创建带有恶意载荷但外表正常的工件。该攻击使得休眠的载荷能够在未来的工作流中作为可信上下文被无缝重新激活,整个过程无需任何新增的恶意外部输入。为了系统评估这种传播,作者构建了 CUAChain 数据集,包含 30 条良性任务链和三个攻击目标。在 OpenClaw、Codex 和 Claude Code 上,在四种不同防御设置下进行的广泛实验表明,SynChain 能够取得高攻击成功率,并优于调整后的基线方法。该研究证明,保护 CUA 系统需要具备来源感知的推理能力,即跨任务执行轨迹进行安全分析。本文的主要贡献包括:首次系统化揭示 CUA 内部持久化状态带来的新型攻击面,提出可复现的攻击范式与评估数据集,并在多个主流代理框架中验证了攻击的有效性,为后续安全防御研究提供了重要基础。
💡 推荐理由: CUA 系统正快速普及,但其持久化状态引入的新攻击面尚未被充分认识。本文揭示的“内部污染”攻击可绕过传统外部输入检测,影响所有依赖技能/记忆复用的 LLM 代理,安全团队需重新审视对代理系统的信任边界。
🎯 建议动作: 研究跟进