推荐 10.6
Conf: 50%
本文提出一种针对大语言模型(LLM)智能体的新型黑盒能力克隆攻击方法 AgentLeak。研究背景是:LLM 智能体通过基础模型与显式技能(skills)及执行中获得的隐式程序性知识相结合,能够完成长期任务,这种任务解决能力已成为宝贵的商业资产。既有技能窃取攻击主要恢复显式技能工件,但本文发现工件泄露并不必然导致能力迁移:弱智能体即使获得相同技能,仍因缺少强智能体隐式展现的程序性行为而失败。核心洞察在于:技能执行差距本身构成泄露面——受害智能体成功执行与攻击者智能体失败执行之间的可观察差异,会暴露缺失的行为。基于此,AgentLeak 从这些执行差异中识别能力关键行为,并将其整合到攻击者侧技能中,同时保持攻击者的模型、框架和工具不变。实验涵盖 20 个任务场景、600 个实例、多种智能体系统和多个骨干模型,结果显示 AgentLeak 相比直接技能重用将任务通过率提升超过 40%,并恢复了受害者与攻击者能力差距的 80% 以上。这项研究揭示了 LLM 智能体中的机密性风险:仅保护显式工件是不够的,可观察的执行行为可能泄露重建专有任务解决能力所需的程序性知识,从而让低能力且受攻击者控制的智能体获得复制能力。本文适合关注 AI 安全、LLM 智能体攻防、模型知识产权保护的研究人员和安全从业者阅读。
💡 推荐理由: 该研究首次系统性地证明:即使不窃取显式技能,仅通过观测执行差异即可让弱智能体克隆强智能体的隐式程序性知识,对 LLM Agent 的知识产权和机密性构成新型威胁。
🎯 建议动作: 研究跟进,评估自身 Agent 是否暴露过多执行细节,并考虑混淆响应或限制可观察行为差异。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)