推荐 5.5
Conf: 50%
本文研究了基于大型语言模型(LLM)的自主多智能体系统(AMAS)在推理时(inference-time)所依赖的“智能体编排框架”(harness)的知识产权泄露风险。AMAS 系统(例如 Hermes)在推理过程中动态协调多个 LLM 智能体的推理与行动,其编排框架需要在组合搜索空间中与底层 LLM 共同进化,构建成本高昂,因而构成了有价值的知识产权。已有工作关注静态多智能体系统中预配置架构的 IP 泄露,但尚未回答在 AMAS 这类推理时行为动态涌现的系统中是否存在类似风险。为填补这一空白,作者提出了“Agent Harness Distillation (AHD)”框架,将编排框架提取(harness extraction)形式化为一个新的安全问题,并开发了量化该风险的评估框架。AHD 通过黑盒交互从目标智能体中提取推理时编排能力,分为两个阶段:预蒸馏阶段根据目标智能体的响应推断其推理时编排行为并构建初始编排;后蒸馏阶段迭代优化该编排以对齐目标智能体的行为模式。在多个真实 AMAS 系统及多个骨干 LLM 上的实验证明了 AHD 的有效性,并揭示了显著的 IP 泄露风险。为此,作者进一步提出了一种基于欺骗(deception)的防御方法,在保持受保护智能体实用性的同时,降低编排提取的有效性。该工作揭示了此前未被充分探索的 AMAS 安全威胁。适合关注 LLM 智能体安全、知识产权保护、红队评估的蓝队/SOC/安全研究员阅读。
💡 推荐理由: 该研究揭示自主多智能体系统的核心编排机制可被黑盒提取,可能造成商业模型与专有逻辑泄露;蓝队需评估自身 LLM 智能体是否面临同类 IP 盗窃风险。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)