#ip-leakage

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

该论文研究基于大型语言模型(LLM)的自主多智能体系统(AMAS)在推理时框架(inference-time harness)的知识产权泄露风险。AMAS(如 Hermes)依赖推理时框架来协调推理与行动,这些框架需要大量工程投入和计算资源,在组合搜索空间中与底层LLM共同进化,因此构成宝贵的知识产权。已有工作研究了静态多智能体系统的IP泄露,但AMAS中框架行为在推理过程中动态涌现,风险尚不明确。为此,作者提出了Agent Harness Distillation (AHD)框架,专门研究AMAS中推理时框架提取带来的安全风险。AHD将框架提取形式化为新的安全问题,并开发了量化评估框架。AHD通过黑盒交互从目标智能体中提取推理时框架能力,分为两个阶段:预蒸馏阶段从目标智能体的响应中推断推理时框架行为并构建初始框架;后蒸馏阶段迭代细化初始框架以对齐目标智能体的行为模式。在多个骨干LLM上的真实AMAS实验表明,AHD能有效提取框架,揭示出显著的IP泄露风险。作者还提出了一种基于欺骗的防御方法,在保护目标智能体实用性的同时降低框架提取的有效性。该工作发现了AMAS中此前未被充分探索的安全威胁。适合AMAS设计者、LLM安全研究员及关注AI知识产权保护的从业者阅读。

💡 推荐理由: 自主多智能体系统的推理时框架是核心知识产权,本文首次系统研究其被黑盒提取的风险,为AI资产保护提供了新视角和防御思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)