推荐 5.5
Conf: 50%
该论文研究了个性化大语言模型(LLM)智能体的隐私泄露风险。随着LLM智能体将用户记忆转化为压缩或结构化表示(称为用户模型)以指导后续决策,尽管源文本在普通接口可达的状态中被移除,此类模型仍被视为具有更好的隐私保护性,因为直接的内存提取攻击无法获取原始文本。然而,作者指出用户模型暴露了新的攻击面:攻击者仍能从被其影响的个性化行为中恢复私有信息,即使源记录和后端状态不可访问。为此,论文提出UMPeek,一种基于假设引导的自适应探测黑盒攻击方法。UMPeek通过请求中留下的开放选择形成假设,在多个普通后续任务之间切换,并仅保留被可见行为支持且未被反驳的声明。作者在多种个性化任务和用户模型后端上进行了广泛的基准评估,并在真实系统中使用已确认保留的信息进行验证,同时评估了防御措施对自适应探测的抵抗能力。实验结果表明,UMPeek在基准测试和真实世界比较中均优于现有攻击,并能在响应级防御下继续恢复用户信息,证明当保留信息影响可见行为时,仅使记录和后端状态不可访问并不能保证语义隐私。
💡 推荐理由: 该研究揭示了个性化LLM智能体在无直接访问内部状态时仍可通过行为侧信道泄露隐私,为蓝队评估此类系统的隐私风险提供了新的攻击面认识。
🎯 建议动作: 研究跟进,评估内部个性化LLM系统对UMPeek类攻击的脆弱性,并研究行为级防御。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)