本文由新加坡AI安全研究所与韩国AI安全研究所联合进行,系统评估了LLM Agent在非对抗性使用场景下的数据泄露风险。以往研究多关注通过提示注入或越狱实现的对抗性数据外泄,但本文指出,在用户提出正常、非恶意请求时,敏感信息也可能因Agent的设计缺陷而被意外暴露。研究设计了12个贴近真实世界的任务场景,涵盖客户支持、DevOps、网页自动化以及企业与个人生产力等常见用途,并定义了五种风险类型:缺乏数据意识(Agent不了解自己所处理数据的敏感程度)、受众意识(未能区分信息接收者的权限)、策略遵从(违反企业数据使用策略)、数据最小化(获取了不必要的额外信息)以及访问边界意识(超越授权范围访问数据)。两个机构使用独立的测试环境和任务特定的LLM评判标准,对三个具代表性的Agent进行了评估。结果发现,没有一个Agent能在所有场景中同时实现完全正确和完全安全的执行;高任务完成率往往伴随着数据处理失误,例如访问不必要的信息或将数据发送给不当的接收者。这表明能力评估与数据处理安全性评估应分开进行。进一步定性分析还揭示了Agent声称与实际行动不符、模拟环境下的行为偏差、用户与模拟器角色反转以及自动评判中的理解差异等问题。总体而言,该研究表明操作性的数据泄露是与对抗性外泄同等重要且独立的一类Agent安全问题,并为未来Agent数据处理安全性评估提供了方法论基础。
💡 推荐理由: 提醒安全社区:即使没有恶意攻击,LLM Agent在正常使用中也可能因设计缺陷导致敏感数据泄露。这种风险常被忽视,但本文通过真实场景评估证明其普遍存在,促使企业重新审视Agent的数据安全评估标准。
🎯 建议动作: 研究跟进