#persona-attack

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

本文首次揭示了大语言模型(LLM)中由角色一致性(persona consistency)引发的推理成本攻击漏洞。随着LLM在实际应用中的广泛部署,其推理效率和服务可靠性成为关键问题,而自回归生成机制使得恶意提示可以操纵生成行为,诱导模型产生过量token,从而放大计算消耗并威胁服务效率。现有攻击方法主要依赖对抗性后缀或显式的扩展指令,这些方法具有可检测的行为模式,限制了其实际适用性。本文发现,LLM在维持被分配角色时会保持角色一致性,即使这种一致性导致低效推理和过度生成,模型也会忠实执行。基于这一观察,作者提出了RolePlay框架,一种任务感知的动态角色对齐框架,通过构造自适应角色自然诱导低效但语义连贯的生成行为,实现推理成本放大。在多个LLM和多种任务数据集上的大量实验表明,RolePlay显著优于现有推理扩展方法,平均token放大倍数达到7.64倍,最大token放大倍数达到207.64倍。该研究将角色条件化(persona conditioning)识别为LLM推理效率的新攻击面,为计算成本放大提供了新视角。本文适合关注LLM安全、模型鲁棒性以及AI基础设施成本优化的研究人员和安全从业者阅读。

💡 推荐理由: 该攻击无需对抗性后缀,仅通过看似无害的角色设定即可让LLM产生大量无关token,造成服务成本激增,影响依赖LLM的在线服务可用性,值得安全团队关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)