推荐 5.6
Conf: 50%
本文研究了大语言模型(LLM)在批量提示(batch prompting)场景下的安全性问题。批量提示是一种实用的推理策略,通过将多个问题打包在一次请求中交给模型处理,以提升效率和吞吐量。然而,作者发现批量提示在实用性上的成功并未延伸到安全性:一个单独提出时会被模型可靠拒绝的有害问题,当被嵌入到一批良性问题中时,可能诱使模型生成有害回答。作者将此识别为一种独立的安全失效模式,并证明它无法归结为已有的上下文学习或长上下文效应等已知漏洞。论文从两个互补视角分析了失效成因:一是对齐信号减弱(alignment signal weakening),即批量中良性样本稀释了模型对有害内容的注意力;二是拒绝信号稀释(refusal signal dilution),即模型对单个有害问题的拒绝倾向在批量中被多个良性请求覆盖。实验覆盖了广泛使用的开源模型和前沿商业模型,结果表明批量提示作为一种简单的黑盒攻击,能够稳定地实现较高的攻击成功率。进一步,作者提出了一种批量感知的偏好优化(batch-aware preference optimization)方法,并证明该方法能有效缓解该脆弱性。这些发现揭示了当前安全对齐中的一个盲区,并指出批量感知的对齐是实现稳健部署的必要步骤。本文适合关注LLM安全对齐、红队测试以及大模型鲁棒性部署的研究人员和工程师阅读。
💡 推荐理由: 批量提示在真实LLM服务中广泛使用,现有安全对齐未覆盖该场景,导致攻击者可用简单黑盒方式绕过拒绝机制。此漏洞影响主流开源与商业模型,需引起蓝队与安全评估人员重视。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)