#decomposition-attack

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao

该论文研究了大语言模型(LLM)服务在面对分解攻击时的防御极限,特别是当攻击者使用不可关联身份时,有状态防御是否仍然有效。分解攻击将有害任务拆分为多个看似合规的请求,分别提交给目标服务,再在外部组合各次回答以完成恶意目标。大多数现有防御是无状态的,仅基于当前请求判断,因此无法识别这种跨请求的恶意模式。理论上,有状态监控器可以将所有与同一攻击任务相关的请求分组,从而阻止攻击。然而,攻击者可以利用不可关联的身份(如频繁更换会话或账户)在不同上下文下发请求,并在外部组合答案,使得服务端无法可靠地关联这些请求。论文的核心问题是:在无法可靠分组的情况下,分解攻击是否还能被阻止?作者通过理论证明,对于无重试的固定攻击策略,可达到的安全性与实用性权衡完全取决于良性请求如何被分组:如果良性请求形成持久、可识别的组,则存在有效防御;如果每次请求都像全新且无法区分的组,则任何有用操作点都会消失。当攻击者能够重试并从允许/阻止决策中学习时,防御效果进一步恶化,因为反馈只揭示哪些请求被放行,却无法告诉防御者该阻止是否正确。实验在91个可执行任务和11393个与能力匹配的良性请求上进行,在良性请求1%拒绝上限和无关背景流量0.5%上限约束下,所有十种测试策略(包括一种具有精确请求到操作映射的特权策略)要么无法阻止攻击,要么超出预算。对于防御未见过的任务族,攻击成功率在首次尝试后至少为99%,两次尝试后为100%。结论是,有效防御需要额外证据或机制来支撑分组,例如可靠的身份关联、新身份获取成本、或对答案使用的控制。该研究适合关注LLM服务安全、对抗机器学习以及可信AI基础设施的从业者阅读,它揭示了当前有状态防御的理论边界,并为未来设计更稳健的防御体系提供了方向。

💡 推荐理由: 该研究首次严格证明了在攻击者使用不可关联身份时,纯请求级别的有状态防御对分解攻击存在理论极限,对依赖状态监控的LLM安全方案提出了根本性挑战,推动安全界重新思考身份绑定与答案溯源的重要性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)