推荐 3.6
Conf: 50%
本文针对大型推理模型(LRM)暴露出的新型安全失效模式展开研究:对抗性提示能够操纵推理上下文、任务分解或能力解释,使有害目标被当作合法推理步骤处理。现有防护手段(如安全提醒、外部分类器、自检查包装器)往往脆弱,原因在于它们要么直接检查对抗性提示,要么让目标模型在与攻击利用的同一表面上执行额外的安全推理。为此,作者提出了一种与模型无关的推理时防护栏——能力路由防护(CRG),适用于防御者无法检查隐藏推理轨迹或修改模型权重的闭源LRM场景。CRG将提示防御重新定义为能力路由问题:一个侧信道控制器首先构建用户授权任务、活动上下文、安全证据和能力迁移风险的可信表示,将可执行意图与不可信的推理上下文分离。该表示支持路由特定执行,使CRG能够阻止高风险请求、约束模糊请求,并通过可信活动上下文转发低风险请求。最后,CRG应用TraceCheck验证与授权任务的一致性,并调用受限回退以保留低风险良性请求的实用性。大量实验表明,CRG有效缓解了多种以推理为中心的越狱攻击,同时保持良性实用并避免过度拒绝。进一步分析显示,其各组件贡献互补,凸显了协调防御机制对于保护大型推理模型的重要性。
💡 推荐理由: 为闭源推理模型提供了一种不依赖内部信息的新型防护思路,填补了针对推理中心越狱的防御空白,对依赖第三方大模型API的安全团队具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)