#semantic-rewriting

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Qi Wang, Chengcheng Wan, Jiangtao Wang

本文提出 SRD-GUARD,一种面向大语言模型(LLM)的免参数、黑盒防御框架,用于对抗越狱(jailbreak)攻击。越狱攻击常通过角色扮演、虚构场景或看似合理的动机隐藏有害意图,现有推理时防御要么漏掉伪装攻击,要么过度拒绝合法请求。SRD-GUARD 的核心思路是“语义重写 + 共识风险评分”:首先对输入提示词生成 5 个语义等价的改写版本,这些改写保留原始请求的底层目标,但去除上下文包装;然后由多个独立的 LLM 安全评分器对原始提示和改写版本在连续风险尺度上打分;最后决策模块结合绝对风险阈值和原始/改写之间的相对风险变化,自适应地选择拦截、放行或警告。实验基于 Llama-3-8B-Uncensored 和 DeepSeek-V4-Flash 两个模型,针对 UNIATTACK、CIPHER、DeepInception 三类攻击并采用 AdvBench 和 OR-Bench-Hard 基准进行评估。结果显示 SRD-GUARD 的平均有害检测成功率(DSR)分别为 91.44% 和 100%,而合法请求过拒率(ORR)分别为 8.00% 和 12.00%,相比基线取得了更优的 DSR-ORR 权衡。消融实验证明:重写能够暴露隐藏的有害意图;联合评分可增强对单个评分器行为的稳健性;风险自适应决策支持对模糊输入的差异性处理。这些结果表明,语义意图暴露、共识风险评估与相对风险感知路由为黑盒越狱防御提供了一种有效且可选择性强的思路。论文仅提供了 abstract,未包含详细方法推导与完整实验细节,无法验证其实现复现性,因此相关结论需谨慎看待。适合 LLM 安全研究者、红蓝队人员及模型部署方阅读。

💡 推荐理由: 论文针对 LLM 部署中的越狱攻击,提出无需微调、黑盒可用的推理时防御,核心是语义重写暴露意图与多模型共识评分,能改善误拒率,对安全运营和模型护栏设计有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)