#parameter-pruning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Torsten Krauß, Hamid Dashtbani, Alexandra Dmitrienko

大型语言模型(LLM)在翻译、代码生成等任务中表现出巨大优势,但同时引入了社会风险,恶意用户可通过有害提示(如请求非法活动指导)利用模型。为缓解此问题,模型通常内置安全机制自动拒绝此类提示。然而,现有越狱方法常需大量人工、高计算成本或导致模型过度修改而影响常规效用。本文提出TwinBreak,一种创新的安全对齐移除方法。基于安全机制类似嵌入式后门的观察,TwinBreak识别并剪除负责该功能的参数。通过聚焦最相关的模型层,TwinBreak对模型效用和安全性的关键参数进行细粒度分析。TwinBreak是首个通过分析具有高度结构和内容相似性的提示的中间输出来隔离安全参数的方法。作者构建了包含100对“双胞胎提示”的TwinPrompt数据集。实验在来自五家供应商的16个LLM上进行,成功率89%至98%,且计算需求极低。该方法揭示了现有安全对齐的脆弱性,对LLM安全研究具有重要警示意义。

💡 推荐理由: TwinBreak以极低计算成本高效移除LLM安全对齐,成功率高达89%-98%,揭示了安全机制的可分离性,对防御者设计更鲁棒的对齐策略至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)