#defensive-deception

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Mark Russinovich

该论文提出一种针对开放权重语言模型安全对齐可被轻易移除问题的防御性欺骗方法。作者指出,通过“abliteration”技术,攻击者可以在几分钟内从模型权重中投影出拒绝中介方向,从而移除安全对齐,且目前没有发布时防御能持久阻止。论文的核心思想是“无法阻止则欺骗”,提出“诱饵加固”(Fool's Gold)防御:承认拒绝层可被剥离,但毒化其收益——一旦拒绝被移除,模型对大多数危险操作请求会给出自信、流畅但关键元素被伪造的诱饵答案。诱饵在攻击的可微模拟中训练,仅在受攻击状态下表达;同时使用“拒绝针”和“良性约束”保持未受攻击状态的行为与原始模型一致。研究在五个模型家族的七个模型上(9B-122B,密集与混合专家架构)进行实例化。在通过预注册有效性门控的六个模型上,受攻击状态下对新提示的响应中0.51-0.90为诱饵,其中0.27-0.84归因于防御;所有六个模型保持在注册的良性行为和能力预算内;第七个较小模型未通过门控(边界情况)。在冻结测试集或未触碰分层上结果可复现。论文的关键主张是认识论层面的:在没有独立真值的情况下,论文测试的观察表面无法区分伪造答案与正确答案——在外部红队基准的CBRNE相关切片上,防御后的122B模型在匹配质量答案上的致命错误率为0.82-0.86,而未防御模型至多0.10。重复采样无法恢复信任:在K=64时,逐元素共识在0.083-0.625的提示上重建了完全可用的程序(而未防御为0.58-0.96),且没有无标签方法能区分这些情况;在最弱的模型上,该主张仅基于每次生成。论文评估了化学和生物危害;防御不解决上下文内越狱,且仅保护初始发布的防御权重。该研究适合关注大型语言模型安全防御、红队测试和模型鲁棒性的安全研究者阅读。

💡 推荐理由: 该研究针对开放权重模型安全对齐容易被移除的痛点,提出一种新颖的防御思路,通过诱饵信息降低攻击者的利用收益,为LLM防御提供了可借鉴的欺骗式对抗方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)