#model-safety

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith

开放权重语言模型的安全护栏可被"拒绝特征消融"(Refusal Feature Ablation, RFA) 轻易绕过:该技术通过对比估计器在模型残差流中定位出一条线性"拒绝方向",并将其投影剔除,从而在几乎不损失模型通用能力的前提下获得很高的攻击成功率 (ASR)。针对这类攻击的传统防御通常需要对每一个新的模型检查点进行安全微调,计算成本高昂、难以规模化。本文提出"诱饵方向优化"(Decoy Direction Optimization, DDO),一种快速的事后权重编辑防御,无需对基座模型做任何微调。其核心机理洞察是:消融攻击依赖对比估计器来寻找拒绝方向,因此与其试图隐藏真实的拒绝回路,不如主动向网络 MLP 神经元中注入一个高幅值、非线性的诱饵信号。当攻击者尝试定位拒绝方向时,该诱饵会污染其估计器,诱导攻击者错误地消融一个无害的正交特征,而真实的安全机制仍保持完好。作者进一步给出了刻画这一效应的形式化谱界 (spectral bound) 证明。实验方面,DDO 在六个模型家族上进行了评估,在标准 RFA 攻击下 ASR 低于 10%;在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 与经过训练的防御基线表现相当(最坏情况 ASR 65% 对 58%),并将 Heretic 权重级攻击的 ASR 从 88.7% 降至 18%,而每配置的优化成本仅为训练式基线的 1/30 至 1/450。

💡 推荐理由: 开放权重模型一旦发布,任何人都能对权重做后处理,消融类攻击成本极低,而传统防御需逐检查点微调,难以规模化。DDO 提供了一种低成本事后加固路径,对模型发布方、模型托管平台与下游部署团队有直接工程价值,也提出"防御即扰动攻击者估计器"这一新范式。

🎯 建议动作: 研究跟进,并纳入内部模型发布安全评估流程试点

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lucas Pinto

本文研究AI安全控制中的可信监控(trusted monitoring)防线。可信监控依赖一个更便宜的“可信模型”对“不可信模型”的行为进行评分,以检测潜在的破坏性行为(如后门攻击)。传统评估仅针对一个或两个不可信模型报告准确率,但本文质疑这种准确率是监控器与模型家族的配对属性。作者通过控制不可信策略家族(即模型系列)作为变量,在代码后门攻击场景下,对四个开源权重家族(涵盖四大前沿厂商)进行严格无泄漏的跨家族转移实验。结果表明,监控器在自身家族上表现优异,但跨家族时检测性能显著下降:跨家族AUROC比同家族低0.172(95% CI [0.158, 0.185]),且这一差距在控制后门明显性后依然存在。进一步分析发现,不同家族的破坏行为在特征空间中占据不同的方向,而监控器的评分方向若偏向目标家族,则能恢复大部分损失;随机旋转则无效果。在1%审计预算的“委托-信任”机制下,来自不同家族的监控器仅捕获19%的攻击尝试,而同家族监控器可捕获41%,差距高达21.7个百分点。因此,单配对评估高估了监控器实际部署时的安全性。作者提出四步协议:测量跨家族AUROC矩阵、量化交互效应、检查几何方向、报告同族与异族性能差异。本文适合关注AI安全控制评估方法论的研究人员和工程师阅读。

💡 推荐理由: 揭示了当前可信监控评估中的一个关键盲点:监控器可能过拟合于其校准时的模型家族,导致跨家族部署时安全性被高估。对依赖单一模型对评估的安全架构构成挑战,需引入跨家族验证。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)