#adversarial-fine-tuning

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen, Yijun Yang

该论文研究了语言模型在安全对齐过程中,拒绝有害请求与回答良性请求之间的耦合关系。现有评估通常只关注模型的最终拒绝表现,但未能揭示模型是否真正学会了识别有害性、激活拒绝策略,还是仅将两者简单耦合。为此,作者提出了一种“双安全几何”协议,通过测量有害性载体(harmfulness carriers)、拒绝载体(refusal carriers)及其耦合程度,来深入分析安全微调的内部动态。实验基于Mistral-7B-v0.1模型,对比了标准监督微调(SFT)和鲁棒对抗微调(R2D2)两种训练轨迹,并使用了多个对齐锚点进行验证。主要发现包括:(1)对齐锚点验证了协议的有效性:拒绝侧的干预比仅有害性干预更能重新打开攻击成功,且有害性与拒绝载体近乎正交;(2)在R2D2轨迹中,早期阶段呈现高耦合状态,此时模型具有强固定源鲁棒性和饱和安全提示拒绝能力,但良性效用严重下降;后期阶段耦合降低,部分恢复良性效用,但同时攻击成功率重新上升;(3)SFT也达到了低耦合状态,但其鲁棒性显著弱于R2D2,说明低耦合本身并不能保证安全性。进一步的跨锚点诊断和稀疏GCG/AutoDAN迁移实验表明,在R2D2场景下,有害性-拒绝耦合(H/R coupling)是信息量丰富的指标,而SFT的迁移更适合用漂移或行为状态度量来解释。因果扫描支持固定协议的敏感性,但未能独立建立有害性与拒绝的通路。这些结果将H/R耦合定位为对抗微调下安全几何动态的操作性诊断工具,为后续研究如何评估和提升模型鲁棒性提供了新视角。

💡 推荐理由: 揭示了对抗微调下模型安全鲁棒性变化的内部机制,帮助安全从业者评估微调后的模型是否真正学到了拒绝有害请求,而非仅暂时耦合,对LLM安全对齐评估具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kealan Dunnett, Reza Arablouei, Dimity Miller, Volkan Dedeoglu, Raja Jurdak

本文研究目标检测模型中的后门攻击防御问题。后门攻击会向深度模型中植入恶意行为,同时保持其在干净数据上的性能,对安全关键的视觉系统构成严重威胁。虽然图像分类领域的后门防御已有广泛研究,但目标检测的防御方法相对不成熟。对抗微调是分类任务中常用的后门缓解方法,但直接迁移到目标检测面临挑战:分类导向的对抗生成与检测攻击空间不匹配(攻击可能导致目标误分类或消失),且标准检测损失会在众多预测中稀释修复信号。本文提出了一种检测感知的对抗微调框架,在防御者仅能访问受损检测器和少量干净数据集、且未知攻击目标的情况下缓解目标检测后门。首先,为了在不需攻击目标知识的情况下生成对抗样本,引入了软分支最小化(soft-branch minimisation),使用软门控组合针对误分类和消失攻击的目标,并结合检测感知的分类损失最大化。其次,针对定向修复,提出了一种对目标匹配预测应用的双目标微调损失,将防御更新集中在与后门行为最相关的预测上。在基于CNN和Transformer的检测器上的实验表明,与分类导向的基线方法相比,该方法在更有效降低攻击成功率的同时保持真实检测性能,并维持了有竞争力的干净检测性能。

💡 推荐理由: 首次系统性地将对抗微调后门防御从分类扩展到目标检测,填补了该领域防御方法的空白,对提升自动驾驶、安防等安全关键视觉系统的鲁棒性具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)