#model-fine-tuning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jing Guan, Yachao Yang, Zhaoliang Liu, Yuyao Zhang, Fanyu Meng, Junlan Feng

该论文研究的是大语言模型在恶意微调(adversarial fine-tuning)下的安全对齐脆弱性问题,以及训练期防御手段的时效机制。已有工作提出「预防性引导」(Preventative Steering):在微调阶段向模型注入代表不良人格特质的 persona 向量,并在评估阶段再将这些向量移除,从而抑制有害人格漂移。然而,这种方法为何能提供持久保护,其内在机制此前并不清楚。作者从优化动力学的时间维度切入,追踪注入信号在训练过程中的演化,发现防御效果来源于两个阶段:早期存在一个「补偿性适应」阶段,模型通过参数更新主动抵消注入的有害特质;随后进入「稳态」阶段,纠正信号逐渐衰减,保护能力随训练推进而下降。在参数空间分析中,作者定位到注意力输出投影(attention output projections)是承载防御性更新的主要残差写入路径(dominant residual-write route),说明防御并非均匀分布在整个网络,而是集中在特定子模块。为验证保护是否来自静态的权重偏移,作者设计了「干预增量保留」(IDP)与「IDP 延续」实验:在训练后保留或重新注入该权重偏移量,结果均无法维持原有保护水平。这表明预防性引导依赖的是持续的主动适应过程,而非一次性写入的静态防护。基于这一发现,作者提出渐进强度调度(Progressive Intensity Scheduling, PIS):以中等注入强度起步,在静态强度下的对齐效果开始衰减时逐步提升注入强度。在 Qwen2.5 与 Gemma-3 系列模型上的评估显示,PIS 相比固定强度的引导方法提升了安全鲁棒性,同时减少了有害特质的表达。

💡 推荐理由: 它解释了训练期防御为何会随微调步数失效,并指出防御信号集中在注意力输出投影这一可观测、可干预的路径上。对需要长期维护微调流水线的团队而言,提示「一次性对齐注入」不可靠,应改用随训练进度动态调整强度的策略。

🎯 建议动作: 研究跟进:复现其时间动力学分析方法,将 PIS 思路纳入内部微调安全评估基线。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)