#llm-alignment

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Yi Shi, Tanyu Chen, Kai Shen

该论文研究的是:在开放权重语言模型上被广泛引用的「方向消融(directional ablation)」白盒攻击,是否在从前沿稠密模型迁移到大规模混合专家(MoE)架构后依然成立。所谓方向消融,是指不需要基于梯度的训练、也不需要任何优化,仅用几百条对比提示即可拟合出一个「拒绝方向」,并把它从写入残差流的权重中投影移除,从而让模型丧失拒绝有害请求的能力。此前该攻击只在大约 70B 参数以内的稠密模型上得到验证,而前沿 MoE 模型的残差流不再是单一张量,权重还以量化形式发布,因此其可迁移性与作用位置都成了未解问题。 作者将其应用于 GLM-5.3-Flash(320B 参数、288 个路由专家、四路宽度超连接残差、block-FP8 量化)。结论分三层:第一,攻击确实在 MoE 架构上存活,但它命中位置与原始配方读者预期的位置不同。分别编辑注意力写入者、稠密写入者和路由专家写入者,可消除的拒绝比例分别为 0.039、0.016 和 0.148;三者联合编辑才达到 0.776,也就是说 74% 的效果只在联合干预下才出现。第二,按模块名匹配的传统配方只能覆盖 0.776 中的 0.066,这正是它在 MoE 上「静默失效」的原因——表面看没有报错,实际几乎没有削弱对齐。第三,效果具有方向特异性:消融一个与该方向正交的随机方向并不会改变拒绝行为;同时存在一个按类别聚集的残差,对暴力、色情和仇恨内容拟合的子空间在 1 至 12 的所有秩上都能保留可测量的拒绝能力,说明单方向编辑无法彻底抹除安全对齐。作者报告该方法在七个有害基准上实现 41 至 89 个百分点的拒绝率下降,且未检测到能力变化,并给出了攻击失效的边界条件。适合安全研究员、对齐与可解释性研究者、以及负责开放权重模型发布前评估的工程师阅读。

💡 推荐理由: 它证明只需数百条对比提示的白盒对齐消融在 320B MoE 上仍然有效,且传统按模块名匹配的修复思路会静默失效,同时揭示了安全对齐在类别层面存在难以根除的残差,直接影响开放权重模型的安全评估与发布决策。

🎯 建议动作: 研究跟进:将联合写入者消融测试纳入内部分发前对齐评估流程,并复核现有开放权重模型的权重完整性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Fengyu Gao, Jing Yang

本文提出 DPPrefSyn,一种用于生成差分隐私(DP)合成偏好数据的新算法,旨在保护大语言模型(LLM)对齐过程中的隐私。在偏好对齐的后训练阶段,使用真实人类偏好数据可能泄露敏感的用户提示和判断。DPPrefSyn 基于 Bradley-Terry 偏好模型和成对偏好数据的内在几何结构,首先从私有数据中学习具有严格差分隐私保证的潜在偏好模型,然后利用该模型与公共提示生成高质量的合成偏好数据。该方法通过利用每簇奖励模型的共享线性结构来有效捕获私有数据中的异质人类偏好,并使用差分隐私主成分分析(DP-PCA)提高学习准确性。大量实验表明,DPPrefSyn 在强 DP 保证下实现了有竞争力的对齐性能。这是首个生成 DP 合成偏好数据用于 LLM 对齐的工作,代码已开源。

💡 推荐理由: LLM 对齐依赖人类偏好数据,但隐私问题日益突出。本文第一个提出差分隐私合成偏好数据方法,为隐私保护对齐提供了可行方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)