#sparse-autoencoder

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yizhe Zeng, Chenxu Niu, Wei Zhang, Hao Huang, Yunpeng Li, Dongxu Han, Dan Du, Cheng Hong, Hequn Xian, Yuling Liu

该论文针对大语言模型(LLM)后门防御碎片化的问题,首次利用稀疏自编码器(SAEs)从特征层面进行系统的机制性分析,以解释为何现有防御方法难以统一应对不同标记类型的后门攻击。后门攻击通过在训练数据中注入触发模式,使模型在特定输入下产生恶意行为,同时保持正常任务性能;防御手段通常分为针对脏标签(dirty-label)与干净标签(clean-label)攻击两类,但缺乏通用性。作者构建了干净/被投毒模型在正常/触发输入下的2×2对比矩阵,将后门引起的logit偏移追溯到高贡献的SAE特征,并将这些特征划分为四类角色:交互特征(interaction)、抑制特征(suppressed)、混合特征(mixed)和权重修改特征(weight-modified)。分析揭示了两类后门在特征编码上的系统性差异:脏标签后门主要由孤立的交互特征主导,而干净标签后门更依赖于混合特征与权重修改特征的异质组合。这一差异从机制上解释了为何现有防御在不同攻击范式下表现碎片化。为验证假设,作者提出了推理时特征钳制(inference-time feature clamping)方法,在大多数脏标签设置下将攻击成功率(ASR)降至10.8%以下,在多数干净标签设置下降至15.4%以下,同时保持良性任务性能。结果表明,基于SAE的分析不仅能解释防御碎片化的根源,还能指导可解释的后门缓解策略。该研究适合关注LLM安全、后门防御、可解释AI以及机制可解释性的研究人员与安全工程师阅读,为开发更统一、更通用的防御框架提供了新视角。

💡 推荐理由: 首次从特征机制层面解释LLM后门防御碎片化根因,用SAE统一分析脏标签/干净标签攻击,为设计可解释且通用化的后门缓解方案提供理论基础,对安全研究与防御落地有重要启发。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)