#trigger-shift

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuan Su, Tianyu Du, Yuwen Pu, Jianhai Chen, Jinbao Li, Shouling Ji

该论文提出了一种名为 Lilith 的黑盒后门攻击框架,首次系统研究“训练-推理触发器移位”下的后门泛化问题。现有后门攻击研究大多假设训练时使用的触发器与推理时完全一致,或仅考虑训练中已暴露的触发器变体、沿预定变换轴的扰动,而忽略了训练时学习的后门能否泛化到训练阶段完全未见过的一类推理触发器。Lilith 仅利用与受害者数据不相交的替代资源,先通过单个训练锚点诱导出一个紧凑的目标侧脆弱性,再构造一个有界的、仅推理阶段的触发器族,该触发器族能保持锚点诱导的表示几何结构。作者用锚点间隙和族到达范围刻画该机制,并推导出在局部正则性和有界替代-受害者差异下实现族级目标保持的充分条件。实验覆盖多种数据集、架构、投毒比例和防御方法,表明 Lilith 能以较低的效用损失和较小的触发器泛化差距实现高族级攻击成功率。进一步分析显示,族的激活取决于表示对齐而非触发器提议机制,这揭示出仅评估精确触发器匹配的传统后门评估所忽视的更广泛威胁。论文属于机器学习安全研究,适合后门攻击防御研究者、模型鲁棒性评估工程师及使用第三方训练服务的平台安全团队阅读。

💡 推荐理由: 揭示了后门攻击评估中的一个盲区:训练触发器与推理触发器族不匹配时后门仍可泛化,意味着防御者不能仅依赖精确触发器匹配检测,需关注表示层面的后门效应。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)