#undetectable

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Andrej Bogdanov, Alon Rosen, Neekon Vafa

本文研究深度神经网络中后门植入的统计不可检测性。作者展示了一种对抗性模型训练者可以在大规模前馈神经网络中植入后门的方法,这些后门在白盒设置下是统计不可检测的,即后门模型与诚实训练模型之间的总变差距离很小,即使审查者拥有模型的完整描述(如所有权重)。后门提供了对每个输入的不变性对抗样本,能将相距很远的输入映射到异常接近的输出。然而,在没有后门的情况下,在标准密码学假设下,任何多项式时间内生成此类对抗样本都是不可能的。理论分析和初步实证结果表明,模型训练者与模型使用者之间存在根本性的能力不对称性。该工作揭示了恶意训练者可以植入理论上不可检测的后门,对模型供应链安全构成潜在威胁。适合安全研究者、机器学习工程师以及关注模型完整性的从业者阅读。

💡 推荐理由: 该研究揭示了深度神经网络后门攻击的一种新范式:后门在白盒环境下统计不可检测,颠覆了传统认知。安全从业者需关注模型训练环节的信任根问题。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)