该论文研究的是「潜在世界模型(Latent World Model)」在复用场景下暴露出的供应链后门风险。世界模型是一类学习式模拟器:把观测编码为潜在状态,并预测在给定动作下状态如何演化。当前社区开始像复用预训练编码器和语言模型那样,把预训练世界模型直接当作「开箱即用」的动力学骨干网络,用于下游控制任务(如 Dreamer 风格的想象式 actor 训练,或基于预测未来的 MPC/CEM 规划)。作者指出,这种复用模式引入了一条新的供应链攻击路径:攻击者只需控制一个对外发布的模型检查点,就能劫持下游控制器——而受害者全程在干净数据上训练与评估,从未见过触发器。 该攻击的关键创新在于不编码任何显式的「触发器→动作」规则。相反,被投毒的世界模型会把携带触发器的观测路由到潜在空间中某个选定区域,并重塑该区域的局部动力学,使得受害者自身的优化过程(想象式 actor 训练或规划搜索)自行「重新发现」攻击者预设的目标动作。这样后门与受害者算法解耦,不依赖特定控制器实现。 实验覆盖多个控制任务与多类触发器族。结果表明:触发器能把控制器动作导向攻击者目标,可控制全部动作维度,在最强设置下能劫持 100% 的触发步。同时该检查点仍能通过受害者在部署前常规运行的干净数据诊断,干净任务成功率至少保留约 75%。效果具有时间门控特性:仅在触发器存在时出现,触发器移除后即消失。作者还发现「触发器盲」的修复手段受预算制约:适度的干净微调能保住干净任务效用,但触发失败依然存在;只有足够激进的适配才能消除后门,代价是干净控制性能显著下降。结论是,世界模型骨干正成为一个新兴且被严重忽视的控制系统攻击面,论文代码与工件已开源。该工作适合从事具身智能、强化学习安全、AI 供应链与模型后门检测的研究者与工程师阅读。
💡 推荐理由: 预训练模型复用已成主流工程实践,而世界模型作为控制系统的动力学骨干,其检查点一旦被投毒即可在受害者未见触发器的情况下劫持下游控制器,且能通过常规干净数据验收。这提示模型供应链审计与部署前评估需要覆盖潜在动力学层,而非只看任务成功率。
🎯 建议动作: 研究跟进