该论文是一篇关于基于世界模型的具身人工智能(Embodied AI)安全性的综述。世界模型为具身智能体提供预测核心:将观测压缩为状态,模拟基于行动的未来,并支持超越反应式控制的规划。然而,这一预测层引入了新的安全边界——攻击可以从数据、传感器、提示或反馈传播至物理动作。论文并非将世界模型视为孤立组件,而是追踪其整个生命周期中的威胁,包括数据构建、表征学习、状态落地(grounding)、想象(imagination)、轨迹评估、执行,以及通过记忆和工具进行的长周期适应。作者指出,诸如投毒、后门、对抗样本、传感器欺骗、提示注入、轨迹操纵和供应链攻击等常见攻击家族,在破坏世界状态、学习到的动态模型、可供性估计或安全成本时,具有独特含义。同时,论文强调了一种二元性:世界模型可以作为运行时安全防护盾,但当其被破坏或被过度信任时,会产生预测性安全幻觉。该综述提出了生命周期分类法,将现有攻击映射到世界模型的安全属性,概述了安全失效的评估协议,并系统地组织了跨越数据来源、鲁棒落地、不确定性感知预测、轨迹门控、反馈审计和部署保障的防御策略。本文适合人工智能安全、机器人学、安全关键系统以及对抗性机器学习领域的研究人员和从业者阅读,以理解具身智能系统中世界模型带来的新型攻击面与防御思路。由于仅依据摘要,本摘要基于原文提供的有限信息,具体实验细节和结论需查阅完整论文。
💡 推荐理由: 世界模型正成为具身AI的核心组件,但引入预测层的同时也暴露了新的安全边界。本文首次从生命周期角度系统梳理其威胁与防御,为蓝队评估此类系统的风险提供了框架。
🎯 建议动作: 研究跟进