#world-models

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

该论文是一篇关于基于世界模型的具身人工智能(Embodied AI)安全性的综述。世界模型为具身智能体提供预测核心:将观测压缩为状态,模拟基于行动的未来,并支持超越反应式控制的规划。然而,这一预测层引入了新的安全边界——攻击可以从数据、传感器、提示或反馈传播至物理动作。论文并非将世界模型视为孤立组件,而是追踪其整个生命周期中的威胁,包括数据构建、表征学习、状态落地(grounding)、想象(imagination)、轨迹评估、执行,以及通过记忆和工具进行的长周期适应。作者指出,诸如投毒、后门、对抗样本、传感器欺骗、提示注入、轨迹操纵和供应链攻击等常见攻击家族,在破坏世界状态、学习到的动态模型、可供性估计或安全成本时,具有独特含义。同时,论文强调了一种二元性:世界模型可以作为运行时安全防护盾,但当其被破坏或被过度信任时,会产生预测性安全幻觉。该综述提出了生命周期分类法,将现有攻击映射到世界模型的安全属性,概述了安全失效的评估协议,并系统地组织了跨越数据来源、鲁棒落地、不确定性感知预测、轨迹门控、反馈审计和部署保障的防御策略。本文适合人工智能安全、机器人学、安全关键系统以及对抗性机器学习领域的研究人员和从业者阅读,以理解具身智能系统中世界模型带来的新型攻击面与防御思路。由于仅依据摘要,本摘要基于原文提供的有限信息,具体实验细节和结论需查阅完整论文。

💡 推荐理由: 世界模型正成为具身AI的核心组件,但引入预测层的同时也暴露了新的安全边界。本文首次从生命周期角度系统梳理其威胁与防御,为蓝队评估此类系统的风险提供了框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

该论文研究了世界模型(world models)在机器人学习管道中的安全性问题。世界模型作为一种高效的数据生成和仿真工具,正被越来越多地集成到机器人训练流程中,但本文证明了世界模型引入了一种隐蔽且有效的数据投毒攻击入口。与传统的直接向训练数据注入危险轨迹的方法不同,作者提出的新型攻击向看似安全的远程操作数据中注入恶意提示或过渡动态,这些恶意数据只有在通过世界模型处理时才会激活,从而生成合成危险轨迹,最终导致训练出不安全或被篡改的机器人策略。攻击在动作条件世界模型和文本条件世界模型上均得到验证,包括对下游深度强化学习策略的端到端后门攻击,以及视觉-语言-动作(VLA)场景的概念验证。该研究突显了世界模型在机器人学习供应链中的脆弱性,并呼吁开发更安全的模型以及重新评估其集成方式。适合机器人安全、对抗性机器学习和系统安全领域的研究人员阅读。

💡 推荐理由: 世界模型作为新兴组件,此前未被充分认识其安全风险;本文揭露的新型投毒攻击隐蔽性强、后果严重,直接威胁机器人策略的可靠性与安全性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)