#human-agent-interaction

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Heng Li, Fulin Zhao, Zhe Geng, Zhiyuan Yao, Wei Yuan, Xiapu Luo

该论文研究移动端智能体(mobile agent)安全中的一个基础性前提是否成立:用户与智能体在同一界面状态下是否看到一致的信息。作者指出,人类用户通过物理显示屏与视觉系统感知移动界面,其观察受遮挡与亮度对比度限制;而智能体消费的是数字截图与无障碍(accessibility)节点元数据,这些表征可能保留人眼无法察觉或被遮挡的内容,并暴露非视觉的控件元数据。由此,同一个 UI 状态可能对用户与智能体呈现实质不同的信息,作者将这种错位命名为“人—智能体 UI 失同步”(human-agent UI desynchronization)。 论文的核心问题是:一个对合法 APK 进行重打包得到的克隆应用,能否在不影响人对原应用使用体验、且行为与原始应用保持一致的前提下,利用这种失同步把智能体引导到攻击者指定的动作上。作者验证了该威胁的可行性:仅需在部署前嵌入扰动,无需运行时获取用户指令、无需探测智能体、也无需在线自适应,即可诱发智能体行为偏离。 为系统性地暴露和评估该威胁,作者构建了一个自动化框架,能够生成与用户运行时指令无关的 UI 失同步攻击,并将其落到可实际部署的 APK 中。评估覆盖 5 个移动智能体框架与 3 个主干模型,在涉及多类应用的 546 个任务上分别取得平均 77.9% 与 66.9% 的误导率。补充的用户问卷研究(186 名参与者)显示,所用视觉扰动难以被人类用户察觉。论文贡献在于:首次系统化定义并验证人—智能体 UI 失同步这一威胁类别,给出可复现的自动化构造与评估方法,并用跨框架、跨模型的量化结果与用户感知数据说明该风险在真实移动智能体部署中的普遍性与隐蔽性。适合移动安全、智能体安全、人机交互安全方向的研究者与蓝队工程师阅读。

💡 推荐理由: 移动智能体正被赋予代替用户执行敏感操作的能力,而其安全审查长期默认“人与智能体看到同一个界面”。该工作证明这一前提可被系统性打破,且攻击只需在发布前植入、部署后无需任何在线适配即可生效,跨 5 个框架、3 个模型均能显著误导智能体,同时人眼难以察觉,属于智能体安全信任模型层面的结构性风险。

🎯 建议动作: 纳入内部评估:将 UI 失同步列为移动智能体信任模型的核心风险项,验证自研或采购的智能体框架是否具备多源观测一致性校验能力,并规划二次确认与完整性校验的落地路线

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)