本文研究第三方移动代理(Agent)应用中的安全漏洞,重点关注基于视觉语言模型(VLM)的自动化手机交互代理。这些代理通过截图感知设备状态并依赖VLM推理执行动作,拥有高权限决策能力。与传统移动应用相比,代理与环境的交互方式引入了新的攻击面。作者总结了代理应用与普通应用在环境交互中的关键差异,分析了代理的安全姿态,并识别出两类独特攻击面:屏幕感知攻击面(利用人类与机器视觉之间的差异)和误用通道攻击面(拦截或操纵代理执行管线)。他们设计并实现了七种具体攻击,包括隐式文本注入、不可见像素区域利用、截图篡改以及主机PC命令注入等。在五个流行的移动代理框架上的评估表明,恶意应用可以在无需任何特权权限的情况下劫持代理动作并执行任意命令,同时保持对用户视觉上的不可见。这些发现揭示了自主代理设计中的根本信任错配,并强调了在多租户平台上需要感知感知安全模型的紧迫性。
💡 推荐理由: 揭示了移动VLM代理在设计上的根本信任缺陷,攻击者无需权限即可劫持高权限代理,威胁用户隐私和设备安全。
🎯 建议动作: 研究跟进