#gui-agents

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Haoxin An, Yunpeng Song, Zihao Bai, Zhongmin Cai, Guojun Xiong, Chenhao Lin, Wentao Chen, Feng Wei, Chao Shen

本文研究GUI智能体(如移动设备上的自主操作代理)在真实部署中的对齐(alignment)鲁棒性问题。作者指出,当前主流的轻量级防御手段——提示词级对齐(prompt-level alignment)——是一种“局部现象”:它仅在狭窄的评估切片上有效,即单轮、显式表达意图的请求,而无法覆盖真实用户可能采用的多样化交互路径。为了验证这一假设,作者设计了一种配对诊断方法(paired diagnostic),在三个前沿GUI智能体(Qwen、Claude、GPT)上,通过屏幕接地(screen-grounded)的用户侧说服(user-side persuasion)场景,且不进行环境注入(no environment injection),评估防御效果。实验发现:单行护栏(one-line guardrail)能大幅降低单轮攻击成功率(ASR),最高降低约40个百分点,且几乎不产生过度拒绝(over-refusal)成本;然而,当从独立探针(independent probes)转向四轮升级链(four-turn escalation chains)时,每个模型的受保护ASR都回升了约20个百分点。相对中性基线,这种回升反映了Qwen模型的护栏显著劣化,而Claude和GPT则表现出与防御正交的动态风险。此外,显着性差距(salience gap)的符号在护栏存在时发生翻转:无护栏时,隐藏意图的请求并不比显式请求更易成功;有护栏时反而更易成功,表明防御主要依赖意图被明确命名时才起作用。因此,静态单轮ASR会系统性地高估部署环境的实际鲁棒性。该研究揭示了对齐需要在动态交互和精确威胁条件下持续有效,而非仅满足单轮拒绝。

💡 推荐理由: 揭示当前GUI智能体防御评估的盲区:单轮静态指标严重高估真实鲁棒性,长尾交互和多轮说服能系统性瓦解护栏,对移动安全和无障碍自动化场景构成实际威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)