#audio-injection

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

本文研究多模态大语言模型智能体在连续音频交互场景下面临的新型安全威胁——并发音频提示注入攻击。随着以LLM驱动的多模态智能体通过语音与用户进行自然交互并自主执行任务,音频输入中不可避免地包含环境噪声,这为攻击者提供了可乘之机。与针对语音设备的传统声学攻击不同,作者提出了指令增强和场景隐藏两种新技术,使恶意音频指令能够不可感知地“搭便车”在用户语音之上,从而劫持智能体执行恶意操作。为系统量化该威胁,作者构建了首个音频指令注入攻击基准AudioAgentSecurity,涵盖8个真实任务场景和10种不同攻击模式,并评估了包括Gemini 3 Pro和GPT-4o-audio在内的11个先进智能体。实验表明,所提方法对Gemini 3 Pro的平均攻击成功率(ASR)达到69.10%。为防御此类攻击,作者进一步提出级联音频解耦与验证(CADV)机制,基于源分离和一致性分析,与现有提示级防御相比,检测准确率最高可达96%,能有效防御多种声学注入攻击。最后,在豆包AI智能手机上结合人类志愿者的真实世界实验,在多样动态场景中验证了攻击的高隐蔽性和有效性,同时证明CADV防御能够可靠缓解这些漏洞。该研究揭示了多模态音频交互中未被充分探索的攻击面,并为后续防御研究提供了基准和方法。

💡 推荐理由: 该研究揭示多模态LLM智能体的音频输入通道存在可被利用的注入攻击面,影响范围覆盖主流商用模型,为蓝队理解和防御此类新型音频提示注入提供了首个系统化基准和有效防御方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)