#audio-security

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Zhuohang Li, Cong Shi 0004, Tianfang Zhang, Yi Xie 0001, Jian Liu 0001, Bo Yuan 0001, Yingying Chen 0001

本文针对智能音频系统面临的各种机器诱导音频攻击(包括重放攻击、合成攻击、隐藏语音命令、不可听攻击和音频对抗样本)提出了一种统一的检测方案。现有防御通常针对单一攻击类型,难以整合成通用方案。智能设备(如Amazon Echo、Apple HomePod)普遍配备麦克风阵列,但少有研究利用多声道音频进行通用防御。作者利用多声道音频的幅度和相位谱提取空间信息,通过深度学习模型捕捉人声与机器播放音频之间的根本差异。为提高在新声学环境下的泛化能力,采用了无监督域自适应训练框架。在公开的多声道重放攻击数据集和自收集的包含5种高级攻击的多声道音频数据集上进行了评估,结果显示该方法在检测各类机器诱导攻击时等错误率(EER)低至6.6%,即使在新环境中EER也仅为8.8%。该研究为智能音频系统提供了一种实用、可部署的统合防御框架。

💡 推荐理由: 为智能音频设备(如智能音箱、语音助手)提供了一种统一、高效的多声道防御方案,填补了现有防御针对单个攻击类型、实用性差的空白。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Meng Chen 0011, Kun Wang 0025, Li Lu 0008, Jiaheng Zhang, Tianwei Zhang 0004

本文揭示了一种针对大型音频-语言模型(LALMs)的新型安全威胁——听觉提示注入(auditory prompt injection)。与传统的文本提示注入不同,攻击者可以在连续的、高维度的音频信道中嵌入恶意指令,且这些指令在上下文无关和感知不可见的情况下操纵模型行为。作者提出了一个名为AudioHijack的通用攻击框架,通过采样梯度估计实现端到端优化,绕过不可微的音频分词器,并利用注意力监督和多上下文训练,使模型注意力聚焦于对抗性音频,同时保持对未见用户上下文的泛化能力。设计的卷积混合方法将扰动调制成自然的混响效果,极大提高了隐蔽性。在13个最新LALMs上的实验表明,该方法在6种恶意行为类别中平均成功率高达79%-96%,且音频保真度高。真实世界测试显示,Mistral AI和Microsoft Azure的商业语音代理可被诱导执行未经授权的操作。该工作系统性地揭示了LALMs在音频输入方面的安全漏洞,强调亟需针对性的防御措施。适合安全研究员、AI系统开发者及语音助手服务提供商阅读。

💡 推荐理由: 该研究首次系统性地提出并实践了针对大型音频-语言模型的听觉提示注入攻击,暴露了当前语音助手的安全盲区,对于推动多模态AI安全防御具有重要预警价值。

🎯 建议动作: 研究跟进,评估自身LALM产品对此类攻击的脆弱性,并关注后续防御方案。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)