该论文研究商用黑盒语音平台(包括云语音 API 和语音控制设备)上的对抗性攻击。现有黑盒攻击通常依赖模型返回的概率分数或置信度信息来生成对抗样本,但服务提供商可以通过不返回这些信息来防御。作者提出两种更贴近实际且条件更严格的攻击方法。针对云语音 API,提出 Occam,一种仅依赖最终决策(decision-only)的黑盒攻击。Occam 将对抗样本生成建模为不连续的大规模全局优化问题,并自适应地将其分解为多个子问题协同优化。实验表明,Occam 在 Google、Alibaba、Microsoft、Tencent、iFlytek、Jingdong 等广泛使用的语音和说话人识别 API 上达到 100% 的攻击成功率(SRoA),平均信噪比(SNR)为 14.23 dB,优于现有最优黑盒攻击。针对语音控制设备,提出 NI-Occam,这是首个非交互式物理对抗攻击,攻击者无需查询目标设备,也无需获取其内部信息或训练数据。作者首次将对抗攻击与模型反演攻击相结合,生成具有高迁移性的物理有效音频对抗样本,实现对目标设备的零交互攻击。实验显示,NI-Occam 能成功欺骗 Apple Siri、Microsoft Cortana、Google Assistant、iFlytek 和 Amazon Echo,平均 SRoA 为 52%,SNR 为 9.65 dB,揭示了对语音控制设备进行非交互式物理攻击的可行性。核心贡献在于降低了攻击所需的先验知识,扩展了对抗攻击的适用场景,同时提醒防御者仅隐藏概率分数不足以抵御攻击。适合关注语音安全、对抗机器学习、物理世界攻击的研究人员阅读。
💡 推荐理由: 该研究打破了仅依赖决策即可发起有效攻击的假设,证明商用语音平台即使不返回概率分数也面临威胁,同时首次实现非交互物理攻击,促使防御方重新评估安全措施。
🎯 建议动作: 研究跟进