本文针对智能音频系统面临的各种机器诱导音频攻击(包括重放攻击、合成攻击、隐藏语音命令、不可听攻击和音频对抗样本)提出了一种统一的检测方案。现有防御通常针对单一攻击类型,难以整合成通用方案。智能设备(如Amazon Echo、Apple HomePod)普遍配备麦克风阵列,但少有研究利用多声道音频进行通用防御。作者利用多声道音频的幅度和相位谱提取空间信息,通过深度学习模型捕捉人声与机器播放音频之间的根本差异。为提高在新声学环境下的泛化能力,采用了无监督域自适应训练框架。在公开的多声道重放攻击数据集和自收集的包含5种高级攻击的多声道音频数据集上进行了评估,结果显示该方法在检测各类机器诱导攻击时等错误率(EER)低至6.6%,即使在新环境中EER也仅为8.8%。该研究为智能音频系统提供了一种实用、可部署的统合防御框架。
💡 推荐理由: 为智能音频设备(如智能音箱、语音助手)提供了一种统一、高效的多声道防御方案,填补了现有防御针对单个攻击类型、实用性差的空白。
🎯 建议动作: 研究跟进