该论文提出了一种名为GATAS的自动语音识别(ASR)系统黑盒测试方法。研究背景是,尽管基于transformer的ASR模型在关键应用中取得了高准确率,但仍容易受到对抗性攻击,尤其是在黑盒场景下,攻击需要保持感知自然性。现有方法通常直接扰动波形,容易产生不自然的噪声。GATAS创新地利用文本到语音(TTS)模型的音素级潜在空间来生成触发错误的输入,通过在自然语音流形内插值潜在表示来诱导转录错误。该方法将攻击形式化为一个多目标优化问题,平衡语义差异和感知质量。实验评估基于多个白盒和黑盒基线,结果显示GATAS在保持较低失真和更高感知质量的同时,实现了98%的攻击成功率,人类研究也证实了其自然性。即使没有梯度信息,GATAS仍能与白盒方法竞争,表明表示对齐和感知质量比访问模型内部更关键。该工作为ASR系统的鲁棒性测试提供了高效、真实的黑盒测试用例生成方法。
💡 推荐理由: 该研究揭示了ASR系统的潜在脆弱性,提出了一种既有效又自然的新型黑盒测试方法,对语音助手、听写软件等关键应用的安全测试具有重要参考价值。
🎯 建议动作: 研究跟进