本文提出了一种名为SafeEar的新型音频深度伪造检测框架,旨在解决现有检测方法因必须访问完整原始录音而泄露语音内容隐私的问题。随着文本转语音(TTS)和语音转换(VC)技术的进步,生成的逼真音频被恶意用于深度伪造,对社会和个人构成威胁。现有对策主要依赖完整音频来判断真伪,但在涉及商业秘密等敏感信息的场景中,内容暴露是不可接受的。SafeEar的核心创新在于设计了一种神经音频编解码器作为解耦模型,将音频样本中的语义信息(如语言内容)和声学信息(如韵律、音色)分离,检测器仅利用声学特征进行深度伪造识别,从而完全避免语义内容暴露。为了克服缺乏语义线索时识别各种深度伪造音频的挑战,该方法引入真实世界的编解码数据增强技术,提升检测器的泛化能力。在四个基准数据集上的广泛实验表明,SafeEar在检测多种深度伪造技术时取得了最低2.02%的等错误率(EER),同时保护了五种语言的语音内容:机器和人类听觉分析的字错误率(WER)均超过93.93%,用户研究也证实了隐私保护效果。此外,作者构建了用于反深度伪造和反内容恢复评估的基准,为未来音频隐私保护与深度伪造检测领域的研究提供了基础。本文适合对音频安全、隐私保护及深度伪造检测感兴趣的研究人员和工程师阅读。
💡 推荐理由: 音频深度伪造检测中隐私保护长期被忽视,SafeEar首次在不访问语音内容的情况下实现高精度检测,解决了敏感场景(如商业机密、法律谈话)下安全与隐私的矛盾,是音频取证领域的重要进展。
🎯 建议动作: 研究跟进