#audio-deepfake

共收录 2 条相关安全情报。

← 返回所有主题
推荐 9.5
Conf: 50%
👥 作者: Xinfeng Li, Kai Li 0047, Yifan Zheng 0001, Chen Yan 0001, Xiaoyu Ji 0001, Wenyuan Xu 0001

本文提出了一种名为SafeEar的新型音频深度伪造检测框架,旨在解决现有检测方法因必须访问完整原始录音而泄露语音内容隐私的问题。随着文本转语音(TTS)和语音转换(VC)技术的进步,生成的逼真音频被恶意用于深度伪造,对社会和个人构成威胁。现有对策主要依赖完整音频来判断真伪,但在涉及商业秘密等敏感信息的场景中,内容暴露是不可接受的。SafeEar的核心创新在于设计了一种神经音频编解码器作为解耦模型,将音频样本中的语义信息(如语言内容)和声学信息(如韵律、音色)分离,检测器仅利用声学特征进行深度伪造识别,从而完全避免语义内容暴露。为了克服缺乏语义线索时识别各种深度伪造音频的挑战,该方法引入真实世界的编解码数据增强技术,提升检测器的泛化能力。在四个基准数据集上的广泛实验表明,SafeEar在检测多种深度伪造技术时取得了最低2.02%的等错误率(EER),同时保护了五种语言的语音内容:机器和人类听觉分析的字错误率(WER)均超过93.93%,用户研究也证实了隐私保护效果。此外,作者构建了用于反深度伪造和反内容恢复评估的基准,为未来音频隐私保护与深度伪造检测领域的研究提供了基础。本文适合对音频安全、隐私保护及深度伪造检测感兴趣的研究人员和工程师阅读。

💡 推荐理由: 音频深度伪造检测中隐私保护长期被忽视,SafeEar首次在不访问语音内容的情况下实现高精度检测,解决了敏感场景(如商业机密、法律谈话)下安全与隐私的矛盾,是音频取证领域的重要进展。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.6
Conf: 50%
👥 作者: Vojtěch Staněk, Anton Firc, Jakub Reš, Kamil Malinka

该论文针对自动说话人验证(ASV)中的欺骗检测问题,提出了一种参考增强训练(RAT)策略。作者首先设计了一种基于说话者参考录音的条件反欺骗架构,但在实验中发现该架构在推理时趋向于忽略参考信号,退化为无条件检测器。进一步分析表明,训练过程中引入参考通道会诱导模型学习到一种不变性表示,从而提高深度伪造检测的鲁棒性,即使在推理时参考缺失或失配的情况下也能提升性能。基于这一观察,作者提出了RAT方法:在训练阶段始终提供参考录音(即使与实际测试时的参考不同或为零向量),从而迫使模型利用参考信息学习更泛化的特征。在ASVspoof 5基准上的实验结果显示,单个检测器使用RAT后达到了2.57%的等错误率(EER)和0.074的最小检测代价函数(minDCF),超越了包括大型集成系统在内的现有最佳结果。论文的核心贡献在于揭示了参考信号在训练中的正则化作用,并提出了一种简单有效的训练策略,无需改变推理时的输入格式即可提升反欺骗性能。适合语音安全、生物特征识别领域的研究者和工程师阅读。

💡 推荐理由: 揭示了训练时引入参考信号可提升深度伪造检测鲁棒性的机制,提出的RAT方法简单有效,无需推理时依赖参考即可超越集成系统,对ASV反欺骗有直接应用价值。

🎯 建议动作: 研究跟进,评估RAT在自身ASV系统的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)