#speech-synthesis

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.6
Conf: 50%
👥 作者: Milan Šalko, Anton Firc, Kamil Malinka, Vojtěch Staněk, Martin Perešini, Filip Pleško, Jakub Reš

语音合成技术的快速发展使深度伪造音频达到高度逼真的水平,对语音身份验证和数字取证构成日益严峻的威胁。早期研究曾报道人类对深度伪造语音的检测准确率可达70%-80%,但这些研究主要基于较老的合成器,难以反映当前生成语音的真实攻击能力。本研究针对这一差距,选取了分别于2019年(RTVC)、2022年(YourTTS)和2024年(ElevenLabs)发布的三种代表性语音合成工具,邀请82名IT专业人员参与听辨实验,同时使用六个预训练的深度伪造检测器对相同材料进行基准测试,以系统评估人类和自动检测器对现代合成语音的识别能力。实验涵盖完全合成语音(全文伪造)和部分伪造(仅篡改语句中的某一个句子)两种场景。结果显示:对于完全合成语音,人类检测的F1分数从RTVC和YourTTS的约90%急剧下降到ElevenLabs的48%,且参与者事先已被明确警告音频中可能存在深度伪造;对于部分伪造,严格判断的准确率仅为9%,听众有77%的概率将合成句子误判为真实语音。研究进一步发现,人类与自动检测器的错误模式互补,两者均无法可靠定位短篡改片段。此外,听众在识别合成语音时,越来越多地将真实语音误标记为伪造,导致对未操纵音频的信任度不断下降。这些发现表明,人类感知对于现代合成器和部分伪造条件已不可靠,必须依靠程序化验证、来源证明、水印技术和片段级检测等多层次防御手段来应对。该研究为语音伪造检测领域提供了新的实证数据,对设计和评估鲁棒的音频取证系统具有重要参考价值。

💡 推荐理由: 该研究证明最新语音合成器(如ElevenLabs)能轻松欺骗IT专业人员,人类听辨在部分伪造场景下几乎失效,直接威胁语音认证、电话业务等场景,凸显部署技术性音频验证的紧迫性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)