#audio-deepfake

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Kevin Warren, Tyler Tucker, Anna Crowder, Daniel Olszewski, Allison Lu, Caroline Fedele, Magdalena Pasternak, Seth Layton, Kevin R. B. Butler, Carrie Gates, Patrick Traynor

该论文针对音频深度伪造检测这一日益严峻的安全问题,首次开展了大规模的人类识别能力评估研究。随着语音合成与声音克隆技术的快速发展,深度伪造音频已被用于电信诈骗、虚假信息传播等恶意场景,传统自动检测模型虽然取得一定进展,但人类作为最终决策者的听觉判断能力却缺乏系统性验证。研究团队设计了涵盖多种伪造方式、说话人、语言、音频时长和真实度差异的测试集,招募大量参与者进行听辨实验,比较了不同背景人群(如普通用户、技术从业者、专家等)的识别准确率、响应时间和置信度。实验结果表明,人类对高质量音频深度伪造的识别率并不理想,尤其在短音频和跨语言场景下错误率显著上升;同时,参与者的自信程度与真实表现之间存在明显偏差。论文进一步分析了人类检测与自动检测性能的互补性,指出单纯依赖人类或机器均存在局限,并提出了将人类感知特征融入自动检测系统的潜在方向。该研究为音频取证、内容审核和反欺诈领域提供了重要的实证数据和设计参考,对于评估现有防御体系的有效性以及制定人机协同检测策略具有直接价值。适合数字取证专家、反欺诈安全工程师以及语音认证系统设计者阅读。

💡 推荐理由: 该研究量化了人类对音频深度伪造的检测能力边界,弥补了以往只关注自动检测模型的空白,为设计人机协同防御、设置安全告警阈值及用户培训提供了实证依据。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Seunghyun Kim, Junghyun Kim, Jiyoung Woo

本文介绍“Go-To-Germany”团队参与ImageCLEF 2026音频深度伪造检测与生成任务的方案与结果。研究背景:深度伪造音频对身份认证、司法证据和金融安全构成现实威胁,而现有检测器对未知或对抗性生成样本的泛化能力尚待验证。该团队提出一种基于四骨干自监督学习(SSL)集成的检测系统,融合WavLM-Large、Wav2Vec2-XLS-R-300M、ECAPA-TDNN和x-vector四种预训练语音表征,通过集成投票机制进行深度伪造判别。在官方检测评测中,系统取得0.9522的总分,对参与者生成的深度伪造样本达到100%识别率,但对主办方保留的真实录音仅有0.8875准确率,暴露11.25%的假阳性差距。在生成子任务中,团队提交了一个经均匀混响处理、故意作为反取证探针的F5-TTS v1基线,最终以词错误率4.99%、字符错误率2.07%、最终得分0.4304的成绩排名第一;其背后还有包含GLM-TTS、F5-TTS、XTTS v2、CosyVoice3的四模型生成程序,用于系统研究不同生成器的可检测性。跨轨道对比揭示显著的生成-检测不对称性:检测端能识别全部参与者生成的深度伪造,但该团队在生成端提交的探针模型却成功逃避了61.4%的参与者检测器和56.2%的主办方检测器,说明当前检测体系在面对刻意反取证设计的Audio Deepfake时仍存在明显短板。为验证多骨干SSL集成的设计动机,作者完成了基于伪造检验的消融实验,包括LOSO 56说话人交叉验证、三区域骨干几何分析、bootstrap置信区间和PCA分析,结果支持“架构保险”假说:不同SSL骨干间决策模式互补,集成后对未知生成流的鲁棒性更强。论文还提供五个跨轨道见解和五个预注册的伪造实验,将生成侧逃避策略与检测侧设计决策关联起来。文章最后将11.25%的真音假阳性差距列为部署时最关键的开放挑战。适合音频取证、深度伪造检测、自监督学习和生成式模型安全方向的研究者及蓝队人员阅读。

💡 推荐理由: 音频深度伪造已用于电信诈骗、虚假证言和声纹绕过。本文证明即便顶级检测系统也会保留11.25%假阳性,且反取证音频可避开半数以上检测器,威胁语音身份识别与取证系统。多骨干SSL集成思路为防御方提供一条增强泛化的可行路径。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Daniyal Kabir Dar, Arun Ross

本文研究了音频深度伪造检测器在跨数据集时性能大幅下降的问题,提出其中一个原因是检测器对说话人身份特征的过度依赖。标准训练语料中,说话人身份与真/假标签存在相关性,导致检测器部分依赖说话人相关线索而非合成伪影。作者提出了身份敏感性得分(ISS),这是一种针对每条音频的诊断指标,量化检测器输出在不同说话人身份上下文下的变化程度。ISS无需真实标签,可基于检测器得分和参考说话人样本计算。在两个检测器和两个数据集上的实验表明,被错误分类的音频的ISS得分比正确分类的音频高29至52倍;仅使用ISS即可预测错误分类,AUC最高达0.954。通过语音转换实验进一步验证了ISS确实捕捉到身份敏感行为而非仅仅是预测置信度:被标记为身份敏感的音频对语音转换的响应强度是稳定音频的19至30倍。因此,ISS可作为音频深度伪造检测中与说话人相关的失效分析的实用推理时诊断工具。

💡 推荐理由: 音频深度伪造检测器在实际应用中常有高错误率,本研究揭示了其性能下降的一个关键内因——对说话人身份的隐性依赖,并提供了可量化的诊断指标,有助于提升检测器鲁棒性。

🎯 建议动作: 研究跟进,评估ISS在自身检测系统中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Xinfeng Li, Kai Li 0047, Yifan Zheng 0001, Chen Yan 0001, Xiaoyu Ji 0001, Wenyuan Xu 0001

本文提出了一种名为SafeEar的新型音频深度伪造检测框架,旨在解决现有检测方法因必须访问完整原始录音而泄露语音内容隐私的问题。随着文本转语音(TTS)和语音转换(VC)技术的进步,生成的逼真音频被恶意用于深度伪造,对社会和个人构成威胁。现有对策主要依赖完整音频来判断真伪,但在涉及商业秘密等敏感信息的场景中,内容暴露是不可接受的。SafeEar的核心创新在于设计了一种神经音频编解码器作为解耦模型,将音频样本中的语义信息(如语言内容)和声学信息(如韵律、音色)分离,检测器仅利用声学特征进行深度伪造识别,从而完全避免语义内容暴露。为了克服缺乏语义线索时识别各种深度伪造音频的挑战,该方法引入真实世界的编解码数据增强技术,提升检测器的泛化能力。在四个基准数据集上的广泛实验表明,SafeEar在检测多种深度伪造技术时取得了最低2.02%的等错误率(EER),同时保护了五种语言的语音内容:机器和人类听觉分析的字错误率(WER)均超过93.93%,用户研究也证实了隐私保护效果。此外,作者构建了用于反深度伪造和反内容恢复评估的基准,为未来音频隐私保护与深度伪造检测领域的研究提供了基础。本文适合对音频安全、隐私保护及深度伪造检测感兴趣的研究人员和工程师阅读。

💡 推荐理由: 音频深度伪造检测中隐私保护长期被忽视,SafeEar首次在不访问语音内容的情况下实现高精度检测,解决了敏感场景(如商业机密、法律谈话)下安全与隐私的矛盾,是音频取证领域的重要进展。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.6
Conf: 50%
👥 作者: Vojtěch Staněk, Anton Firc, Jakub Reš, Kamil Malinka

该论文针对自动说话人验证(ASV)中的欺骗检测问题,提出了一种参考增强训练(RAT)策略。作者首先设计了一种基于说话者参考录音的条件反欺骗架构,但在实验中发现该架构在推理时趋向于忽略参考信号,退化为无条件检测器。进一步分析表明,训练过程中引入参考通道会诱导模型学习到一种不变性表示,从而提高深度伪造检测的鲁棒性,即使在推理时参考缺失或失配的情况下也能提升性能。基于这一观察,作者提出了RAT方法:在训练阶段始终提供参考录音(即使与实际测试时的参考不同或为零向量),从而迫使模型利用参考信息学习更泛化的特征。在ASVspoof 5基准上的实验结果显示,单个检测器使用RAT后达到了2.57%的等错误率(EER)和0.074的最小检测代价函数(minDCF),超越了包括大型集成系统在内的现有最佳结果。论文的核心贡献在于揭示了参考信号在训练中的正则化作用,并提出了一种简单有效的训练策略,无需改变推理时的输入格式即可提升反欺骗性能。适合语音安全、生物特征识别领域的研究者和工程师阅读。

💡 推荐理由: 揭示了训练时引入参考信号可提升深度伪造检测鲁棒性的机制,提出的RAT方法简单有效,无需推理时依赖参考即可超越集成系统,对ASV反欺骗有直接应用价值。

🎯 建议动作: 研究跟进,评估RAT在自身ASV系统的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)