#speaker-identity

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Daniyal Kabir Dar, Arun Ross

本文研究了音频深度伪造检测器在跨数据集时性能大幅下降的问题,提出其中一个原因是检测器对说话人身份特征的过度依赖。标准训练语料中,说话人身份与真/假标签存在相关性,导致检测器部分依赖说话人相关线索而非合成伪影。作者提出了身份敏感性得分(ISS),这是一种针对每条音频的诊断指标,量化检测器输出在不同说话人身份上下文下的变化程度。ISS无需真实标签,可基于检测器得分和参考说话人样本计算。在两个检测器和两个数据集上的实验表明,被错误分类的音频的ISS得分比正确分类的音频高29至52倍;仅使用ISS即可预测错误分类,AUC最高达0.954。通过语音转换实验进一步验证了ISS确实捕捉到身份敏感行为而非仅仅是预测置信度:被标记为身份敏感的音频对语音转换的响应强度是稳定音频的19至30倍。因此,ISS可作为音频深度伪造检测中与说话人相关的失效分析的实用推理时诊断工具。

💡 推荐理由: 音频深度伪造检测器在实际应用中常有高错误率,本研究揭示了其性能下降的一个关键内因——对说话人身份的隐性依赖,并提供了可量化的诊断指标,有助于提升检测器鲁棒性。

🎯 建议动作: 研究跟进,评估ISS在自身检测系统中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)