推荐 3.5
Conf: 50%
本文提出了一种基于Wiener-Hopf线性预测的可解释音频深度伪造检测框架。针对现有黑盒模型可解释性差、计算复杂度高的问题,作者设计了一个轻量级二维卷积神经网络(CNN),将Wiener-Hopf预测系数作为输入特征,实现了分类结果与声学特性之间的直接透明关联。在基准数据集上的实验表明,该方法在保持竞争性检测性能的同时,计算复杂度显著低于现有先进方案。利用Grad-CAM进行可解释性分析发现,分类器主要关注低阶预测系数以及静音和过渡区域,提示Wiener-Hopf预测器能捕捉合成语音中的混响特征和细微统计不一致性。鲁棒性实验显示,通过微调能有效恢复在常见后处理退化(如加性噪声、MP3压缩、电话滤波)下的检测性能。该工作为音频深度伪造检测提供了可解释且高效的解决方案。
💡 推荐理由: 本文提出的可解释音频深度伪造检测框架在保持高检测性能的同时降低了计算复杂度,并通过Grad-CAM揭示模型决策依据,有助于提升对合成语音检测的信任度,适合音频取证和AI安全研究人员关注。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)