#imageclef

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Seunghyun Kim, Junghyun Kim, Jiyoung Woo

本文介绍“Go-To-Germany”团队参与ImageCLEF 2026音频深度伪造检测与生成任务的方案与结果。研究背景:深度伪造音频对身份认证、司法证据和金融安全构成现实威胁,而现有检测器对未知或对抗性生成样本的泛化能力尚待验证。该团队提出一种基于四骨干自监督学习(SSL)集成的检测系统,融合WavLM-Large、Wav2Vec2-XLS-R-300M、ECAPA-TDNN和x-vector四种预训练语音表征,通过集成投票机制进行深度伪造判别。在官方检测评测中,系统取得0.9522的总分,对参与者生成的深度伪造样本达到100%识别率,但对主办方保留的真实录音仅有0.8875准确率,暴露11.25%的假阳性差距。在生成子任务中,团队提交了一个经均匀混响处理、故意作为反取证探针的F5-TTS v1基线,最终以词错误率4.99%、字符错误率2.07%、最终得分0.4304的成绩排名第一;其背后还有包含GLM-TTS、F5-TTS、XTTS v2、CosyVoice3的四模型生成程序,用于系统研究不同生成器的可检测性。跨轨道对比揭示显著的生成-检测不对称性:检测端能识别全部参与者生成的深度伪造,但该团队在生成端提交的探针模型却成功逃避了61.4%的参与者检测器和56.2%的主办方检测器,说明当前检测体系在面对刻意反取证设计的Audio Deepfake时仍存在明显短板。为验证多骨干SSL集成的设计动机,作者完成了基于伪造检验的消融实验,包括LOSO 56说话人交叉验证、三区域骨干几何分析、bootstrap置信区间和PCA分析,结果支持“架构保险”假说:不同SSL骨干间决策模式互补,集成后对未知生成流的鲁棒性更强。论文还提供五个跨轨道见解和五个预注册的伪造实验,将生成侧逃避策略与检测侧设计决策关联起来。文章最后将11.25%的真音假阳性差距列为部署时最关键的开放挑战。适合音频取证、深度伪造检测、自监督学习和生成式模型安全方向的研究者及蓝队人员阅读。

💡 推荐理由: 音频深度伪造已用于电信诈骗、虚假证言和声纹绕过。本文证明即便顶级检测系统也会保留11.25%假阳性,且反取证音频可避开半数以上检测器,威胁语音身份识别与取证系统。多骨干SSL集成思路为防御方提供一条增强泛化的可行路径。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)