#physiological-signals

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Othmane Harraq, Tamer Aldwairi

本文针对说话人脸(Talking-Face, TF)深度伪造检测问题,提出了一种基于生理信号(远程光电容积描记术, rPPG)的取证方法。TF深度伪造技术利用静态源图像和音频信号合成逼真的面部视频,而现有基于图像特征的检测器几乎完全失效。与换脸(face-swap)伪造不同,TF合成没有对应的真实视频,因此无法继承生理特征,这使得rPPG成为该伪造类型独有的检测模态。作者构建了一个检测框架:首先使用RhythmFormer网络从每个视频中提取rPPG波形,然后训练一组轻量级分类器(如1D ResNet)来区分真实与合成的生理信号。在Celeb-DF++数据集的TF子集上,采用严格的与身份无关的评估协议(测试集身份与训练集完全分离),该框架的最佳模型(1D ResNet)取得了AUC 0.806、等错误率27.8%的性能,仅比当前最好的通用检测器Effort(ICML 2025)低2.4个百分点,且完全基于生理通道。此外,作者对代表性先前rPPG检测器DeepFakesON-Phys进行了受控复现研究,发现其在传统换脸数据上AUC高达0.999,但在TF子集上退化至0.622。进一步实验表明,检测难度与生成器高度相关:在7种TF生成器中,AUC范围从0.985(Real3DPortrait)到0.690(IP-LAP),且该排序在所有评估协议下保持稳定。该结果反映了每个生成器可解释的生理属性,而非评估噪声,构成了本文的主要理论贡献。

💡 推荐理由: 说话人脸深度伪造检测是当前安全盲区,该方法利用不可伪造的生理信号提供新检测维度,对视频取证和虚假信息防御具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)