该论文针对辅助生活场景中声学传感技术面临的语音隐私问题展开研究。虽然利用环境声音监测老年人日常活动具有非侵入性、成本低等优势,但持续采集环境音频不可避免地会包含语音信息,这成为该类技术在实际部署中的关键障碍。作者提出了一种基于U-Net编码器-解码器架构的隐私防火墙流水线,其核心思想是在保留环境声音(如走动、烹饪、电视声等能反映日常活动的声音)的同时,从原始音频中移除语音成分。该模型完全在合成数据上训练,不需要真实场景的标注语音数据。活动识别部分则采用VGGish迁移学习结合SVM分类器实现。实验在ESC-50和SINS数据集上设置了多种语音混入比例,结果显示所提方法在所有测试条件下均能将残余语音降至0%(通过Silero语音活动检测验证),性能显著优于Facebook Denoiser(残余语音6.55%)、SepFormer(36.34%)和ConvTasNet(47.21%)。在ESC-50数据集40%语音比例的设置下,经过语音移除后活动分类的精确率和召回率分别恢复至85%和85%,优于未经处理的81%/75%,并接近无语音基线的84%/83%。此外,作者还使用AudioHive应用采集的真实家庭环境录音进行验证,处理后同样达到0%可检测语音,同时保持了76%的精确率和召回率。实验结果表明,该流水线能够在几乎不影响活动识别性能的前提下实现隐私保护的声学传感,有效解决了环境监测在老年护理中推广的关键障碍。本文适合从事隐私保护传感、边缘计算、智能家居健康监测以及语音处理相关领域的研究人员和工程技术人员阅读。
💡 推荐理由: 该工作为声学传感中的语音隐私问题提供了一种可落地的方案,能在去除语音的同时保留活动识别所需的环境声音,对养老监护等隐私敏感场景有直接参考价值。
🎯 建议动作: 研究跟进