#audio

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Xinfeng Li, Chen Yan 0001, Xuancun Lu, Zihan Zeng, Xiaoyu Ji 0001, Wenyuan Xu 0001

自动语音识别(ASR)系统已广泛应用于智能助手、语音控制、电话客服、会议转写等场景,其安全性直接关系到用户隐私和设备控制权。已有研究表明,ASR系统容易受到对抗样本(Adversarial Examples, AEs)的攻击,通过引入精心设计的微小扰动,可以诱导识别系统输出攻击者指定的错误文本。然而,许多既有对抗样本在物理世界中可能具有可听性,容易被用户察觉,从而降低攻击的隐蔽性和实用性。针对这一局限,本论文(标题为“Inaudible Adversarial Perturbation: Manipulating the Recognition of User Speech in Real Time”)提出了一种不可听的对抗扰动方法,目标是在实时场景下操纵用户语音的识别结果。该扰动的核心特点是人类听觉上难以察觉,但能够被ASR系统感知并导致误识别。论文可能利用人耳听觉系统的掩蔽效应或超声波等机制来生成此类不可听扰动,但具体的生成算法和架构细节在摘要中未明确给出。研究的主要贡献在于揭示了一种更为隐蔽的ASR攻击途径,使攻击者可以在用户无感的情况下控制语音识别结果,从而对智能设备或语音交互系统构成切实威胁。本篇摘要仅包含一句关于ASR系统易受对抗样本攻击的陈述,未提供实验数据、技术细节或评估结果,因此所有内容仅基于标题和该抽象句进行合理归纳。该研究适合语音安全研究者、ASR系统开发者以及关注对抗机器学习的安全从业者阅读,有助于理解下一代语音攻击的潜在形态。

💡 推荐理由: 语音助手和声控设备日益普及,如果攻击者能在用户无感知的情况下篡改语音识别结果,可能导致设备执行恶意指令、泄露隐私或造成安全事件。防御者需提前了解此类不可听攻击的存在,并评估自身系统的抗性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Peng Cheng 0007, Yuwei Wang 0009, Peng Huang, Zhongjie Ba, Xiaodong Lin 0001, Feng Lin 0004, Li Lu 0008, Kui Ren 0001

该论文聚焦于语音可控智能设备面临的对抗样本(AE)威胁。已有黑盒对抗攻击仅需目标ASR系统最终转录结果,但通常需要大量查询,成本高昂,且对抗样本易受ASR模型更新影响。作者指出根本原因在于无法直接在深度学习模型决策边界附近构造对抗样本。基于此,提出ALIF,首个基于语言学特征的黑盒对抗攻击管道。ALIF利用文本-语音(TTS)和ASR模型的互逆过程,在决策边界所在的语言学嵌入空间中生成扰动。基于ALIF管道,进一步提出ALIF-OTL和ALIF-OTA两种方案,分别针对数字域和物理播放环境,在四个商业ASR和语音助手上进行攻击。大量评估表明,ALIF-OTL和ALIF-OTA的查询效率分别比现有方法提升97.7%和73.3%,且攻击性能相当。尤为突出的是,ALIF-OTL仅需一次查询即可生成攻击样本。时间鲁棒性实验验证了该方法对ASR模型更新的抵抗能力。该研究揭示了低成本、高效的黑盒音频对抗攻击途径,对语音平台安全性构成新挑战。

💡 推荐理由: 本文展示了极低成本的黑盒音频对抗攻击,仅需一次查询即可生成有效样本,且对ASR更新鲁棒,提醒防御者此类攻击可能对语音助手和ASR服务造成严重威胁,需关注语言学层面的防御。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Vojtěch Staněk, Eva Trnovská, Kamil Malinka, Anton Firc

该论文对39个深度伪造语音数据集进行了系统性的数据集级审计,分析了可访问性、文档质量、人口统计与语言覆盖范围、数据集规模以及底层真实语音来源等关键属性。研究发现两个重要问题:首先,绝大多数数据集缺乏人口统计元数据(如年龄、种族、国籍等),仅有少数包含性别或语言标签,导致无法进行有意义的子组分析,公平性评估几乎不可行;其次,不同数据集之间底层真实语音语料库存在大量重叠,这种重叠会损害跨数据集评估的有效性,并可能导致泛化性能被夸大。研究揭示了当前深度伪造语音检测领域的系统性数据缺陷,强调了构建更透明、更平衡、更高质量数据集的重要性,并为未来研究方向提供了指导。适合语音安全、AI安全及公平性研究者阅读。

💡 推荐理由: 深度伪造语音检测系统的可信度高度依赖数据集质量,该审计揭示了当前数据集的严重缺陷——缺乏人口统计信息导致公平性无法评估,语料库重叠导致泛化性能虚高。安全从业者部署此类检测系统时需警惕潜在的偏见与过拟合风险。

🎯 建议动作: 阅读论文,关注后续改进数据集的方法论

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

本文提出了一种针对大型音频语言模型(LALMs)的新型越狱攻击范式,称为声学干扰攻击(AIA)。传统方法通常将音频作为恶意负载的载体,通过语义优化、声学参数控制或添加扰动来嵌入有害内容。而本文作者发现,LALM的安全对齐可以被特定的声学潜在语义(ALS)所破坏,这些ALS是音频生成模型先验中固有的副语言特征,而与音频的内容无关。AIA利用一组通用的、指令无关的干扰音频,这些音频内容良性但注入了特定的ALS,作为通用越狱触发器,使标准恶意文本查询能够绕过安全对齐,无需针对具体实例进行优化。实验在10个LALM和5个数据集上进行,AIA达到了最先进的攻击成功率。可解释性分析揭示了AIA导致的推理路径偏移,并识别了ALS中的固有有效模式,揭示了LALM跨模态对齐的根本脆弱性。该研究适合AI安全研究人员、LALM开发者及安全防御者阅读。

💡 推荐理由: 该研究揭示了一种利用音频内在的副语言特征(而非内容)绕过LALM安全对齐的全新攻击面,对多模态AI安全构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)