#full-duplex

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jaechul Roh, Deepak Chandran, Amir Houmansadr, Andrea Fanelli

该论文关注全双工语音模型(full-duplex speech models)带来的一个被忽视的攻击面:这类模型在生成回复的同时仍持续接收用户语音输入,因此攻击者可以在模型「说话」期间通过用户音频通道插入额外的语音内容,从而与当前对话轮次解耦地影响模型行为。作者提出 DuplexJail 这一测试框架,其核心特点是所注入的语音提示是固定的、与具体有害请求内容无关(request-independent),即不依赖针对每个请求定制话术,而是考察「在不当时间点插入语音」这一交互结构本身能否破坏安全对齐。研究设计了两种注入时机策略进行对照:其一为固定延迟中断,即在有害请求音频播放结束后延迟一段时间插入提示;其二为拒答触发中断,即持续监测模型流式文本输出,一旦出现拒答线索(cue)便立即插入提示,属于对模型自身输出状态的自适应触发。实验覆盖四个开源全双工语音模型,并使用 AdvBench 与 HarmBench 共 720 条有害请求作为评测集,以整段回复(whole-response)为粒度统计攻击成功率。结果显示,固定延迟策略在 AdvBench 上把 PersonaPlex 的成功率推高到 40.3%、PersonaPlex-RL 推高到 48.7%,相对基线分别提升 33.8 与 39.3 个百分点;拒答触发策略在这两个模型上分别达到 35.6% 与 48.6%。值得注意的是,所有试验无论是否真的发生中断都被计入评分,保证了评估口径的一致性。此外,部分条件下 FLM-Audio 的有害回复率同样上升,而 BayLing-Duplex 则出现下降,说明不同架构对语音中断的鲁棒性差异显著。论文的主要贡献在于:首次把「语音中断」形式化为一种越狱攻击向量;给出可复现的评测方法与跨模型对比数据;并主张安全评估必须覆盖全双工交互的「进行中」状态,而非仅评估一轮一轮的静态对话。适合语音大模型研发、模型安全对齐、红队评测及多模态安全治理方向的研究者与工程师阅读。

💡 推荐理由: 当前多数语音助手安全评测仍沿用「一轮请求—一轮回复」的静态范式,而全双工模型的持续收音特性使攻击者能在生成过程中插话,且无需定制话术即可显著提升越狱成功率。这提示现有对齐与拒答机制在真实交互时序下可能失效,安全评估与上线门槛需相应调整。

🎯 建议动作: 研究跟进:将该测试范式纳入内部语音模型安全评估清单,优先对具备全双工能力的在研/在用模型做时序化回归测试

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)