#multimodal-guardrail

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Haoyu Zhang, Xiao Luo, Haowen Xu, Yi Feng, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

该论文揭示了一个被忽视的评估方法论缺陷:黑盒多模态护栏(guardrail)的安全指标往往被错误地归因于护栏本身,而实际上目标模型自身的对齐机制也参与了拒绝行为。研究者指出,防御管线中两个组件都能产生拒绝(护栏和模型自身对齐),但当前评估将两者混合计数,导致护栏的实际贡献被高估或低估。关键变量有两个:载荷通过哪个通道(如文本或图像像素)传递,以及测试框架在护栏内部读取的是何种文本(攻击者实际发送的编码提示、原始未编码请求或无关文本)。通过在两个开源目标模型上对文本护栏进行实验,发现:当载荷被渲染为像素时,护栏完全不拦截,所有拒绝都来自模型自身;读取攻击者实际发送的编码提示时,护栏仅产生少数拒绝;读取攻击背后的未编码请求时,护栏几乎拦截一切,模型则几乎沉默。这种盲区并非不准确,而是恒定的决策模式。进一步实验表明,若将未编码请求作为护栏输入,会大幅虚增护栏的防护效果,且该效应在不同防御策略(护栏门控、字幕复核、多数投票)中表现不同。隔离分析显示,这种虚增并非源于检测能力提升——负责危害判断的阶段毫无贡献,而负责重新生成答案的阶段承担了全部效果。更棘手的是,参考实现从单一提示字段构建所有阶段,无法区分攻击者输入与基准记录,导致忠实部署会无意中引入该偏差。论文还修订了作者自己此前发表的部分数据。

💡 推荐理由: 安全团队若依赖黑盒护栏的评估报告,可能严重错估防护强度;该研究揭示了当前多模态安全评测的隐藏偏差,影响护栏选购、部署与红蓝对抗设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)