#confidence-calibration

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

该论文研究视觉语言系统(VLM)在基于答案保留的攻击下置信度读数的鲁棒性。作者提出一个信息性-可操作性边界(informativeness-manipulability frontier),用于刻画攻击者在保持生成答案逐字节不变的前提下,能够操纵模型置信度输出的程度。在可到达性假设下,不可移动的置信度读数无法胜过答案字符串准确率先验(合并值为0.617)。独立于该假设,低于可测阈值的均匀幅值证书可保证对抗性判别高于同一底线。作者在四个视觉语言模型、三个视觉问答基准、五个部署置信度通道和两个防御估计器上进行了实验,发现直接或代理攻击能产生逐项可行的扰动,并在所有84个估计器-单元组合中反驳该统一证书。进一步,协调的正确性标签感知攻击将对抗性判别降至或低于答案字符串底线,在所有60个部署通道单元中均如此,包括59个初始高于该底线的单元。隐藏状态干预和开放文本模型激活空间复制表明,类似的置信度移动可在表示层面诱导,而不仅依赖对抗图像。测试的四个防御家族在各自评估下均未建立稳健替代方案。在置信度门控模拟中,协调的token概率攻击转移到隐藏状态门控后,高达84.8%的先前被拒绝的错误答案被接受;按基准自然正确率重新加权后,转移场景下12个单元中有8个、直接门控攻击下所有12个单元的接受准确率均低于无门控基线。结论是:在所研究的威胁模型和预算下,置信度是完整性敏感的监督信号,而非内在稳健的信号。该工作适合研究对抗鲁棒性、VLM安全、以及依赖置信度过滤的部署者阅读。

💡 推荐理由: 许多实际系统将置信度作为拒绝低质量答案的门控信号,该研究揭示攻击者可在不改变答案的情况下操纵置信度,导致门控失效。对依赖VLM安全过滤的蓝队而言,这意味着置信度本身不可作为可靠防线,需引入额外校验机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)