#refusal-calibration

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Wenhan Chang, Tianqing Zhu, Ping Xiong, Shiyi Liao, Wanlei Zhou

该论文提出 RISA(Response Inspection and Selective Actions),一种面向大型语言模型(LLM)的推理时拒绝行为校准框架。研究背景是:LLM 需要可靠地区分有害提示与良性提示,错误的拒绝行为要么导致有害内容被输出,要么错误地拒绝用户的有用请求。现有的训练时对齐方法需要更新模型参数,计算成本高;而推理时对齐方法(如上下文安全提示、激活引导、解码控制)大多在未检查初始响应是否已正确的情况下直接干预,可能破坏原本正确的拒绝或有用回答。针对这些问题,RISA 采取“先检查、后选择干预”的思路,在不更新底层模型的前提下,通过两步实现对拒绝错误的修正:第一步,使用固定的上下文规则为明确场景赋予拒绝分数;第二步,对规则未覆盖的场景,利用校准后的线性探针从最终层的提示隐藏状态中推导拒绝分数。为适应不同基础模型,RISA 分别校准探针分数、表示支持边界和动作阈值。运行阶段,RISA 将提示的拒绝分数与初始拒绝状态结合,通过动作策略仅在必要时进行干预。实验结果显示,RISA 能够提升拒绝可靠性,同时基本保持模型的有用性,为 LLM 中的响应感知拒绝校准提供了实用方案。该研究适合关注 LLM 安全对齐、推理时防御机制及红队评估的研究人员与安全工程师阅读。

💡 推荐理由: LLM 拒绝行为直接影响内容安全与可用性,RISA 提供了一种轻量、可适配的推理时校准方法,无需重新训练即可减少有害响应或误拒,适合集成到现有安全防护流程中。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)