本文针对大型语言模型(LLM)在网络安全领域的安全辅助边界问题展开研究。LLM 能够解决复杂问题,但在高风险领域的滥用可能造成严重后果,因此模型提供商通常会对潜在有害请求加以限制。然而,一刀切地拒绝所有网络安全请求会损害合法防御者的利益,因此需要一种机制来区分恶意使用与正当防御辅助。现有网络安全相关的安全评估数据集均未考虑请求的对话上下文,即同一请求在不同历史对话情境下可能被模型赋予不同的安全边界。为此,作者提出了 3R-Bench(Refusal, Repetition, and Revision)基准,包含 150 个真实世界的网络安全请求,并为其构建两种对抗性对话场景:一种是在请求前注入被拒绝或被接受的对话历史,另一种是将请求拆解为多轮对话。作者评估了 8 个主流 LLM,发现模型对相同请求的响应会因对话历史发生显著变化:在 400 对样本产生的 376 对可用结果中,合规率从被拒绝历史后的 62.0% 上升到被接受历史后的 85.1%;而在对话分解场景下,合规率从直接响应的 501/800 骤降至对话后的 172/800,在 738 对两种条件下均返回模型生成文本的样本中,合规率平均下降了 45.1 个百分点。此外,失败反馈只能挽回很小一部分能力损失。该研究表明,对话上下文会显著改变 LLM 的安全边界,现有安全评估忽略上下文将高估或低估模型风险。本文的主要贡献包括提出一个考虑对话上下文的安全评估基准、揭示对话历史与任务分解对合规率的重大影响,并呼吁安全评估应纳入多轮交互因素。适合 LLM 安全研究者、模型提供商的安全团队及关注 AI 对齐的从业者阅读。
💡 推荐理由: 揭示了 LLM 在网络安全辅助中安全边界的不稳定性:同一请求因对话历史或任务分解而获得截然不同的响应,导致现有安全评估失真。对蓝队而言,理解这些对话规避模式有助于设计更健壮的检测与防护策略。
🎯 建议动作: 研究跟进