本文提出了一种名为 Language Model Security Modules (LMSM) 的安全框架,受 Linux 安全模块 (LSM) 的架构启发,旨在解决大型语言模型 (LLM) 部署中分层防御仍可能被恶意提示绕过的问题。研究者指出,现有可解释性方法能够暴露模型生成路径上的内部信号,但这些信号本身并非安全控制;若将其用于安全防护,通常需要为每个信号单独编写校准、策略逻辑和干预代码,导致集成成本高且无法形成统一防御。LMSM 将 LSM 的职责分离思想引入 LLM 服务流程:选定的安全后端提供校准证据,带版本化的策略引擎基于可信的每请求上下文评估活动规则,独立的门控模块则授权缓冲输出的释放。这一设计将仲裁正确性与策略有效性解耦,允许在不重建请求处理或强制逻辑的情况下更换后端、规则或调度策略。原型实现基于 Hugging Face Transformers 和连续批处理 vLLM,验证了同一基础设施可承载基于稀疏自编码器 (SAE)、transcoder 以及任务适配密集探针的多种部署,并在调度器扰动下保持请求级决策的一致性,同时支持每条请求选择性执行和组合多条规则。在 Qwen3-4B 模型上,LMSM-Checkpoint 将 HarmBench 攻击成功率从 39.20% 降至 3.32%,XSTest 误拒率从 2.40% 上升至 4.40%,且在 32 个活动序列下保留了无监控服务路径 98.14% 的吞吐量。该框架为可解释性和模型内部分析的进展提供了通往运行时强制执行的统一路径。
💡 推荐理由: 为 LLM 运行时安全提供了一种可扩展的模块化框架,能统一多种安全信号并降低集成成本,同时保持高吞吐,对实际部署防线建设有直接参考价值。
🎯 建议动作: 研究跟进