本文提出了一种名为 HoneyRoute 的推理服务层,用于在面向对抗性的大语言模型(LLM)服务中检测恶意请求并将其路由到专用蜜罐模型,从而保护生产模型,同时持续收集攻击者交互并转化为情报。现有防御通常将陷阱嵌入模型内存或在协议层重建欺骗机制,导致服务层本身缺乏保护,且无法将捕获数据反馈给检测系统。HoneyRoute 由三部分组成:(i) 流式路由器,基于冻结的 0.8B 嵌入骨干网络和按领域划分的 MLP 头;(ii) 双实现蜜罐,包含规则/提示工程构造的代码蜜罐或同系列专用副本;(iii) 分析循环,将捕获的交互转换为攻击者指纹,用于路由器再训练。在真实生产流量轨迹和涵盖七个领域的攻击语料上评估,路由器在 38 毫秒中位新增延迟下达到 F1=.911,匹配两层 guard-LLM 级联模型 F1 的 96%,但延迟仅为后者的 1/385,并且在 13 种对抗性变换下实现 0% 逃逸;通过转移恶意请求,在真实 GCG 后缀负载并发洪泛下,生产模型 token 消耗减少 97.8%;训练副本在良性保留请求上与生产模型的协议一致率为 92.9%,而朴素的无条件诱饵注入一致率仅 7.6%,选择性伪装注入可恢复到 88.9%,描绘了可恢复的保真度-可追溯性前沿;循环训练修正头将合法安全研究的误路由降低 9 倍,同时将检测 F1 提升至 .933。该研究主要面向 LLM 服务安全、对抗性机器学习和蓝队防御研究者,核心价值在于提出服务层的主动欺骗与情报闭环思路。
💡 推荐理由: 传统防御多聚焦于模型或协议层,服务层级缺少恶意流量隔离与反哺机制。HoneyRoute 提供低延迟路由与蜜罐闭环,可实现在线检测、对抗样本缓解和攻击者画像收集,对 LLM 服务的安全架构设计具有直接参考价值。
🎯 建议动作: 研究跟进