#runtime-monitoring

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Moustafa Said, Aurora Naska, Kevin Morio, Robert Künnemann

该论文聚焦于一个长期存在的安全工程问题:即时通信协议的「形式化规范保证」与「实际运行实现行为」之间存在落差。Signal 协议为数以十亿计的用户提供加密通信,是 WhatsApp(全球用户量最大的消息应用)与 Signal 官方客户端的底层协议;学界已在计算模型与 Dolev-Yao 符号模型下对该协议给出大量强安全证明,但这些证明只覆盖协议规范本身,无法说明真实客户端在运行时是否严格按模型执行。作者的工作是填补这一差距:采用新近提出的运行时监控器 SpecMon,对实际观测到的执行轨迹进行一致性检查,判断其是否符合形式化协议模型。为此,作者对两个真实应用(WhatsApp Web 与 Signal Desktop)进行插桩,捕获它们与网络层及密码学组件之间的交互事件;在可信事件抽取的前提上,把运行时行为抽象为符号层,再据此构建两个与 Tamarin 兼容的多重集重写(multiset-rewrite)模型以便形式化验证。论文给出了首个 WhatsApp Web 上 Signal 协议实现的模型,以及迄今为止最详细的 Signal 原始协议模型。监控结果显示,在给定的抽取与符号抽象假设下,观测到的执行符合这些模型,并对 Signal 协议的核心组件验证了认证性与机密性属性。值得注意的是,监控还暴露出原始 libsignal 库与 WhatsApp 分支之间此前未被文档记录的行为差异。作者同时评估了方法的可复现性与实用性:完成 WhatsApp Web 建模、应用插桩、加入模糊测试并运行实验共耗时三个人周;实验表明可对真实应用进行高效监控,并能检测人为注入的安全故障,在其实测环境中开销较低。

💡 推荐理由: 它把形式化协议验证从「纸面规范」推进到「真实客户端运行时」,为 E2EE 即时通信实现提供可复用的插桩+运行时监控+Tamarin 建模流水线;同时披露 libsignal 与 WhatsApp 分支的未记录差异,值得依赖这些库自研客户端的团队复核。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
INFO
PAPER 2026-08-31

SingProbe Technical Report

推荐 5.5
Conf: 50%
👥 作者: Sing Team

大型语言模型(LLM)在生产环境中的可靠部署高度依赖运行时安全防护栏(runtime guardrails)。然而,现有防护方案大多采用独立的外部模型,不仅带来额外的推理开销,还会延迟安全信号并难以跟上基础模型能力的快速演进。为应对上述挑战,本文提出SingProbe——一种轻量级的内在运行时防护机制,它直接复用LLM在自回归解码进程中产生的隐藏状态(hidden states),在不影响原模型推理流程的前提下,随解码过程同步进行实时安全评估。SingProbe在统一框架中连续执行三类逐token预测:查询意图(query intent)、响应安全性(response safety)和幻觉风险(hallucination risk),其额外防护推理开销极小,被作者称为“免费午餐”方案。为了验证流式防护的有效性,论文还构建了SingStreamBench基准,专门考察防护拦在良性前缀上是否保持静默,同时能及时捕捉新出现的不安全内容。实验表明,SingProbe仅需约200万参数,附加开销低于0.5%,即可达到或超过体积远为庞大的独立防护模型和专业幻觉检测器的性能。除被动检测外,SingProbe生成的风险分数还可以用于预测后续生成内容的风险程度,并指导受约束的安全解码,从源头规避潜在问题。论文进一步将该范式扩展至医疗文本生成任务(SingProbe-Med),根据临床风险的出现情况有选择地触发干预措施。综合来看,这项工作表明LLM内部表示能够为生成过程的监控和控制提供一个高效且有表现力的接口,对未来构建低延迟、低成本的运行时安全体系具有重要参考价值。

💡 推荐理由: 为LLM应用提供了一种几乎零附加成本的实时防护思路,可同时检测不安全内容、幻觉与恶意意图,有望降低安全防护的部署门槛和运行开销,助推大规模安全推理落地。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Bernd Finkbeiner, Frederik Scheerer

该论文研究了在隐私敏感环境中,运行时监控系统如何保护敏感信息的问题。现代基于流的监控器会收集被观测系统运行时的详细统计数据,这些数据可能泄露隐私。差分隐私是保护敏感信息的先进方法,但将其集成到运行时监控中面临挑战:时序算子会导致单个输入值随时间影响多个输出,从而反复泄露隐私。论文提出了一种自动在基于流的监控规范中强制实施差分隐私的方法,通过分析时间依赖性并在规范中注入经过校准的噪声来实现。为了保持输出的效用,论文识别了规范中策略性的噪声注入位置,并利用基于树的机制来减轻聚合算子噪声注入带来的精度损失。通过在公共交通使用监控的案例研究,展示了该方法的实用性和有效性。

💡 推荐理由: 为隐私敏感场景下的运行时监控提供了差分隐私自动集成方案,解决了时序算子导致隐私重复泄露的问题。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nay Myat Min, Long H. Pham, Jun Sun

大型语言模型在运行时可能表现出各种异常行为,例如训练时注入的后门在触发词下被激活、越狱攻击绕过安全对齐、提示注入覆盖部署者指令。现有的运行时防御通常针对单一威胁,且依赖干净参考模型、触发知识或可编辑权重,这些假设对不透明的第三方模型往往不成立。本文提出层间收敛指纹(Layerwise Convergence Fingerprinting, LCF),一种无需调优的运行时监控方法。LCF将模型的层间隐藏状态轨迹视为健康信号:对每一层间的差异计算对角马氏距离,通过Ledoit-Wolf收缩聚合,并在200个干净样本上使用留一法校准阈值,无需参考模型、触发知识或重新训练。在四个架构(Llama-3-8B、Qwen2.5-7B、Gemma-2-9B、Qwen2.5-14B)上针对后门、越狱和提示注入三类威胁进行评估(56种后门组合、3种越狱技术、BIPIA邮件和代码问答任务),LCF将Qwen2.5-7B和Gemma-2的平均后门攻击成功率降至1%以下,Qwen2.5-14B降至1.3%;检测92-100%的DAN越狱(GCG和角色扮演为62-100%);在所有(模型、领域)的8个单元格中100%标记文本载荷注入;后门误报率12-16%,推理开销小于0.1%。单个聚合分数即可覆盖全部三类威胁,无需针对具体威胁进行调整,使LCF成为云服务和设备端LLM的通用运行时安全层。

💡 推荐理由: 提供一种无需修改模型、轻量级的运行时异常检测方法,可同时防御后门、越狱和提示注入,适合保护部署在黑盒或第三方LLM中的应用。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)