#runtime-monitor

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ruiyang Zhang

本文研究基于线性时序逻辑(LTL)和有限状态自动机(FSA)的运行时安全监控器在防御大语言模型(LLM)智能体工具调用序列时的失效原因。实际部署中,同一监控器在不同模型架构上对攻击的覆盖率差异巨大:在部分架构上可达 68-75%,而在另一些架构上几乎为零,且无法用模型能力、训练数据或提示设计解释。作者提出了一个理论框架来解释这一现象,证明任意固定不变量的 FSA 监控器的召回率受攻击分布集中度的上界约束,即被频率最高的 k 个触发-补全模式覆盖的攻击比例。当攻击集中(香农熵低)时,小的固定不变量集合可以实现高召回;当攻击分散为多个结构不同的模式(熵高)时,任何可处理规模的固定不变量集合都无法达到高召回,无论不变量如何推导。作者在八个前沿 LLM 架构上验证了这一熵-覆盖率界限:GPT 类和 DeepSeek 后端产生高度集中的攻击分布(熵约 0.24 比特,单一模式覆盖 96%),对应 68-75% 的召回;Gemini 变体则产生高熵分布(熵约 2.81 比特,7 个簇各不超过 7%),对应仅 6-13% 的召回,且与架构匹配的重新训练无关。熵解释了覆盖率中 76% 的方差(Pearson r = -0.87, p = 0.005, 95% CI [-0.98, -0.78]),留一法验证下 r 在 [-0.91, -0.82] 之间。作者还提出一种部署前熵测试,可用少量攻击样本预测监控器覆盖率,从而在部署前实现架构感知的监控器选择。该界限和测试与架构无关,适用于任何基于 FSA 的离散动作序列运行时监控器。适合研究 LLM 智能体安全、形式化验证与运行时监控的研究人员、安全架构师以及从事 AI 红蓝队工作的工程师阅读。

💡 推荐理由: 该研究揭示了 LTL 监控器在 LLM 智能体安全中的固有局限性:攻击分布熵决定监控覆盖率,高熵攻击分布下任何固定不变量集合都难以有效。这为蓝队评估运行时监控方案提供了理论依据,避免盲目依赖形式化监控器。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)