本文研究了长期运行的智能体(agent)在上下文压缩(context compaction)过程中,安全护栏(safety guardrail)如何因单一周期的自我摘要(self-summarization)而失效。长期智能体通常需要周期性地压缩上下文,将原始对话记录替换为模型生成的摘要。近期研究(Governance Decay,Chen 2026)表明,在压缩过程中丢弃持续性的安全约束会导致多种模型出现行为违规。本文则聚焦于更细粒度的问题:在单一压缩周期内,一条安全规则是如何被丢失的,以及这对检测与评估有何意义。核心发现是:存在性检查(presence check)并不等同于安全性检查(safety check)。当压缩过程并未彻底丢弃一条规则时,常常会留下一个“看起来像规则但行为上不像规则”的退化残留(degraded residue)。在行为回放(behavioral replay)测试中,这种残留会导致模型执行被禁止行为的频率远高于完整焊接(intact welded)的规则;在两种回放模型下,全场景差异分别达到+34分和+57分(均为正向)。类别级(category-level)的存活表现类似于残留,甚至完整的规则有时也无法触发(fail to fire),因此仅检查文本存在的审计会产生虚假的安全感。进一步的分析表明,规则形式(rule-form)的条目比显著性匹配的事实(prominence-matched facts)被保留的频率高得多——这正是为什么基于存在性的检查会让人觉得足够,尽管“存活”并不等于“受到保护”。文本丢失的模式是依场景而定的:在单一规则下表现为“焊接或丢弃”(weld-or-drop),在更紧的预算下则表现为退化的谓词丢失(predicate-loss residues);本研究未观察到假设中的文本切断(textual severing)模式。这种丢失在运行时是静默的,只有通过与保留的外部地面真值(如约束注册表)进行比较才能发现,而这种比较只能揭示文本缺失,无法判断存活的规则是否仍能触发。本文还记录了评估陷阱:若仅依赖LLM裁判的标签,会得出相反的结论。所有实验结果均针对单个压缩周期。
💡 推荐理由: 该研究揭示了现有护栏审计方法的盲区——仅检查规则文字是否保留会给出虚假安全感,而退化残留可能在运行时静默地导致违规。对依赖上下文压缩的长期智能体安全评估具有直接指导意义。
🎯 建议动作: 研究跟进