该论文关注编码智能体(coding agent)过程溯源问题。现有做法多为对智能体最终产出的补丁(patch)打水印,只能为提交的产物提供来源证据,却无法验证产生该产物的可见执行轨迹(trajectory)是否被篡改;而行为水印方法通常只给出全局性的"是否检测到"或"恢复标识符"信号,因此当轨迹被局部编辑后,仍可能保留足够的归属证据,却无法指出哪一段受保护区域已变得不一致。为此作者提出 TrajMark:一种无需训练、对称密钥、且对用户可见(visible-only)的轨迹水印框架,其核心思想是将"鲁棒的归属认定"与"脆弱的局部完整性校验"解耦为两层。第一层是稀疏所有者层,通过把自然发生的部分 READ 动作改写成带密钥的线性方程,来编码一个六比特的部署标识符;第二层是定位层,插入相互链接的普通、分组与终结"封条",以对受保护的关键动作片段作出承诺。两层分离带来两个性质:归属证据可以跨轨迹稳健累积;而局部修改会扰动附近带密钥的承诺,从而暴露受影响的具体协议区域。论文还给出所有者可恢复性、完整性碰撞概率、结构开销与定位行为的设计层分析。实验覆盖三种编码智能体框架与三种大模型:在所有干净且完整含水印的批次中均能恢复出准确所有者;在穷举式合格单点攻击下检测出 95.5%~100% 的编辑;在随机单动作破坏下,能把 95.8% 的篡改位置定位到一个被接受的协议区域(而非具体到单个动作)。所有者标记不增加额外轨迹动作,完整性层增加显式的只读封条;匹配条件下 Pass@1 为 26.9%,未加水印对照为 26.3%,说明性能开销很小。
💡 推荐理由: 编码智能体轨迹正成为审计与追责的关键证据,但现有水印只保护最终产物、不认证过程。TrajMark 把"谁拥有"与"哪里被改"拆成两层,可在几乎不影响任务成功率的前提下同时支持归属认定与篡改区域定位,对智能体供应链审计、事件溯源与合规取证有直接参考价值。
🎯 建议动作: 研究跟进