推荐 3.5
Conf: 50%
本文针对AI agent在执行时从市场或其他agent获取的技能(包含提示指令、可执行代码和工具声明)的身份标识问题。现有加密哈希(如SHA)对微小改动敏感,无法反映技能之间的相似性,不利于技能治理和注册。作者提出一种紧凑的局部敏感指纹方法:将技能的三个组件(prompt、code、tools)分别通过多库SimHash投影到固定120字节的签名,并通过汉明距离进行常数时间比较。核心创新在于保持每个组件的独立指纹(三元组),而非汇总为单一分数。这使得指纹能够:1)当某组件共享而其他组件经过改写、重命名、重构或受控代码翻译时,仍能恢复技能家族身份;2)定位哪个组件被重用;3)区分独立的多语言重实现(不恢复身份)。该方法强调“血缘关系”而非行为等价,为技能注册表提供结构化的身份轴线,与行为验证互补。在4950对比较中,指纹的AUC达到0.974(95% CI [0.956, 0.994]),且使用比特数仅为所近似嵌入的1/77。在906个技能注入基准测试中,指纹能识别被注入的技能为已知基础的篡改副本并定位变化。本文适合AI安全工程师、agent平台开发者、以及关注LLM应用供应链安全的研究人员阅读。
💡 推荐理由: AI agent技能的可信治理缺乏稳定的身份标识,本文提出的局部敏感指纹可检测技能复用与篡改,为agent供应链安全提供实用的血缘追踪手段。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)