推荐 10.5
Conf: 50%
本文指出当前自我进化的技能库(如 AutoSkills、Hermes Agent)在自动生成编排建议时仅关注效率提升,而忽略了安全性的关键缺口。作者认为,技能(Skill)描述的是代理应如何行为,而策略(Policy)决定了哪些行为被允许成为实际行动。现有的技能格式(如 Markdown 和脚本)仅覆盖了前者,后者则由模型自行推断。当技能被错误调用时,可能产生解锁房门或转账等严重后果。虽然已有研究分别记录了恶意技能危害云软件、以及越狱大语言模型控制的机器人造成物理伤害,但两者的交叉——恶意代理技能导致物理伤害——尚未被报告。作者将此类问题命名为“借用权威”(Borrowed Authority):技能格式未给接收代理提供类型化的方式拒绝代理间的权限声明,因此恶意或误用的技能可通过附加权限请求来驱动执行。为解决这一问题,作者提出边缘技能守卫(Edge Skillguard),这是一种位于技能工件内部的类型化权威层,与工作流引擎置于工具之间的方式不同,它通过世界状态和传感器证据进行守卫。在实时边缘控制平面测试台上,该守卫在五个攻击变体中拒绝了60/60的借用权威请求,且未阻塞正常请求;在5倍规模及跨主机(Tailscale mesh)环境下结论依然成立。实验结果建议,高风险技能应将类型化调用策略与程序性知识打包,使物理行动依赖于机器可校验的证据,而非对等代理的声明。
💡 推荐理由: 该研究揭示了 AI 代理安全中的新攻击面:恶意技能可利用权限继承缺陷直接驱动物理设备,导致实际物理伤害。它强调了将策略与技能分离的必要性,为边缘智能和具身智能的环境安全提供了前瞻性防御方向。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)