#skills

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Chi Zhang, Yimin Liu, Xinze Chen, Ping Ji

该论文针对当前 Agent Skills 标准下可复用性问题进行了大规模实证研究。Agent Skills 通常以 SKILL.md 文件形式存在,将指令与辅助资源结合,使大型语言模型(LLM)代理能够在单次对话之外复用流程。然而,许多公开的技能虽然以可复用组件形式分享,实际上往往源于单一任务、单一仓库或单一对话,缺乏真正的通用性。作者收集了来自 20,556 个仓库的 138,133 个公开 SKILL.md 文件,基于官方规范和最佳实践指南构建了一个两层缺陷分类体系,系统性地分析了这些技能文件的质量。研究发现,91.8% 的技能文件至少包含一个检测到的缺陷,且在宽松和严格阈值下估计结果稳定(88.8%-94.6%)。主要的失败类型是常规的打包问题而非恶意攻击:包括路由元数据薄弱、正文臃肿或不可操作、资源组织混乱等。作者进一步对 20,000 个技能执行确定性路由压力测试,结果显示具有有效路由元数据的技能从启动描述中被检索的可靠性显著高于存在路由缺陷的技能。缺陷率在不同平台和来源间存在差异:遵循规范的技能缺陷较少,而带有 AI 标记的技能在安全性和可移植性方面问题更多。最后,论文提出了轻量级强制与修复实验,验证了一种质量保证生成工作流,该工作流结合了规范感知提示、轻量级 lint 检查、自动修复和安全门控。该研究为 Agent Skills 的可复用性提供了大规模数据支撑,为技能开发者和平台设计者提供了改进方向。适合关注 LLM 代理生态、技能工程和安全质量的从业者阅读。

💡 推荐理由: 该研究首次对大规模公开 Agent Skills 进行系统性质量分析,揭示绝大多数技能存在影响复用的缺陷,为 LLM 代理生态的安全与可靠性提供了数据依据,有助于推动技能标准化和质量保障。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)