推荐 5.5
Conf: 50%
本文研究自主编码代理(coding agents)在企业软件工作流中集成时引入的新型安全风险:代理技能(agent skills)接口。该接口以文件夹形式包含指令与脚本,代理动态加载以专用化自身行为,但也扩大了攻击面,使恶意shell命令可隐藏在自然语言技能文件中。作者提出三项贡献:第一,提出一种对抗性技能合成方法,利用跨四个系列的六个LLM将471条真实shell命令转化为看似良性的技能,形成包含2826个技能、映射到11个MITRE ATT&CK战术的基准数据集;第二,构建可复现的评估流水线,结合运行分层、证据锚定、拒绝否决和确定性声明意图覆盖,并采用三裁判LLM-as-a-judge面板,通过与人类盲审金标准(Cohen's kappa=0.85)验证;第三,对两款企业级代理(Gemini CLI和Qwen Code)完成5629次运行的进行大规模特征刻画,发现Gemini CLI在95.5%-96.1%的运行中被成功利用,Qwen Code在71.6%-74.0%的运行中被成功利用(从原始多数投票到声明意图修正估计,均与人类金标准一致),且几乎不受生成模型影响。显式安全识别仅出现在1.99%的运行中。研究表明,企业在采用编码代理前必须评估并缓解技能接口风险。代码和数据集已公开。
💡 推荐理由: 揭示LLM代理技能文件可被武器化且隐蔽性极高,现有代理缺乏有效安全识别机制,企业采用编码代理前必须评估此类风险。
🎯 建议动作: 纳入内部评估,关注该基准与检测方法,测试自有代理对恶意技能文件的防御能力
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)