#post-training

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Alexander Tu, Michael Tu

本文研究面向可执行终端与模型上下文协议(MCP)环境中工具使用型大语言模型(LLM)代理的最小权限学习问题。LLM 代理在执行任务时,可能行使超出用户授予或任务所需的权限,导致“过度授权”错误。传统的权限门控系统在验证代理环境时存在不足,因此本文探讨能否通过后训练方法,使一个 4B 参数模型学会根据任务条件选择适当的权限级别,以补充现有控制措施。作者提出一个框架,在每个动作执行前以及从观察到的效果中,沿六个风险维度进行审计。审计采用确定性验证器,对完成度、证据、确切状态、禁止尝试和安全成功进行评分。结合预定义的任务特定充分授权范围,为轨迹计算任务特定的过度特权值,并在后训练中优化该值。实验基于 Qwen3.5-4B 模型,在 1,500 个任务上训练,并在 2,896 个评估片段(覆盖 500 个保留任务)中测试。结果表明,选中的种子模型实现了 98.48% 的安全成功率,而基础策略仅为 64.36%;过度授权错误事件从 4.56% 降至 0.79%。外部测试显示模型保留了原有能力,并能根据提示引导改进。此外,一个 400 任务的继续训练研究也发现了泛化迹象,过度授权事件减少了 6.99 个百分点,同时保持了先前能力。作者总结认为,通过最小权限感知的后训练来学习克制,作为工具使用代理在终端和 MCP 环境中的额外控制层是有用的,但并不能替代权限门控和沙箱机制。

💡 推荐理由: LLM 代理的权限滥用风险日益突出,该研究提供了一种新颖的后训练方法来减少过度授权错误,可作为现有权限门控的补充,为安全从业者设计更安全的代理系统提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)