#answer-set-programming

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Arun Ravindran, Saurabh Deochake

大型语言模型(LLM)代理日益依赖外部工具来扩展能力,但这也引入了新的安全边界:第三方工具可能在接口层面看似无害,而在实现中嵌入不安全行为。现有防御机制依赖弱元数据、将特征描述和策略判断合并为单一决策、或使用缺乏确定性、可审计推理的启发式/LLM强制执行,无法有效处理任务上下文和多工具组合。本文提出ToolGuardian,一个策略驱动的框架,通过预准入审查和任务感知的运行时授权来保障代理-工具交互安全。ToolGuardian采用渐进式特征化方法,将证据转换为结构化事实:描述捕获声明意图,系统调用跟踪暴露粗略行为,模拟执行揭示观察到的效果,源代码分析识别潜在行为。其核心贡献是基于回答集编程(ASP)的声明式策略层,能够显式推理能力、效果、任务上下文和组合。作者使用相同的输入和输出契约,将ASP与基于启发式和LLM的策略实现进行比较。在16个MCP风格工具(包括8个源自真实开源工具的恶意变体)和20个运行时场景上评估ToolGuardian。在准入审查阶段,使用描述、系统调用和观察效果证据,ASP的拒绝类F1得分为0.86,准确率为88%。在运行时授权方面,完全指定的实现能正确分类所有场景,而消融实验显示,移除组合和合规规则会显著降低性能。

💡 推荐理由: 为LLM代理与第三方工具交互提供了一种声明式、可审计的安全策略框架,解决了现有启发式方法缺乏确定性的问题,对保障AI代理生态安全具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)