#multi-tier-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

本文提出 ClawSentry,一个面向自主 LLM 智能体的渐进式多层安全监控网关。研究背景是:当 LLM 智能体从简单对话扩展到执行代码、读取本地文件、编排外部工具时,单个被恶意第三方技能劫持的智能体可能导致数据泄露、权限提升或级联破坏。作者认为智能体风险是渐进式的:风险可能出现在智能体控制循环的四个位置——技能准入、调用时意图、执行时效果、行动后后果;且一个被拒绝的危险目标可能通过不同的表面形式、工具或轮次重新出现。现有防护通常只针对单一生命周期边界或单个调用,存在局限性。基于这一威胁模型,ClawSentry 采用框架无关的架构,不修改智能体内部结构,通过 Agent Harness Protocol (AHP) 抽象将统一策略应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI。其核心机制包括:在技能包执行前,First-use Skill Package Review (FSPR) 在确定性证据下限下审计技能包,并将未解决案例升级到受限的只读智能体审查(位置 A);运行时采用三层渐进决策引擎——确定性 L1 层、规则锚定的 L2 语义审查器、和只读的 L3 证据寻求智能体——仅在残余歧义上消耗上下文审查;同时会话级反绕过机制可识别工具切换和改述重试(位置 B-C);行动后路径将高严重性证据非追溯地反馈到后续审查(位置 D)。实验结果显示:在 SkillInject 基准上使用 Codex/GPT-5.4,上下文攻击成功率(ASR)从 39.55% 降至 2.61%,而上下文任务成功率(TSR)仅从 83.78% 微降至 83.05%;在 SkillsSafety 基准的五个 Work Agent 上,ClawSentry 将 ASR 限制在 9.09%–15.03%(未防护时为 33.5%–49.7%),干净技能上的总体 TSR 保持在 98.7%。

💡 推荐理由: 针对 LLM 智能体被恶意技能劫持的威胁,提供了覆盖全生命周期的渐进式防御框架,且无需修改智能体内部,对实际部署具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)