推荐 5.5
Conf: 50%
该论文针对 AI 代理在执行密码学操作(如 Git 提交签名、API 调用认证、证书签发)时私钥存储不安全的问题展开研究。当前常见做法将私钥存放在软件可访问的位置(明文文件、环境变量或容器内存),任何具备足够读权限的进程都能提取原始密钥材料。作者引用了一个实际生产事件:某广泛部署的框架中的私钥在五分钟内通过电子邮件注入被泄露,以此说明严重性。为此,论文提出用硬件限制的密钥(通过供应商中立的 PKCS#11 接口访问)替代软件驻留密钥,硬件安全模块(HSM/TPM/智能卡)在设备内执行密码学操作,主机仅通过不透明句柄获得结果。硬件隔离是核心贡献,并由五层零信任强制堆栈支撑:会话身份(SAGA)、范围边界(Smax)、语义验证(RAV)、污点追踪以及硬件执行边界。作者基于 AgentDojo 的 ImportantInstructionsAttack 模板派生出 12 种注入场景进行评测,覆盖四个 LLM 模型(gpt-oss-120b、Qwen2.5-72B、DeepSeek-V4-Flash,n=192 合计)。基线模式下攻击成功率(ASR)为 19.3% [14.3%, 25.4%];启用保护后 ASR 为 0%(Wilson 95% 置信区间上限 2.0%),并且在四个良性任务场景中零误报。该研究为 AI 代理的密钥管理提供了一种可落地的硬件强制架构,适合 LLM 安全工程师、零信任架构师以及密码学应用开发者阅读。
💡 推荐理由: 直接解决了 AI 代理密钥泄露的致命问题,用硬件隔离和内容感知授权大幅降低注入攻击风险,实测 ASR 从 19.3% 降至 0%,对 LLM 应用安全设计有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)