#claude-code

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ting Yan

该论文研究 CLAUDE.md 中自然语言安全规则与 Claude Code 内置控制(deny)之间的语义鸿沟。CLAUDE.md 中的“do not”是模型解释的自然语言指令,而 deny 是代理执行前阻止动作的内置控制。两者可表达相同安全目标,但控制机制不同。作者在 481 个公开 CLAUDE.md 文件中测量了这种差距:用 LLM 将提取的候选规则与 Claude Code 文档化控制匹配,并由两名安全从业者独立抽样检查(未看到模型答案及对方标签)。根据控制必须与书面规则匹配的严格程度,仅约 4%-16% 的检索到的安全规则具有匹配的内置控制;在最严格标准下估计为 4.4%(95% CI: 2.6%-6.7%),且两名标注者对哪些规则存在匹配高度一致。对完整文件的人工审查发现,提取方法捕获了 66.3% 的符合条件的安全规则,因此报告的比例仅适用于捕获的规则。论文指出这是可用性安全问题:CLAUDE.md 是只写通道,开发者编写安全规则但无法获得控制是否会执行的反馈。同一纯文本形式隐藏了两种规则类型:一种可由权限规则、模式或沙箱强制执行,另一种只能由模型解释。该工作为 LLM 代理配置的安全保障提供了实证分析,突出了自然语言指令与硬性控制之间的信任缺口,对构建安全 LLM 代理工作流具有重要参考价值。

💡 推荐理由: 揭示了开发者对 CLAUDE.md 安全规则的信任可能落空:大量规则缺乏内置控制强制执行,仅依赖模型解释,存在被绕过风险。对使用 Claude Code 或类似代理的团队是重要提醒。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)