#specification

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Satyam Kumar, Saurabh Jha

该论文识别了AI安全领域中一个关键的缺失环节:规范基础设施(Specification Infrastructure)。尽管可解释性、形式化方法、安全工程、评估方法和强化学习安全等领域各自产出了大量工作,但这些成果无法组合成可部署的监督方案。每个部署自主智能体系统的团队都不得不自行构建审计模式、策略方言、监控栈和升级路径,大部分是在重复发明已有模式。作者诊断这是一个协调缺口而非研究缺口,并提出了一个二维分类法:五个技术层(可读性、规范、调解、评估、升级)与六个关注点(对齐、鲁棒性、对抗防御、安全、治理、问责)交叉,将现有工作填充到5x6矩阵中。第2层(规范)是人类将意图转化为机器可验证制品的层面,是所有其他层依赖的连接组织,但它缺乏成熟工程学科的四个标志:共享词汇、设计原则、可组合性标准和治理实践。作者提出了第2层的六项设计原则(可激发性、可组合性、对抗感知、可追溯性、可治理性等),并通过工作示例和参考架构使其具体化,该架构将规范转化为运行时执行、评估和升级。现有系统如Cedar、Constitutional AI和Open Policy Agent各自只处理了第2层的一个片段,而矩阵的处理也不完整;将它们视为共享层中的片段使得组合变得可行。作为证据,作者介绍了CARMA,一个用于自主ETL智能体的第2层原型,其中单一规范驱动执行、评估和升级,每个决策都可追溯至版本化的规范。该论文命名了AI监督缺失的内容,并为独立团队提供了构建可组合缺失部分的原则。

💡 推荐理由: 该论文系统性地指出了AI安全工程中的一个根本性协调问题,并为构建可组合的规范基础设施提供了原则和参考架构,对部署LLM agent、自主系统的安全团队具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)