#evidence

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Peiying Zhu, Sidi Chang

本文针对智能体(Agent)评估中的证据充分性与覆盖范围问题,提出了一套名为 ClaimReceipt 的声明相对收据规范与选择性验证器。研究背景是:在智能体评测中,存在两种不同的证据问题:一是已报告声明能否从保留证据中重新计算得出(充分性);二是保留的记录是否覆盖了承诺的实验集合(覆盖性)。普通的通用日志和哈希链接记录无法可靠地回答这两个问题。ClaimReceipt 的核心方法是:将类型化的事务证据绑定到一份签名的实验清单上,并为每条声明返回 PASS、INVALID 或 INCONCLUSIVE 三种结果。作者在实现前冻结了规范(SHA-256 哈希为 18d109...b81),以确保规范不被实现细节污染。实验使用 1,392 条历史买方—卖方记录进行验证:CR-2 验证器重现了全部五个手工标注的审计结论,精确重放了 600 条确定性记录和 792 条后生成记录,在测试的消融实验下使全部 13 个声明字段组都保持非冗余,并且对 11/11 个语义故障返回预期结果,同时 0/8 误报。随后,作者进行了前瞻性的 CR-3 时期实验:在推理前承诺 30 项任务,终端收据被签名并链接,私人证据为审计方加密。完整证据得到覆盖性和账目 PASS;扣押一个终端收据返回 INCONCLUSIVE_COVERAGE;而扣押所有私人打开则保留覆盖性和协议验证,但使经济声明变得不确定——这些结果与预注册的预测完全吻合。收据插桩仅增加模型推理时间的 0.021% 和每事务 9.9 KB 的存储开销。规范可读性探针表明,冻结的规范对独立读者而言仍非完全无歧义。结论是,声明验证不仅需要声明充分的证据,还需要一个已承诺的宇宙,使遗漏变得可见。本文适合智能体评测设计者、AI 安全审计人员、以及关注可验证 AI 系统(特别是基于证据的审计机制)的研究者阅读。

💡 推荐理由: 为智能体评测的可信审计提供了可操作证据链机制,解决日志不可靠、覆盖范围不明的问题,助力蓝队自建评测流程的可复现与一致性验证。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)