#llm-evaluation

共收录 2 条相关安全情报。

← 返回所有主题
推荐 5.6
Conf: 50%
👥 作者: Faruk Alpay, Taylan Alpay

该论文聚焦 LLM 系统在“答案发布”(publication)环节的完整性与授权绑定问题:已获批准的内容必须与其当前的授权上下文严格绑定,否则会出现三类可区分的失效——语义层面的错误批准(把无依据的答案判为可用)、授权陈旧(审批时有效但发布时已过期)、以及恢复(recovery)流程自身引入的新误差。作者在 Lightcap 的发布执行机制上系统考察了精确内容绑定、授权新鲜度与检查点恢复三个环节。实验设计上,选用 RAGTruth 数据集中 900 条经人工独立标注的回答(来自 150 个源任务),配合三个不同日期的 Ministral 模型以及一个同模型直接 grounding 基线,共产生 3600 次评估。结果显示:以 14B 实例化的生产 response-act 检查器在 302 条被标注为“无支持”的答案中接受了 291 条,而直接基线仅接受 41 条;两者的支持性答案保留率分别为 95.2% 与 66.9%,揭示了安全性与可用性之间的显著取舍。作者提出“精确晋升-修正恒等式”(exact promotion-correction identity),在 100 条按时间排序的 3B-14B-8B-14B 答案轨迹上追踪误差传播;在 65 条初始被批准的答案中,最终的有状态 recheck-recovery 策略相对初始检查点使精确匹配误差上升了 9.23 个百分点(95% 文章聚类置信区间 [-1.72, 19.61]),说明复查恢复机制可能反而放大误差。受控的证据指纹(evidence-fingerprint)变更实验还暴露了发布与恢复之间在“新鲜度”强制执行上的不对称性。此外,一个独立的 BIPIA 提示注入实验在 266 条有效编辑器输出中记录到零次目标插入;外部 Hugging Face 校准实验则把检索模型从 ArguAna 迁移到 SciFact 与 NFCorpus,并把诊断决策规则从 Thunderbird 迁移到 BGL,用于将概率校准变化与排序变化区分开来。核心贡献在于:在可执行的发布边界上,把语义误批准、陈旧授权与恢复引入误差这三类风险分离并量化,为 LLM 输出治理提供了可复现的度量框架。

💡 推荐理由: LLM 答案发布环节的“批准”常被当作可信边界,但本文证明生产级检查器会大量放行无依据答案,且授权过期与恢复流程会引入额外误差。对构建 RAG/Agent 输出治理、审批流水线与内容安全网关的团队具有直接参考价值。

🎯 建议动作: 研究跟进:建议在内部 RAG/Agent 发布流水线上复现其误批准率与保留率度量方法,并将授权新鲜度校验与恢复误差回归测试纳入评估清单。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerman, Brandon Behlendorf, Tom Hobson, Theodore Wilson, Spyros Matsoukas

本文提出了一种阈值超出标准(Threshold Exceedance Criteria, TEC)框架,用于评估前沿语言模型是否显著提升非专业行为者策划化学、生物、放射或核(CBRN)误用的能力。现有CBRN评估在非专业定义、威胁范围、基线、评分规则和决策规则上存在差异,导致结果难以比较。TEC框架将提升(uplift)研究分解为三个独立可执行的部分:确定非专业参与者资格、定义研究中的CBRN威胁范围、以及统计估计实质性提升。作者进一步在一个大规模实证研究中操作化该框架,采用实验设计区分两种提升:生成性提升(模型从头协助创建计划)和修正性提升(模型协助完善现有计划)。研究产生了跨CBRN领域的攻击计划,并通过领域专家评审来估计生成性和修正性提升。应用该框架后,实证研究揭示了领域异质性:在受控的发布前评估中,模型辅助计划有时获得与专家等效的指导评级,但确认的实质性提升仅限于放射领域。这些发现为缓解措施和部署治理决策提供了依据,而非描述已部署模型的行为。最后,文章总结了未来CBRN提升评估的方法论教训,强调预先指定标准、明确基线、分离生成性和修正性估计、以及仔细区分初步筛选信号与确认的风险判定。

💡 推荐理由: 随着LLM能力增强,如何科学评估其对CBRN误用的实质性提升成为政策制定者和模型开发者的关键问题。该框架提供了可重复、可比较的评估方法论,有助于更严谨地量化风险,对AI安全治理具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)