推荐 3.5
Conf: 50%
该论文针对AI智能体在生命科学工作流中可能带来的双重用途风险,提出了一个用于评估模型安全拒绝行为的基准测试——BioSecBench-Refusal。基准包含61个日常任务(来自已发表文献的合法分析)和46个红队任务(虚构但模拟真实研究场景、隐藏生物安全风险的情景)。作者在16种模型-工具链配置上测试了不同模型的拒绝率,结果显示:日常任务的拒绝率在7%到74%之间,红队任务的拒绝率在1%到62%之间,许多配置对合法日常任务的拒绝率与对隐蔽风险任务的拒绝率相当甚至更高。分析表明,大多数拒绝是由模型提供商在智能体推理之前应用的API过滤器触发的。然而,给予更多推理空间的模型显示出识别真正威胁的潜力。论文发布了该基准,旨在帮助模型开发者校准用于智能体生物技术研发的能力与谨慎性。
💡 推荐理由: 首次系统评估AI智能体在生物研究中的安全拒绝行为,揭示了现有模型可能过度拒绝合法任务却放过真实风险的问题,对构建安全的科学AI代理至关重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)