#dual-use

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

这篇论文从底层机制上指出了当前大语言模型安全护栏(safeguards)的一个结构性缺陷:模型在尚未看到回答将被如何使用之前,就必须决定是否回答。对于双用途(dual-use)任务,同一个回答既能帮助授权专业人员,也可能被攻击者利用;而攻击者可以轻易模仿正常请求和交互历史,使现有基于上下文(prompt/对话历史)的可复制信息无法可靠地区分真实意图。作者将模型释放的能力与关于下游使用的可获取证据分开建模。当这些证据是可复制的(copyable),他们推导出攻击者能获得的最坏情况性能下限的精确表达式,同时证明仍能保留有用回答。由此得到一个安全三难困境:有用的能力(Useful Capability)、可靠的安全(Reliable Safety)和开放访问(Open Access)三者不可能同时实现。为了突破这一困境,作者提出引入可信凭证(trusted credential),通过添加难以复制的信息来更准确地预测实际下游用途,从而补充现有安全护栏;他们进一步分析了需要什么更强条件才能完全消除攻击者可利用的下限。论文还给出了来自双用途评估、自适应攻击以及实际部署的受信任访问项目的实验证据,支持这些条件的实际相关性。本文的核心贡献在于从信息论和博弈论角度形式化描述了安全护栏的局限,为设计更可靠的大模型安全机制提供了理论依据,特别值得大模型安全策略制定者、红队成员和安全架构师阅读。

💡 推荐理由: 该研究揭示了大模型安全护栏的根本局限:仅依靠可复制的上下文无法可靠区分合法与恶意使用,这意味着当前许多安全措施存在理论上限,对蓝队设计纵深防御具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kiarash Ahi, Saeed Valizadeh

该论文是一篇关于大语言模型(LLMs)和生成式AI(GenAI)在网络安全与隐私领域中双用途风险的综述。研究背景指出,到2025年LLM生成的恶意软件已占检测威胁的50%,而2021年仅占2%,表明AI驱动的攻击自动化正在飞速发展。论文通过回顾70多篇学术论文、行业报告和技术文档,并结合来自Google Play Protect、Microsoft Defender、AWS、Apple App Store、OpenAI Plugin Stores、Hugging Face Spaces、GitHub等平台的实际案例,系统梳理了LLM在网络安全中的正面应用(如零日检测、DevSecOps、联邦学习、合成内容分析、可解释AI)和恶意应用(如网络钓鱼、漏洞利用、恶意代码生成)。该综述还分析了SAFE框架等新兴举措及AI驱动的异常检测。最终,论文提出了负责任部署LLM的建议,包括模型水印、对抗性防御、跨行业合作等,旨在为AI驱动的网络安全研究设定新基准。核心贡献在于全面勾勒了LLM双用途风险的当前图景,并为研究人员、工程师和安全领导者提供应对AI驱动安全挑战的路线图。适合网络安全研究员、AI从业者、SOC分析师及安全策略制定者阅读。

💡 推荐理由: 该综述系统揭示了LLM和GenAI在网络安全中的双用途风险,帮助安全从业者快速理解当前AI威胁态势及防御策略,对制定内部安全路线图具有重要参考价值。

🎯 建议动作: 阅读全文以获得系统理解,并评估组织内部AI安全策略。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

该论文针对AI智能体在生命科学工作流中可能带来的双重用途风险,提出了一个用于评估模型安全拒绝行为的基准测试——BioSecBench-Refusal。基准包含61个日常任务(来自已发表文献的合法分析)和46个红队任务(虚构但模拟真实研究场景、隐藏生物安全风险的情景)。作者在16种模型-工具链配置上测试了不同模型的拒绝率,结果显示:日常任务的拒绝率在7%到74%之间,红队任务的拒绝率在1%到62%之间,许多配置对合法日常任务的拒绝率与对隐蔽风险任务的拒绝率相当甚至更高。分析表明,大多数拒绝是由模型提供商在智能体推理之前应用的API过滤器触发的。然而,给予更多推理空间的模型显示出识别真正威胁的潜力。论文发布了该基准,旨在帮助模型开发者校准用于智能体生物技术研发的能力与谨慎性。

💡 推荐理由: 首次系统评估AI智能体在生物研究中的安全拒绝行为,揭示了现有模型可能过度拒绝合法任务却放过真实风险的问题,对构建安全的科学AI代理至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)