#AI安全

共收录 3 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee

本文提出了一种对抗性提示框架(Adversarial Prompting Framework, APF),用于系统性地评估生成式AI模型的安全性。随着生成式AI在各行业的广泛应用,模型面临的新型网络攻击风险(尤其是对抗性提示攻击)日益突出。APF框架通过生成多层次的对抗性提示,从简单的直接有害请求到复杂的编码型攻击(如Base64编码、Unicode编码等),全面测试模型的安全防护能力。框架在企业环境中实现了自动化测试,并提供了量化安全评估指标。实验结果表明,不同攻击向量的成功率存在显著差异,其中编码型提示在绕过安全机制方面成功率最高,揭示了现有模型防护的薄弱环节。该研究为AI安全评估提供了可操作的自动化工具,有助于发现和修补模型漏洞,提升系统鲁棒性。

💡 推荐理由: 本文提出的系统性对抗性提示评估框架,能帮助安全团队自动化发现AI模型的安全薄弱点,尤其是在编码攻击等高级绕过技术面前的脆弱性。

🎯 建议动作: 研究跟进,评估该框架在自身AI安全测试中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

本文聚焦于视频内容保护,以防御图像到视频生成(reference-based)和微调(tuning-based)两种定制化视频生成管线带来的隐私泄露与身份盗窃风险。现有针对图像的保护方法无法直接迁移到视频上,面临三大时序挑战:(1) 逐帧优化图像级扰动无法抵抗3D视频VAE的时序压缩;(2) 单视频优化的视频级扰动在时序编辑后失效,且无法保护未见过视频;(3) 时序不一致的扰动量脆弱于未知时序攻击。为此,作者提出时序一致通用对抗扰动(TC-UAP),这是首个能同时防御两种视频定制化管线的保护方法。TC-UAP在滑动窗口内跨多个视频优化身份级的多帧通用对抗扰动(UAP),利用滑动窗口捕获视频VAE时序压缩带来的局部时序依赖,使单个扰动可保护不同长度的未见过视频。同时,引入内在时序建模(优化帧间扰动变化)和外在代理时序攻击损失(模拟未知时序操作),使扰动时序一致且对未知攻击鲁棒。定量与定性实验表明,TC-UAP在identity保护强度上显著优于现有方法,并能在多种未知时序攻击下保持鲁棒。

💡 推荐理由: 视频定制化生成技术快速发展带来严重隐私风险,本文首次提出统一保护方案,填补了视频防御领域的空白,对蓝队保护用户视频身份、防止深度伪造滥用具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Liuyang Yao, Zhouyu Li, Junguang He, Ziyang You

该论文研究AI辅助金融咨询(如信用评估、投资顾问)中存在的隐蔽操纵通道。作者发现LLM推理的采样层存在一个漏洞,允许攻击者在保持与输出审计机制(包括统计水印)完全兼容的情况下,系统性偏置AI生成的金融意见。这种推理阶段的操纵在统计上难以检测:操纵输出与正常输出分布之间的KL散度可以任意小,使得基于输出的检测方案需要不可实际的大样本量才能达到可靠检测。实验在信用评级和投资顾问场景中显示,在隐蔽性感知操纵下,定向偏置关键词可被放大1.8-1.9倍,同时触发零个黑盒检测器并保持水印完整性。该漏洞在三种主流水印方案和三种异构模型架构上均有效,构成系统性金融基础设施风险。软件防御(如密码学安全的伪随机数生成器)完全无效,而QRNG结合TEE硬件隔离通过用量子熵替换可预测的哈希密钥,使所有预计算操纵目标无效,实现了100%攻击阻断(将目标率降至自然基线)。作者提出四项监管修正,核心是要求高风险金融AI系统根据NIST SP 800-90B进行强制性QRNG认证、推理层供应链审计和输出溯源机制。本文适合关注AI安全、金融监管、LLM供应链安全的研究人员和监管者阅读。

💡 推荐理由: 揭示了一种隐蔽且难以检测的AI操纵通道,直接威胁金融市场的诚信与监管有效性。防御方案需要硬件级改造(QRNG+TEE),对现有AI审计体系构成挑战。

🎯 建议动作: 研究跟进:评估自身系统是否依赖可预测的随机数生成;考虑将QRNG硬件集成纳入安全路线图。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)