#ai-governance

共收录 13 条相关安全情报。

← 返回所有主题
👥 作者: Zhongrui Sun, Jiahao Chen, Oubo Ma, Yuwen Pu, Zhou Feng, Haibo Hu, Shouling Ji

随着大语言模型(LLM)被广泛再分发、适配和通过不透明 API 提供服务,仅通过检查模型内部结构或部署记录已难以可靠地确认模型所有权。为此,研究者提出了一种基于语义结构的黑盒归属验证方法 PROSE。现有黑盒指纹大多依赖固定的查询-密钥关联,将模型身份简化为与日常行为脱节的稀疏记忆关联,导致鲁棒性和隐蔽性不足,例如在微调或量化后容易失效。PROSE 将指纹从固定查询集转向“目标语义域”,并用模型内化的“语义结构”替代脆弱的响应密钥。具体而言,指纹被编码为模型在语义上组织其领域结论的方式,而非特定 token 或规定输出。PROSE 首先构建一个私有的领域特定语义模板库,通过对结构正确且干净的响应进行混合微调使模型内化这些模板;然后在验证阶段,通过检测模型对未见过自然查询的响应是否呈现指定结构来判断所有权。实验覆盖多个模型架构、模型规模和目标领域,结果表明:在未修改模型上指纹检测率达到 100%,且未观测到误报;模型效用基本不变;在下游修改和输出变换下仍保持强可检测性。该论文面向 LLM 安全、模型知识产权保护和 AI 治理研究人员,提出了一种分布式、自然诱发的、语义级指纹方案,为黑盒模型验证提供了新思路。

💡 推荐理由: 为 LLM 版权保护和模型泄露溯源提供了黑盒场景下的高鲁棒性验证方案,有助于防御方识别未授权模型复用和 API 代理,具有直接的应用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Simone Gargiulo, Gabriel Kulp

该论文研究如何利用物理侧信道(GPU功耗)进行AI工作负载识别,为AI治理中的计算验证提供技术基础。作者指出,AI计算验证是国际AI治理政策中第一个可落地、可操作的关键点。监管机构若要判断前沿实验室或其他操作方是否遵守相关协议,需要能辨别其GPU计算资源的具体用途(如训练、推理或其它非AI计算)。与可被欺骗或重放的片上NVML遥测不同,物理功耗通道原则上可以在操作者不配合的情况下被外部独立观测。作者在NVIDIA H200 GPU上记录了930条约10 MHz采样率的5秒功耗迹线,涵盖17个开源大语言模型(LLM)家族和25种非AI工作负载。基于该语料库,他们以97%的准确率和0.955的宏平均F1分数,成功将训练、推理与非AI计算区分开来,且评估采用的模型家族在训练中从未出现过。频谱分析表明,AI工作负载的功耗成分主要低于20 kHz,其中训练过程因显存受限的优化器更新而具有特别显著的特征。为进一步验证方法的健壮性,作者将GPU操作者视为对抗性攻击者,允许其重塑物理计算过程,并测试了四种将训练伪装为推理的逃避策略,共生成680条对抗性迹线。经对抗性强化训练的检测器(保留被测试策略)对其中三种策略的捕获率不低于99%;对于第四种“稀释的低秩自适应(LoRA)”策略,强化分类器的检测率在48%到88%之间,但添加额外的救援规则后可将检测率提升至98%以上。作者声明,这些攻击测试并非对对抗性行为的全面评估,但提供了超越真实活动场景的初步洞见,并公开了数据集,以促进更强逃避机制的研究与检测模型的开发。整体而言,该研究展示了外部物理信道用于AI合规监控的可行性与对抗性挑战,对AI治理、GPU资源审计和基础设施安全均有重要参考价值。

💡 推荐理由: 该研究首次证明仅凭外部功耗观测即可高精度区分AI训练、推理与非AI负载,为AI治理合规监控提供了不依赖内部遥测的独立验证通道;同时揭示攻击者可利用LoRA等策略逃避检测,对建设AI计算审计体系有直接警示作用。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Prachi Chaturvedi, Shahnawaz Ahmad, Ehsan Nowroozi, Muhammad Waqas, George Loukas, Alireza Jolfaei, Lucas Cordeiro, Pierre Dantas

该论文针对大型语言模型(LLM)在医疗、司法、金融和公共服务等高风险领域应用中出现的责任归属问题,提出了一种分层责任架构框架(LAAF)。研究背景是:LLM 在这些场景中即使输出缺乏依据或内容错误,也常被当作权威信息,一旦造成损害,难以明确谁应负责以及通过何种机制进行追溯、解释和处置。作者遵循 PRISMA 指南,检索了 2022 年 1 月至 2026 年 3 月间的五个数据库,围绕四个综述问题,从 4512 篇记录中筛选出 122 项主要研究,并纳入 12 份监管与标准文件作为一手资料进行分析。综述将责任概念整合为一种社会技术视角下的“行为者-论坛”关系,分解为五个维度,并从四类机制(技术控制、人类监督、组织治理、文档与可追溯性)中综合出具体做法,同时评估了各类机制的成熟度。作者提出了一个四层分类模型,涵盖来源/出处、应用逻辑、人类监督、治理与救济,并与可追溯性、角色清晰度和持续监控等横切维度相结合。该模型被映射到欧盟《人工智能法案》(高风险义务自 2026 年 8 月 2 日起适用)、NIST AI RMF 及其生成式 AI 配置文件、ISO/IEC 42001 以及医疗、消费金融、教育和公共部门的行业指南上。分析揭示了四个持续存在的差距:人类监督的规范不足、缺乏共享的责任度量指标、学科之间脱节、实证评估有限;同时指出了五个测量工具均未解决的结构性张力。最后,作者将分类模型整合为 LAAF 框架,并将网络安全维度与 OWASP LLM Top 10(2025)对齐。论文明确指出 LAAF 是对现有证据的综合而非经过验证的工件。适合关注 AI 治理、负责任 AI、LLM 安全性和监管合规的研究者、政策制定者及安全架构师阅读。

💡 推荐理由: 该综述系统梳理了 LLM 应用中的责任追踪与治理机制,并映射到 EU AI Act、NIST AI RMF 等关键法规,为安全团队理解合规要求、设计可追溯审计链路提供了结构化参考,是连接 AI 安全与组织治理的实用框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

随着大语言模型(LLM)的广泛部署,第三方供应商提供的开源权重模型推理服务已成为生态系统的重要一环,但对其推理 API 质量的审计仍然是一个开放问题。本文提出 Ventor-QTest,一种无需目标 API 提供任何概率信息的复合黑盒审计方法。该方法将宿主模型路由视为随机过程,通过两个互补组件度量保真度损失:重复请求组件将每个固定的受限上下文多次发送至目标 API,根据返回文本计数重建分类输出分布,并计算平均保真度损失(AFL),该指标是经过零偏差校正、窗口内平均的粗粒化 KL 散度统计量;长序列组件则通过多次独立运行,基于运行级参考中心惊奇统计量的经验上尾报告极端保真度损失(EFL)。实验在三个支持 logprob 的路由条件下验证了 AFL 与基于 logprob 推导的粗粒化 KL 比较器之间存在强线性一致性;在七个路由快照上,20 轮序列探测揭示了不同路由特有的 EFL 变化。AFL 和 EFL 与 GPQA-Diamond 准确率无明显关联,但显著的 EFL 与 Terminal-Bench 通过率随任务暴露增加而下降的现象吻合,表明长跨度任务的正确性对极端保真度损失更为敏感。这些结果支持在审计长视野代理任务时联合报告 AFL 和 EFL。实现已开源(https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest),适合 LLM 安全研究者、模型审计工程师及依赖第三方推理 API 的组织阅读。

💡 推荐理由: 该研究提供了一种无需内部信息的黑盒审计框架,可客观量化托管 LLM API 的保真度损失,尤其适合检测长跨度代理任务的异常退化,为第三方大模型服务的信任评估提供新工具。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dipankar Sarkar

原则性监管(如“公平、清晰、不误导”或“提供良好结果”)属于评判性标准,无法简化为二元谓词。随着大型语言模型(LLM)被越来越多地用作裁判,其实际评估质量变得至关重要。本文提出,任何此类裁判都必须从四个维度进行评测:准确性(accuracy)、释义鲁棒性(paraphrase robustness)、对抗鲁棒性(adversarial robustness)和校准性(calibration)。作者发布了 Principle-Bench,一个包含 168 个加密资产金融推广场景的数据集,这些场景映射到英国金融行为监管局(FCA)的两条原则,并预注册了释义改写、关键词填充和边界扰动等攻击样本。这是首个覆盖原则性监管全部四个评估轴的数据集。同时提出 Ceca(Calibrated Exemplar-Cluster Assessment),一个校准且可审计的评估器,可输出每个示例的反事实归因。实验比较了关键词计数、三种句子转换器嵌入、一个开放式权重 LLM 裁判和一个校准级联,结果显示没有任何方法在所有四个轴上占优。最强的 120B LLM 裁判在良性输入上表现最好,但在面对关键词填充的 Consumer Duty 输入时,准确率从 0.74 骤降至 0.27,被作者称为“合规剧场”。另一个模型家族的裁判在相同分割上 Cohen's kappa 仅为 0.16,说明失败源于模型而非语料库。最终结论是:任何部署级用于原则性监管的 LLM 裁判,除了总体准确率外,还必须报告每个原则的对抗欺骗性和事后校准指标。

💡 推荐理由: LLM 在金融监管等高风险领域被用作自动裁判,其对抗鲁棒性和校准不足可能导致合规误判。本文提供了可复现的评测基准,帮助安全团队评估这类系统的可靠性,避免“合规剧场”式的虚假安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Lucy Qin, Jaron Mink, Elissa M. Redmiles

该研究聚焦于AI生成性内容(AIG-SC)在线社区中的治理问题。随着AI生成性内容的生产日益增多,大量支持创作者需求的在线社区应运而生,其中一些大型社区(成员数超过1万)明确制定了禁止创建和分享滥用性内容(例如AI生成的儿童性虐待材料,CSAM)的规则。为理解社区治理尝试如何在支持自由表达的同时防止滥用,研究者对24名来自此类大型社区的成员和版主进行了深度访谈。研究从四个维度展开分析:(1)这些社区形成的方式和原因;(2)隐含的社区规范;(3)明确陈述的规则及其通过内容审核的落地操作;(4)社区价值观与审核之间的张力如何为滥用行为留下空间。主要发现包括:尽管许多创作者和个人对滥用设有个人边界,但关于创建任意形式AI生成性内容的建议和资源对所有用户开放,不论其意图如何;社区中反审查和不评判的规范进一步复杂化了内容审核,导致版主被迫以法律和平台服务条款的边界来为自己行为辩护。研究最后反思了技术、社区和法律治理的结合如何最有效地减少滥用性内容的生产。这项工作对理解在线社区中AI内容治理的挑战、规范与法律框架的互动具有重要参考价值,适合平台治理研究者、政策制定者及内容审核策略设计者阅读。

💡 推荐理由: 揭示了AI生成性内容社区中治理机制的现状与漏洞,为平台设计更有效的滥用内容防控策略提供实证依据,尤其对防范AI生成CSAM等严重风险有参考意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alan Woodward, Andrew Rogoyski

本文由 Alan Woodward 与 Andrew Rogoyski 撰写,发表于 arXiv cs.AI 分类,聚焦前沿人工智能(Frontier AI)出口管制与网络安全之间的交叉问题。研究背景是:极少数位于两个国家(美国与中国)的企业掌握了最强大的前沿 AI 模型,而这两个国家的政府已展现出通过法律与政治手段限制其他国家安全使用这些系统的能力。文章提到,2026 年 6 月美国政府要求一家领先开发商在向任何外国人(包括居住在美国的外国国民)发布最先进模型前必须获得许可证,导致相关模型在全球范围内短时间内被撤回,原因是该限制在实际管理中难以执行。与此同时,文章援引了首个基本自主的、由 AI 驱动的网络间谍活动案例,并指出前沿模型正在改变网络攻击与防御的经济学。核心论点是:前沿 AI 的访问权正在成为国家网络防御的组成部分,但这种访问权可被随时撤销;对于绝大多数国家而言,建立完全主权能力的显性补救措施仅对少数国家部分可行。文章基于训练成本、算力集中度以及国家 AI 计划的支持力度等证据,探讨了主权对小国、中等国家乃至大国究竟意味着什么。文章提出分层应对策略:通过谈判获取访问保障、在推理层实现主权、使用开放权重模型进行对冲、汇聚区域能力、持续培养人才并投资基础网络韧性。作者特别指出,开放权重对冲的实际能力比通常预期更强,但政治暴露风险也更高;近期风险主要不在于模型表面的性能,而在于强大模型如何被部署和遏制。该研究的主要贡献在于首次系统性地将前沿 AI 出口管制、网络安全的战略依赖性与国家主权能力联系起来,为政策制定者、网络安全战略家和国际关系研究者提供了分析框架与行动建议。适合阅读人群包括国家网络安全机构、AI 治理政策制定者、CSO/CISO 以及研究 AI 安全与战略的学者。本文仅有摘要,未提供实验或实证数据,因此属于观点分析型研究。

💡 推荐理由: 该文揭示了前沿 AI 访问权已成为国家网络安全的关键战略变量,且可被单方面撤销。安全从业者需认识到模型供应链的脆弱性,并考虑开放权重模型和推理层主权作为备选,以降低地缘政治风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Sriram Nagaraj

本文提出一个面向多智能体生成式AI系统治理的严格数学框架,聚焦于K个自适应性生成式AI模型在模型风险管理(MRM)原则下的联合稳定性与零知识证明问题。研究背景在于:当多个模型通过交互矩阵形成元学习耦合时,传统基于单个智能体的Lyapunov稳定性分析不再充分——可能出现每个智能体各自满足声称的稳定性边界,但整个联合系统在涌现层面发生漂移(emergent ensemble-level drift)的情形。作者将该差距形式化为“联合Lyapunov证明”(JLP),这是一个结合密码学与随机过程的协议,能够在每个验证周期内不泄露专有权重的前提下,证明聚合动态满足MRM持续监控标准。主要贡献包括:完整刻画联合二次Lyapunov函数的无穷小生成元;推导系统失去均方稳定性的临界耦合阈值精确表达式;证明“噪声底限定理”(Noise-Floor Theorem),并识别零知识证明的正确目标;推导基于实时权重的逐周期简洁非交互式知识论证(SNARK)。所有理论声明均通过多智能体softmax系统的五项数值研究验证。该论文适合从事AI治理、模型风险管理、形式化验证及可验证机器学习的研究人员阅读,为多模型耦合场景下的风险监控提供了理论工具与可审计性方案。

💡 推荐理由: 多模型协作部署日益普遍,传统单体稳定性评估存在盲区,该框架首次系统性刻画联合漂移风险并提供可证明的治理证明机制,对AI系统审计与合规有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shayell Aharon Salomon Amir Shaked Matan Noga

本文针对AI编程代理(AI coding agents)在安全治理中面临的一个现实困境:现有安全框架虽已识别出过度代理权限、过度授权、弱任务绑定授权以及代理控制不足等风险,也提供了约束、授权、观察、验证和响应等控制能力,但安全团队仍缺乏一种机制来系统化管理那些跨组件、生命周期长于单次事件的持久化部署实例。为此,作者提出了一种新的安全抽象——'代理姿态漏洞'(Agentic Posture Vulnerability, APV)。APV是一种基于任务条件的漏洞管理抽象,它把某个组合式的代理控制暴露记录为持久化条目。同一个代理姿态在不同任务下可能产生不同的运行时表现,APV将这些表现关联回不变的姿态,并保持开放状态,直到权限收窄、缺失控制被补齐、风险被接受或关闭条件得到验证。作者强调,APV并非提出一种新的根因风险类别,而是将现有关于过度代理、授权不足和控制组合缺陷的问题操作化。论文系统区分了APV与CVE可寻址产品缺陷、OWASP Excessive Agency、Agent基线控制结果以及运行时授权-执行间隙等概念。文中还提供了实践场景描述、阈值化定义、六种常见的APV模式、漏洞生命周期、最小记录结构、控制与关闭矩阵、工具含义以及可测试的研究议程。通过这种方式,作者希望为AI代理的长期安全性和可审计性提供一种标准化的管理方法。该论文适合安全研究员、AI系统开发者和安全运维团队阅读,尤其关注LLM代理在生产环境中的风险治理。

💡 推荐理由: 提出'代理姿态漏洞'这一新抽象,填补了AI代理持久化控制风险管理的空白,为蓝队将新型LLM代理风险纳入既有漏洞管理流程提供了理论框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jonathan Shelby

本文探讨了受监管金融机构在快速采纳人工智能(AI)过程中所产生的治理与运营韧性之间的结构性缺口。当前,以欧盟AI法案、ISO IEC 42001、NIST AI风险管理框架及英国原则性方法为代表的治理体系主要围绕可信赖性(trustworthiness)展开,重点关注安全性、公平性、透明度和模型风险。然而,这种治理响应未能充分覆盖运营韧性(operational resilience),即关键业务服务在严重但可信的中断下保持连续性的能力,包括AI组件的可替代性以及对少数前沿模型供应商的依赖集中度问题。作者指出,AI的采用创造了一种独特的韧性义务,这独立于且未被可信AI堆栈充分覆盖。英国金融当局已通过金融政策委员会的系统性分析、关键第三方制度以及2026年5月关于前沿AI与网络韧性的联合声明开始弥合这一差距。本文映射了两种监管逻辑(可信AI与运营韧性),识别出它们之间的结构缺口,并提出了AI韧性框架(AI Resilience Framework)。该框架是一种与具体监管制度无关的方法,通过依赖映射、关键性-可替代性分层、将冲击容忍度扩展到AI特定故障模式、明确的回退原则以及供应商层面的集中度管理,将AI依赖关系纳入运营韧性边界。该框架为首席信息安全官、安全架构师和董事会提供了从AI治理政策到可证明韧性的可行路径。本文是作者关于英国网络韧性监管框架在人工智能维度分析的延续。研究指出,组织应当针对AI系统建立独立的韧性评估与测试机制,避免将AI治理等同于整体韧性。

💡 推荐理由: 填补了现有AI治理框架(如欧盟AI法案)在运营韧性方面的空白,为金融机构应对AI供应链集中风险、第三方依赖及系统级中断提供了可落地的框架。

🎯 建议动作: 研究跟进:建议安全架构师与风险管理团队评估AI韧性框架在本组织的适用性,尤其是依赖映射与供应商集中度管理。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Javier Irigoyen, Roberto Daza, Aythami Morales, Julian Fierrez, Ruben Tolosana, Ruben Vera-Rodriguez, Francisco Jurado, Alvaro Ortigosa

本文综述了人工智能系统风险识别、分析与管理的系统性方法论。首先,梳理了全球范围内推动AI风险评估需求的监管格局,包括欧盟《人工智能法案》等基于风险的监管框架。其次,系统分类了文献中识别的AI相关风险谱系,涵盖从技术故障(如模型鲁棒性不足、数据泄露)到伦理与社会影响(如歧视、隐私侵犯、可解释性缺失)的多种维度。随后,重点回顾了面向AI系统的主流风险评估方法论,聚焦于通用框架(如NIST AI风险管理框架、ISO/IEC 42001等),分析了各框架的核心步骤、适用场景及优缺点。论文指出了当前AI风险评估中的最佳实践,例如分层评估、持续监控与多方利益相关者参与,同时揭示了方法论缺口(例如动态风险适应、因果关系量化、人机协作场景的特殊评估需求)。最后提出了未来研究方向,包括风险指标的标准化、跨领域迁移能力、以及与大模型风险特性匹配的评估技术。本文适合AI安全工程师、风险合规人员、政策制定者及研究人员阅读,以系统理解AI风险评估的现状与挑战。

💡 推荐理由: 随着欧盟《人工智能法案》等监管落地,系统性AI风险评估成为刚需。本文提供了当前方法论的全景图,帮助组织在合规和风险管控中少走弯路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tian Dong, Shaofeng Li 0001, Guoxing Chen, Minhui Xue 0001, Haojin Zhu, Zhen Liu 0008

该论文《RAI2: Responsible Identity Audit Governing the Artificial Intelligence》由Tian Dong等人撰写,旨在解决人工智能系统中的身份审计与治理问题。虽然摘要内容未提供,但根据标题推测,论文可能提出了一种负责任的身份审计框架(RAI2),用于监管AI系统的身份管理、访问控制和合规性审计。该方法可能结合了身份与访问管理(IAM)技术和AI模型审计策略,以增强AI系统的安全性和可问责性。由于缺乏具体细节,无法进一步描述技术架构及实验验证。

💡 推荐理由: 随着AI系统在企业中的广泛部署,身份审计与治理成为确保AI安全合规的关键。该论文可能提供创新的审计框架,帮助安全团队建立对AI身份行为的可视性和管控。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.3)
👥 作者: Anna Ablove, Shreyas Chandrashekaran, Xiao Qiang, Roya Ensafi

本文系统地研究了中文大型语言模型(LLM)服务中内容审查政策的实现方式。研究团队设计并实现了一个自动化测试框架,通过向多个主流中文LLM服务(如百度文心一言、阿里巴巴通义千问等)发送精心构造的提示词,评估它们对敏感话题(如政治、历史、社会事件等)的响应一致性。实验发现,不同服务在审查的严格程度、触发审查的关键词模式、以及拒绝回答的措辞上存在显著差异。部分服务会直接拒绝回答,另一些则提供符合官方立场的回答,还有服务会给出模糊或转移话题的回复。论文进一步分析了审查政策的文本依据,并讨论了这种不一致性对用户信息获取和言论自由的影响。研究贡献在于首次大规模、多维度地刻画了中国LLM服务的审查实现现状,为理解AI时代的信息控制提供了实证数据。

💡 推荐理由: 揭示了中文LLM服务审查政策的实现差异,对理解AI内容监管、用户信息获取质量及跨国服务合规具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)