#inference-time

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Samar Ansari

本文关注一个正在被政策与安全圈忽视的治理错位问题:当前主流的算力治理(compute governance)本质上是一种「训练治理」——在用的算力阈值、申报义务和前沿 AI 监管框架都挂在训练算力上,并把「训练完成的模型」当作监管单元。作者指出这幅图景不完整:随着推理时扩展(inference-time scaling)、智能体式脚手架(agentic scaffolding)和模型压缩到消费级硬件的普及,能力正在向部署阶段迁移,监管对象也从「训练运行」变成「推理调用」。论文要回答的核心问题是:当监管对象位移到推理调用之后,究竟有哪些机制真正可用?为此作者构建了一套推理时机制的可行性分类学,覆盖监测(monitoring)、验证(verification)与执法(enforcement)三大簇,共二十种机制;每种机制基于四家厂商的书面证据,按四点式就绪度量表打分。随后作者用一个二维对手模型对分类学做压力测试(三个能力层级 × 四种对手角色),并把每种机制映射到四种治理场景:国内监管、双边或多边协调、行业自律、算力市场治理。主要发现有三:其一,二十种机制中有十五种今天已有商用技术底座在生产环境中运行,但「治理级保证」与对抗鲁棒性差异极大,不能一概而论;其二,这种就绪度只在「配合型部署者 + 低到中等能力用户」的前提下成立,面对高能力国家级部署者没有任何机制被评为足够,且微调会移除执法簇中依赖模型内部的组件,不过平台外部控制仍可能存续;其三,作者用替代分析把该分类学与姊妹篇硬件论文连接起来,提出一条「条件替代原则」,说明推理阶段机制与硬件阶段机制在何种明示条件下可提供可比的监管覆盖。此外,作者对就绪度评分随机子集做了第二评分者信度检验,二次加权 Cohen's kappa 为 0.74,表明评分具备可接受的一致性。论文属于政策—技术交叉类研究,既不是漏洞披露也不是攻击技术,适合 AI 治理研究者、合规与政策团队、以及做模型部署安全评估的工程师阅读。

💡 推荐理由: 它把「模型上线后还能管什么」拆成可核对的二十个控制点并给出就绪度与对抗边界,明确指出高能力对手与微调场景下治理手段会失效,对做 AI 部署安全评估和合规落地的团队有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmed Abdelnaby, Mohamed Elmahallawy

该论文提出了一种面向实际部署的黑盒后门防御方法 TRIM(Trigger Removal by Identifying Manipulated Regions),用于在推理阶段检测并选择性清除深度神经网络图像分类模型中的后门触发器。后门攻击通过隐藏的恶意触发器让模型在保持高干净准确率的同时,对特定输入产生错误分类。现有防御通常依赖模型内部结构、训练数据或干净验证样本,在仅有模型黑盒访问权限的真实场景中难以部署。TRIM 的核心思路是定位导致模型反常行为的图像区域,并在不影响良性内容的前提下仅净化这些区域。其创新由三个关键组件构成:(i) 基于深度特征表示的区域分割;(ii) 通过图像修复与扩散重建实现的自适应触发器发现,不预设触发器的类型、形状或位置;(iii) 选择性区域净化,在保留良性内容的同时清理被污染的区域。此外,TRIM 会缓存已发现触发器的特征嵌入,以便快速识别和避免重复检测。在多种数据集和后门类型(包括混合式、稀疏、不同大小及多个触发器)上的广泛实验中,TRIM 显著优于现有黑盒防御方法,将攻击成功率(ASR)降低至最低 1.16%,同时保持最高 87.87% 的干净准确率。结果表明,即使防御者没有任何辅助数据,也能在推理阶段有效缓解后门攻击。

💡 推荐理由: 该论文提供了一种不依赖模型内部或干净样本的推理时后门防御方案,适用于真实世界中仅能获得黑盒模型访问权的场景,对部署视觉模型的蓝队成员具有直接参考价值,能够在不中断业务的情况下降低后门攻击风险。

🎯 建议动作: 研究跟进:建议安全团队阅读论文并评估 TRIM 在自有模型上的效果,后续可构建原型进行针对性验证。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.6
Conf: 50%
👥 作者: Chou Jin Chua, Sarang Nambiar, Murali Srinivasan, Ezekiel Soremekun

AKRASIA 是一种针对基于推理的代码大语言模型(Code LLM)的隐蔽后门攻击方法,由研究团队提出并评估。与现有攻击不同,AKRASIA 在推理阶段(inference-time)注入后门,通过探测目标 LLM 以构造代码级触发器,并利用上下文学习(in-context learning)实现后门学习,同时利用模型的不忠实行为(model unfaithfulness)来隐藏触发器并生成看似合理的推理链。研究测试了四种后门目标、六种推理型 LLM、三个编码任务/数据集及三种防御方法。实验结果显示,AKRASIA 在先进 LLM 上的平均攻击成功率(ASR)最高达 99.34%,同时保持最高 97.23% 的准确率(即防御方难以察觉功能退化)。在对抗当前最先进的防御方法时,AKRASIA 在 14/18 种防御设置中仍能保留平均高达 98.82% 的 ASR,并能在高达 80% 的设置中成功规避人工审查,隐藏触发器和推理步骤。该研究揭示了推理型代码 LLM 在面临后门攻击时的脆弱性,强调了开发针对推理后门防御的迫切性。论文适合 LLM 安全研究者、AI 安全工程师及代码模型部署方阅读,以理解这类攻击的机理并思考防御策略。

💡 推荐理由: 代码 LLM 在软件开发中应用日益广泛,AKRASIA 展示了推理型代码模型可被隐蔽植入后门且能逃避现有防御和人工审查,对供应链安全和 AI 代码生成工具的可信度构成严重威胁,安全从业者需警惕此类新型攻击。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Wenhan Chang, Tianqing Zhu, Ping Xiong, Shiyi Liao, Wanlei Zhou

该论文提出 RISA(Response Inspection and Selective Actions),一种面向大型语言模型(LLM)的推理时拒绝行为校准框架。研究背景是:LLM 需要可靠地区分有害提示与良性提示,错误的拒绝行为要么导致有害内容被输出,要么错误地拒绝用户的有用请求。现有的训练时对齐方法需要更新模型参数,计算成本高;而推理时对齐方法(如上下文安全提示、激活引导、解码控制)大多在未检查初始响应是否已正确的情况下直接干预,可能破坏原本正确的拒绝或有用回答。针对这些问题,RISA 采取“先检查、后选择干预”的思路,在不更新底层模型的前提下,通过两步实现对拒绝错误的修正:第一步,使用固定的上下文规则为明确场景赋予拒绝分数;第二步,对规则未覆盖的场景,利用校准后的线性探针从最终层的提示隐藏状态中推导拒绝分数。为适应不同基础模型,RISA 分别校准探针分数、表示支持边界和动作阈值。运行阶段,RISA 将提示的拒绝分数与初始拒绝状态结合,通过动作策略仅在必要时进行干预。实验结果显示,RISA 能够提升拒绝可靠性,同时基本保持模型的有用性,为 LLM 中的响应感知拒绝校准提供了实用方案。该研究适合关注 LLM 安全对齐、推理时防御机制及红队评估的研究人员与安全工程师阅读。

💡 推荐理由: LLM 拒绝行为直接影响内容安全与可用性,RISA 提供了一种轻量、可适配的推理时校准方法,无需重新训练即可减少有害响应或误拒,适合集成到现有安全防护流程中。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)