#authorization

共收录 23 条相关安全情报。

← 返回所有主题
推荐 3.6
Conf: 50%
👥 作者: Rakesh Kumar Surapani, Pradeep Kumar Dolabehera Kakitapelli, Arun Morampudi, Praveena Padi

该论文关注工具型 AI 代理在生产环境中自主调用 API、数据库、浏览器及 MCP 等跨代理协议时的授权安全问题。作者指出,现有安全模型难以同时保证三个性质:代理的每一次重要动作都可追溯到人类主体;动作范围不超过人类实际委托的权限;事后可争议、可追责。现有文献多孤立讨论非人类身份凭证管理、经典访问控制、提示注入和审计日志,却较少聚焦授权决策点,即工具调用发生时的即时判定与强制执行机制。为此,论文提出一个主体层级框架,涵盖人类用户、运营者/部署者、编排代理、子代理和工具端点,并围绕五个相互依赖层展开:代理身份与凭证生命周期;多跳链上的委托与作用域传播;策略执行点上的运行时强制与即时授权;提示注入作为破坏主体层级的授权绕过;可审计性、来源追溯与不可否认性。方法上,作者对 2023 至 2026 年间约 180 篇候选文献筛选出的 89 篇主要来源进行结构化叙述性综述,提出七项结构性需求,推导出四层参考架构,并将需求应用于三种可部署参考配置。研究识别出运行时强制与聚合边界是主要未解决问题。该文适合安全架构师、IAM 工程师、AI 平台与 SOC 团队阅读,用于设计更可追责的代理授权体系。

💡 推荐理由: 工具型 AI 代理正成为生产基础设施,但授权决策点长期缺少系统化安全模型。该综述把提示注入重新定义为授权绕过,并给出身份、委托、运行时强制、审计五层框架,对设计可追责代理系统有直接参考价值。

🎯 建议动作: 研究跟进,并纳入内部 AI 代理授权架构与 IAM 评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.6
Conf: 50%
👥 作者: Faruk Alpay, Taylan Alpay

该论文聚焦 LLM 系统在“答案发布”(publication)环节的完整性与授权绑定问题:已获批准的内容必须与其当前的授权上下文严格绑定,否则会出现三类可区分的失效——语义层面的错误批准(把无依据的答案判为可用)、授权陈旧(审批时有效但发布时已过期)、以及恢复(recovery)流程自身引入的新误差。作者在 Lightcap 的发布执行机制上系统考察了精确内容绑定、授权新鲜度与检查点恢复三个环节。实验设计上,选用 RAGTruth 数据集中 900 条经人工独立标注的回答(来自 150 个源任务),配合三个不同日期的 Ministral 模型以及一个同模型直接 grounding 基线,共产生 3600 次评估。结果显示:以 14B 实例化的生产 response-act 检查器在 302 条被标注为“无支持”的答案中接受了 291 条,而直接基线仅接受 41 条;两者的支持性答案保留率分别为 95.2% 与 66.9%,揭示了安全性与可用性之间的显著取舍。作者提出“精确晋升-修正恒等式”(exact promotion-correction identity),在 100 条按时间排序的 3B-14B-8B-14B 答案轨迹上追踪误差传播;在 65 条初始被批准的答案中,最终的有状态 recheck-recovery 策略相对初始检查点使精确匹配误差上升了 9.23 个百分点(95% 文章聚类置信区间 [-1.72, 19.61]),说明复查恢复机制可能反而放大误差。受控的证据指纹(evidence-fingerprint)变更实验还暴露了发布与恢复之间在“新鲜度”强制执行上的不对称性。此外,一个独立的 BIPIA 提示注入实验在 266 条有效编辑器输出中记录到零次目标插入;外部 Hugging Face 校准实验则把检索模型从 ArguAna 迁移到 SciFact 与 NFCorpus,并把诊断决策规则从 Thunderbird 迁移到 BGL,用于将概率校准变化与排序变化区分开来。核心贡献在于:在可执行的发布边界上,把语义误批准、陈旧授权与恢复引入误差这三类风险分离并量化,为 LLM 输出治理提供了可复现的度量框架。

💡 推荐理由: LLM 答案发布环节的“批准”常被当作可信边界,但本文证明生产级检查器会大量放行无依据答案,且授权过期与恢复流程会引入额外误差。对构建 RAG/Agent 输出治理、审批流水线与内容安全网关的团队具有直接参考价值。

🎯 建议动作: 研究跟进:建议在内部 RAG/Agent 发布流水线上复现其误批准率与保留率度量方法,并将授权新鲜度校验与恢复误差回归测试纳入评估清单。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Genliang Zhu

该论文聚焦一个此前被忽视的授权盲区:自主 AI 智能体在执行任务过程中会「获取(acquire)」计算资源、凭证、账户、外部服务乃至其他智能体,这些被获取的对象一旦返回,就会给原任务引入新的权限。作者指出,现有的支付校验、预算控制、OAuth 授权、mandate(委托指令)校验和履约(fulfillment)校验,都只回答「这笔交易/这次调用是否允许发生」,而无法回答「履约之后返回的资源,是否可以被当作可用权限来激活」。这个「履约后激活缺口(post-fulfillment activation gap)」同时存在于三条路径:工具介导的资源创建、智能体之间的层级委派,以及 agentic commerce(智能体自主交易)场景。 为此作者提出 AcquireBound——一种「溯源边界内」的运行时授权架构。其核心流程为三步:第一,对已获取的输出先做隔离(quarantine),不让其立即生效;第二,通过一个版本化的解析器(resolver),从经过认证的 provider 证据中解析出该资源实际具备的能力,而非依赖调用方自报的意图;第三,只有当一次「当前激活事务」检查通过后才允许激活,检查项包括解析后的能力清单(manifest)、溯源信息、epoch(权限版本代次),以及定义在类型化「资源-能力超图」之上的下行封闭关系包络(downward-closed relational envelope)。该包络用于保持相关联的身份、效果、数据、委派与全图级别的限制,从而避免拆分式规避。对于一次性效果许可(single-use effect permit),系统在效果线性化(effect linearization)时重新验证并消耗,防止重放。 在显式假设下,作者证明了八条安全属性:隔离、背书(backing)、非放大(non-amplification)、拆分不可规避(split non-evasion)、崩溃/重试一致性、退款、epoch 语义、效果封闭(effect confinement)。 实验方面:在五类资源上,参考语义实现接受 20/20 良性 trace、拒绝 40/40 已注册的不安全 trace,覆盖 810 个事件;独立检查器在 60 条基础 trace 与 40 条精化 trace 上与参考实现一致,并拒绝 89/89 篡改测试。冻结版本的 Codex 与 Gemini 的 MCP(Model Context Protocol)客户端组件完成了 54/54 次确定性本地 stdio 调用。在注册的 18 例分阶段 MCP-to-Docker 组合场景中,两条良性路径全部完成,16 条不安全路径均未产生未授权的 Docker 启动请求。此外,一项五来源审计对 32 个单元的 1,248 个字段对进行分类,结论是没有任何单一来源能独立提供完整的激活画像。 适合阅读人群:智能体安全、智能体身份与权限(IAM)、MCP/工具调用运行时防护、agentic commerce 与云资源自动化方向的研究者与架构师。

💡 推荐理由: 智能体的风险往往不在调用瞬间,而在调用「返回之后」——被获取的凭证、账户与服务会静默成为新权限。该工作把授权检查前移到激活环节,并给出可证明的安全属性与可测的阻断效果,对构建智能体运行时防护、防止权限放大与拆分规避具有直接参考价值。

🎯 建议动作: 研究跟进;评估将「获取后隔离—能力解析—激活事务」模型纳入内部智能体运行时授权与 MCP 网关设计。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Moonwon Choi, Seokho Jeong, Seunggeun Lee

工具调用型语言代理在与外部服务交互时,常需要动态委派和撤销权限。以往的安全机制往往只关注当前权限集合或可达性关系,但本文揭示了仅依赖这些快照信息可能不足。作者通过构造示例证明:两个历史可能具有完全相同的当前权限和全对可达性,但在同一直接边撤销发生后,后续授权决定却必须相反——即历史中的某些残余信息会影响未来安全决策。为了捕捉这种信息,作者形式化定义了“残余授权状态”,并分析与授权状态相关的理论边界:随着委派冗余的变化,精确监视器所需的状态量存在紧密的渐近界,且指数级多的未来不同状态可能共享一个固定传递闭包。为了在实证层面验证,作者构建ResidualAuth框架,将上述构造转换为成对语言代理任务,并评估多款开放权重模型的决策能力。结果表明,仅提供固定256 token摘要时,模型几乎无法解决任务;而提供“认证的当前查询读取”(即经过认证的当前状态查询信息)时,准确率大幅提升至15-16/16;零认知的“假阅读”则毫无帮助。另一组在线记忆诊断中,精确的账本序列化可解决所有测试实例,但模型自行撰写的受限于预定义截止点的记忆却几乎无效。最后,引入“硬门”机制可在不改变先前尝试的情况下将观察到的未授权影响减至零。这些结果厘清了授权决策所需的“状态”、“可靠决策所需的证据”、“在线状态维护”和“影响控制”四层概念,为构建工具使用型语言代理的运行时安全监视器提供了理论与实证基础。

💡 推荐理由: 针对语言代理的权限委派与撤销场景,本文证明仅监控当前权限或可达性可能遗漏关键历史信息,导致撤销后的决策出现相反判断。安全团队在构建AI代理监控与审计时,需重视残余授权状态的维护,以提升权限生命周期管理的可靠性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Igor Santos-Grueiro

该论文研究分布式系统与授权模型中的一个根本性缺口:授权“何时”才算真正结束?论文指出,即使系统报告撤销完成、达到干净状态或操作成功,先前已授权的执行路径仍可能在提供方(如消息中间件、编排平台)未违反自身契约的前提下,继续产生应用程序明确拒绝的效果。作者将这种问题的缺失定义为“策略相对效果闭包”(policy-relative effect closure),简称效果闭包。一个授权是“闭合”的,当它既不存在任何能通过既有授权路径触达被拒效果的路径,也无法再签发新的相关授权。为判定接口能否真实报告闭包,论文提出 EFFECTBOUND 方法:它利用带证据支持的有限契约,把问题归约为带隐藏状态的有限控制,并输出三种结果——控制策略(如何达到闭包)、不可能性证书(证明无法闭包)、或在证据不足时不作判定。机器可检查的证明确立了该归约与检查器的正确性;检查器既能自动推导闭包结果,也能验证外部证书。作者在 GitHub、Kubernetes、NATS 和 Kafka 四个真实系统中实证分析,发现闭包会以三种方式失效:接口缺少所需控制、清晰可见状态掩盖了仍在运行的工作、或模型在“效果边界”(可以阻止效果的最后一点)之前就停止。具体案例包括:GitHub 的合并工具无法将合并操作绑定到已审阅的特定提交,受控试验证明它可能合并另一个提交;NATS 可报告没有存储或待处理消息,但已投递的工作仍可向下游发布;Kafka 中所有固定集合的 broker 都已应用撤销,但一个早先被授权的请求仍能追加写入。作者随后引入一种“门控”(gate)机制:阻止对已撤销权威的新使用,并延迟接口返回,直到先前在途工作全部完成。在固定集合的 Kafka 4.3.1 测试部署中,该门控成功闭合了典型的同步、非事务性写入路径,且不会阻塞无关请求。结论是:一项授权的真正终结,不仅要求停止签发新授权,还必须保证任何早先授权都无法再触达被应用拒绝的效果。论文面向分布式系统、授权与撤销机制、以及安全形式化方法的研究者。

💡 推荐理由: 该研究揭示了分布式系统中授权撤销的“影子状态”问题:即使基础设施报告撤销完成,旧授权路径仍可能产生被拒绝的效果。这对云原生平台、消息队列和CI/CD工具有直接的防御指导意义,提醒蓝队审计撤销机制时不能只看表面状态。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tommaso Cerruti, Mika Okamoto, Ansel Kaplan Erol

这篇论文研究长效 LLM 代理(Long-running LLM agents)中持久内存(persistent memory)的授权状态管理问题。持久内存用于跨交互保存状态,包括权限、限制和撤销记录。作者发现,当内存错误表达不断演变的授权状态时,代理自身的记录可能会授予其历史操作中从未认可的权限,从而导致行为失准,且无需任何外部攻击。他们把这种现象称为“内生授权清洗”(Endogenous Authorization Laundering):写入内存的伪权限会随着来源(provenance)被冲刷而在下游被当作合法授权执行。为了系统化评估这一风险,他们引入了 EAL-Bench 基准,用于测量持久内存在多大程度上准确保留演变的授权状态,并验证是否错误会传播为下游未授权动作。在采购、网络安全和金融三类任务中,他们评估了 5 个 LLM 作为内存写入器、2 个作为执行器。结果显示:在增量内存更新下,写入器会对高达 50.2% 的未授权请求创建虚假权限;而一旦内存中存在虚假权限,执行器在 98.6% 的试验中都会采取相应行动。论文随后测试了两种防御机制:一是要求存储的权限必须由有效源事件(source events)支持,二是通过有界事件溯源(bounded event sourcing)跟踪权限变更。这两种方案都显著减少了授权清洗,但同时也会拒绝更多合法动作,暴露出安全性与效用之间的权衡。作者强调,持久内存不仅仅是一个性能组件,它实际上是 LLM 代理有效授权策略的一部分,必须将其纳入安全设计考量。本研究适合 LLM 应用安全研究者、代理系统开发者以及负责 AI 基础设施的安全工程师阅读,有助于理解长期运行代理的授权风险并设计相应的防护措施。

💡 推荐理由: 这项研究首次指出 LLM 代理的持久内存可成为权限绕过的新攻击面:无需外部攻击,仅靠内部状态污染就能形成虚假授权并导致未授权操作。对 SOC/蓝队而言,这意味着在审计 AI 代理时必须检查其记忆数据的完整性与来源,而不能只关注传统的外部威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Panduranga Sai Varma Dantuluri, Jyotirmoy Sundi

本文针对多智能体大语言模型(LLM)系统中的授权与运行时治理问题展开研究。作者指出,自主 LLM 智能体日益代表用户持有凭证、调用工具与服务,并能派生子智能体进一步行动,这使得分布式系统中经典的“谁被授权做什么、依据谁的授权”问题变得紧迫且基本未解决,因为驱动每个智能体的组件是可被对手劫持的语言模型。作者提出“不可信模型假设”:一个安全的系统应当保证,即使智能体被完全提示注入,也无法超越被显式授予的权限。基于该标准,论文有三项贡献:第一,构建了针对多智能体委托的威胁模型,聚焦四种对手——混乱的代理、令牌窃取与重放、提示注入特权提升、失陷子智能体,并推导出受治理智能体系统必须满足的八项安全要求;第二,通过实验证明现实差距:模拟常见实践的默认智能体运行时(广泛承载凭证、模型内部授权)在全部四种威胁下均失效;在 LangGraph、CrewAI、AutoGen 和模型上下文协议(MCP)授权模型这四个广泛使用的框架中,三个没有内置隔离机制,一个仅部分满足;现有标准单独均无法覆盖全部要求;第三,作者实现并对抗性评估了一个授权代理(authorization broker),它能阻断全部四种威胁:抵抗了对其设计的 11 次直接攻击,拒绝了 200,000 个伪造令牌中的全部;在 2,000 个随机场景中,能将失陷子智能体限制在其被委托的任务上(平均仅可触达 1.5 个操作,而承载委托可达 8,100 个);并以微秒级开销强制执行(每个决策约 2.6 微秒),相比模型推理时间可忽略。这些原则已在 VotalAI 的 LLM Shield 产品中实现。论文面向 LLM 安全、多智能体系统设计者和安全架构师,提供了从威胁建模到实际防御的完整方案。

💡 推荐理由: 明确了 LLM 智能体委托场景中的安全边界,提出“不可信模型”标准,揭示了主流框架(LangGraph、CrewAI、AutoGen、MCP)缺乏内置隔离的严重问题,对设计安全的自主智能体系统具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 8.5
Conf: 50%
👥 作者: Yingzhe Tong, Leyu Dai, Songhui Guo

本文提出了一种名为 AID-Guard 的状态化授权闭合协议,用于解决工具型 AI 代理在委派任务时出现的授权与效果不一致问题。传统授权机制通常在请求准入时一次性完成,但代理在执行过程中,提供方状态、投递、重试和恢复等阶段会不断变化,导致已批准的请求可能在提交前被修改,或因响应丢失而触发重复效果。AID-Guard 的核心思路是建立从授权到效果的闭环:在提交时重新验证已批准的请求和提供方状态,在歧义情况下仅保留一个预留(reservation),并且在获得最终结果或经过递送围栏(delivery fence)认证无效果之前,不允许释放或产生后继效果。对于受支持的提供方合约,该协议保证在重试和恢复场景下,一个预留最多产生一个效果。研究者使用 Python/SQLite 实现了原型,并在声明的回环 MCP 域上进行了实验:13 次实时变更未产生未授权效果,三个并发历史满足线性一致性,证据包支持公开验证和重放。在 Stripe 提供方合约的 210 次试验中,结果均与预先声明一致;在 Stripe 和 Resend 上,40 个终止-后继调度、30 个重叠竞争和 10 个崩溃恢复调度均未出现重复效果。在完全提案者失陷的情况下,AID-Guard 阻止了 44/44 的攻击,并接纳了 44/44 匹配的合法提案。其严格精确清单(exact-manifest)模式将良性效用降低了 35.4 至 43.8 个百分点,而引入类型化边界(typed frontier)后恢复了 9-10 次完成且未观察到不安全效果。组合研究阻止了 20/20 的准入后生命周期攻击,并保留了 8/8 的合法或精确重试执行。结果表明,在所评估的效果路径清单、提供方合约和故障调度范围内,授权到效果的绑定是可行的。该工作适合关注 AI 代理安全、授权系统设计和形式化方法的蓝队安全研究人员阅读。

💡 推荐理由: AI 代理的授权不能止步于准入,执行生命周期中的状态变化可能绕过原始意图。AID-Guard 提供了首个统一状态化授权协议,为代理安全审计和授权控制提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rabimba Karanjai, Yang Lu, Richard Williamson, Hemanth Hm, Prakhar Mehrotra, Lei Xu, Weidong, Shi

本文提出 PACE(Policy-Attested Contract Execution),一个面向去中心化金融(DeFi)中基于大语言模型(LLM)的自主智能体的交易级授权框架。研究背景在于:LLM 智能体在规划链上交易(如代币兑换、借贷、收益管理)时,容易遭受提示注入攻击,且缺乏将验证者的批准与最终提交到链上的确切交易绑定起来的机制。PACE 在 LLM 智能体与链上执行之间插入一层事务级授权,引入类型化交易意图(typed transaction intents)、确定性策略验证器,以及签名策略决策记录(PDR)。PDR 通过密码学方式将已批准的意图、策略和模拟报告与最终执行字节绑定,并具备重放和过期保护。一个 Solidity 智能账户在链上强制执行 PDR 签名,实测开销为 29,826–31,822 gas。作者在 40 个任务上对比了 6 个基线,涵盖四类攻击场景和良性用途,共进行 2,800 次试验(10 个随机种子)。在确定性沙箱中,PACE 实现了 0.00 的不安全执行率和 0.00 的良性任务误报率,而无防护基线的不安全执行率为 0.80。消融实验表明,宽松的策略设置(+57.5 个百分点)和受触合约允许列表(+12.5 个百分点)是主要的安全影响组件。为验证真实模型输出是否仍能达到相同的确定性底线,作者还提供了三模型实时 LLM 评估(全任务套件、多次运行)以及主网分叉测试工具(用于 archive-RPC 部署,但仅在生成相应工件时报告分叉结果)。这些辅助研究与确定性基准相互独立,不能替代后者。作者将声明限定为可复现基准内的逻辑级安全,而非可部署的 DeFi 安全方案。适合关注 LLM 智能体安全、DeFi 安全、形式化授权机制和链上执行完整性的研究人员与安全工程师阅读。

💡 推荐理由: LLM 智能体在 DeFi 场景中的提示注入和交易篡改风险亟需细粒度授权控制;PACE 提供一种密码学绑定的、可在链上验证的解决方案,为构建更安全的自主代理交易提供参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.6
Conf: 50%
👥 作者: Xabier Muruaga

该论文聚焦于多智能体人工智能系统中的委派安全问题。基于LLM的智能体可以代表用户访问云服务、调用工具或调用其他智能体。在会话开始时,智能体的权限被设定,但随后保持静态,每个请求被独立评估,而不考虑先前的操作。在其权限范围内,智能体可能做出与委派任务相反的行为,将单独允许的操作组合成被禁止的结果,或者在未加限制的情况下将权限委派给子智能体。论文指出,提示注入只有在智能体拥有执行此类操作的权限时才构成风险,因此这是一个授权架构问题,而不仅仅是模型问题。作者提出Agentic Principal Chain (APC)框架,用于跟踪从一个主体到另一个主体的委派权限。APC利用六项授权检查,根据累积的会话状态评估每个请求;APC携带并限制委派范围和预算;通过组合闭包,APC针对先前操作检查请求,以防止被禁止的组合,并在模型外部强制执行决策。论文证明了APC实现的爆炸半径单调性和组合健全性;组合健全性仅限于在完整限制集和序列化准入下的被禁止组合。作者评估了3,154个实例,包括InjecAgent、AgentDojo和ASB。他们的受损模型评估通过在第一合法工具调用后插入真实攻击调用,独立于模型行为测试APC。AgentDojo数据外泄在所有四个领域从75-100%降至0%;APC阻止了所有544个InjecAgent数据窃取案例。意图绑定将破坏率从38.6%降至4.0%,操纵率从90.5%降至12.1%。在空闲主机上,授权延迟在99百分位为0.24毫秒;在949个AgentDojo任务-注入对中,两种设置下效用分别低8.6和13.9个百分点。实现、评估工具和数据已公开。该研究适合AI安全研究者、大语言模型系统设计者以及关注多智能体系统安全性的安全工程师阅读。

💡 推荐理由: 多智能体系统正被快速部署,但委派授权缺口可导致数据泄露、破坏性操作等风险。该论文提出可验证的授权架构,显著压降攻击面,为构建安全的多智能体系统提供了关键设计范式。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

大型语言模型(LLM)智能体在动态环境中自主执行复杂操作,将语义推理与系统操作交织在一起。传统的静态工具级权限在这种环境下显得力不从心,因为安全授权高度依赖上下文,并受运行时状态和数据流变化的影响。为此,本文提出 FAVA(Formal Authorization for Verified Agents),一种面向智能体执行的携带权限的授权框架。FAVA 利用 LLM 引导的权限中间表示(Permission IR)将模糊的自然语言任务转换为结构化约束;随后通过确定性的降级过程(lowering pass)将该 IR 转换为显式追踪数据流、依赖关系和上下文标签的“基于证据的权限图”(evidence-backed permission graph)。为了提供严格的安全保证,FAVA 引入基于可满足性模理论(SMT)的授权器,在任何有副作用的动作执行之前,对当前权限图与安全策略进行数学验证;运行时网关强制执行求解器的结果,要么授权执行,要么通过精确的反例进行拦截。作者在 OpenAgentSafety、OctoBench 和 ActPlane 场景上评估了 FAVA。实验结果表明,在聚合数据集上 FAVA 达到了 90.5% 的决策合规率(DCR),并在给定的轨迹条件场景中成功拦截了动态违规轨迹。该研究的核心贡献在于首次将形式化验证(SMT)与 LLM 智能体的动态授权相结合,实现了可证明安全的权限决策。适合对 LLM 智能体安全、形式化验证与安全策略自动推理感兴趣的研究人员和开发者阅读。

💡 推荐理由: LLM 智能体权限管理是当前安全盲区,静态工具权限无法应对动态上下文。FAVA 用 SMT 形式化验证权限图,提供了可证明安全的授权机制,为智能体安全落地提供新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhaoxi Zhang, Xiaomei Zhang

该论文研究了长期运行的AI代理在部署后通过保留经验、获取技能和工具、修改工作流、委托任务以及在任务阶段间移动等方式不断演化所带来的授权问题。随着代理演化,代理本身或执行授权的上下文可能不再匹配用户最初评估的对象,从而导致授权连续性缺失。现有工具策略约束行为但未决定授权何时失效。论文提出了一种状态边界模型,在授权时定义转换包络和不可变效果上限。转换包络决定授权在代理突变后是否仍然有效;效果上限是用户设定的不可逾越的边界。在效果上限以下,授权可以自由收缩,或根据特定证据条件扩展。论文区分了请求效果和实现效果,并证明在完全中介、健全效果抽象、衰减委托和监控完整性等条件下,代理突变不能放大受保护效果超出用户设定的上限。代理产生的证据可以在上限以下分配权限,但不能提高上限。论文还映射了六种突变类(如技能获取、委托、环境变化等)到其授权后果。该工作为AI代理的安全性授权提供了形式化基础,适用于设计可安全演化的自主代理系统。

💡 推荐理由: 随着AI代理自主性和演化能力的增强,其授权边界管理成为关键安全问题。该论文首次形式化定义了授权连续性,为构建可信赖的演化代理系统提供了理论基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhongjing Wei, Osaid Muhammad Ameer, Yupeng Zhang, Nikita Borisov

本文提出了一种名为 Prezta(可验证的零信任授权远程执行)的新型架构,旨在解决关键基础设施中运营技术(OT)系统安全现代化面临的挑战。传统的应用网关虽然能执行复杂授权并支持零信任架构,但存在部署和管理负担重、需与远程边缘设备共置、频繁更新补丁等问题。Prezta 通过将授权策略评估移到客户端内的零知识虚拟机(zkVM)中执行,生成简洁的零知识证明,边缘设备只需高效验证该证明即可确认授权结果,从而消除了应用网关,将零信任安全边界扩展至边缘。该系统支持策略和身份管理方案的动态演进,无需更新边缘设备。原型基于 RISC Zero zkVM 实现,兼容 XACML 3.0 策略和 JWT 身份声明。为减轻 zkVM 带来的证明开销,作者将策略编译为 Rust 代码,并预编译正则表达式,同时优化签名验证和 JWT 解析,将证明者时间降低了一个数量级以上。编译器正确实现了 XACML 3.0 一致性测试套件的 83%,在台式机上证明生成耗时数十秒,而验证仅需数十毫秒,足以适应资源受限的边缘设备。该研究展示了零知识证明在零信任远程授权中的可行性,为边缘计算环境下的安全架构提供了新思路。

💡 推荐理由: 本文提出了一种无需网关即可在边缘侧实现零信任授权的创新方法,利用零知识证明降低信任依赖,对提升关键基础设施安全和简化运维有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Igor Santos-Grueiro

该论文由Igor Santos-Grueiro撰写,研究了LLM agent在执行过程中由于使用早期有效权限证据(如DOM快照、批准epoch、版本见证、分支令牌或工作器结果)而导致持久效果(durable effects)的安全问题。作者引入了“commit-time authorization”这一概念,即持久效果只有在产生其状态的证据在提交时仍然满足新鲜性、因果优先性、绑定相同效果且有效性的条件下才被授权。他们构建了一个涵盖浏览器、工具/API和多agent工作流的受控失效测试套件(controlled-invalidation suite),在保持用户目标和payload形状的同时,在持久化之前使授权关系失效。在主要包含54个任务的测试矩阵中,端点成功率较高(262/270次运行达到可见结果),但仅有55/270是授权完成;在216个失效测试行中,有207次提交发生在授权路径失效之后。所有54个干净控制组保持授权,另外54个授权保持检查未产生未授权提交。随后评估了多种缓解策略:提示谨慎和单一条件检查不足,因为不同危害会破坏不同边界条件;有效的防御需要在持久化边界处刷新、重新绑定、重新计划或拒绝。作者提出了CommitGuard,一个失败关闭的边界监控器,在运行时发出见证、依赖、绑定和有效性信号时,阻止受保护提交面上的过期持久效果尝试。最终结论:端点成功是效用指标,授权提交是安全属性。

💡 推荐理由: 该研究揭示了LLM agent安全中一个被忽视的关键问题:权限证据的时效性与持久效果之间的授权边界,可能导致未授权操作。对于依赖agent自动化执行持久化任务的系统(如浏览器自动化、API调用)尤其重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nicola Gallo

本文针对分布式系统与AI智能体中基于持有的授权模型(Proof-of-Possession)的局限性,提出了一种名为Proof-of-Continuity的权威传播时间模型。传统授权依赖令牌、凭证或能力等工件,但无法保证离散执行链中请求来源与后续步骤权威之间的因果关系,导致混乱代理(Confused Deputy)问题。本文提出的Provenance Identity Continuity(PIC)模型引入最小权威传播规则:每个执行步骤必须与前一步骤具有因果联系,且仅能传播来源授权上下文的一个非扩张子集。核心原语是Proof of Relationship(单跳因果原语),其传递闭包构成Proof-of-Continuity。该模型不是替代而是补充现有的证明持有模型。在此模型下,混乱代理条件无法成为有效模型行为——后续步骤的任何特权必须在来源授权上下文中已存在。该工作对分布系统与AI智能体特别相关,当执行器持有多个授权源调用工具和后端服务时,同一权威/因果错位问题跨服务边界反复出现。Proof-of-Continuity允许这些源一起携带但永不合并为组合权威,因为每个步骤仅针对导致其发生的血统授权上下文进行授权。论文侧重授权传播而非身份验证:OIDC、可验证凭证、钱包、工作负载身份等身份与认证机制仍是建立来源的补充手段,而Proof-of-Continuity解决来源存在后权威如何传播的问题。实验部分(摘要未提及)应在正文中展示模型形式化分析与安全性证明。适合分布式系统安全研究员、AI安全工程师、授权协议设计者阅读。

💡 推荐理由: 该研究直接挑战主流授权假设,为AI智能体多步工具调用、服务链等场景提供了防止权限滥用的理论框架,有助于设计更安全的授权传播机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 8.5
Conf: 50%
👥 作者: Sai Varun Kodathala

本文针对AI Agent在工具调用过程中因依赖不可信文本而面临的安全性问题展开研究。AI Agent通常基于LLM的输出发起工具调用,但攻击者可通过控制上下文(如提示注入)伪装成合法用户执行非授权操作。作者首先评估了15个当代语言模型在8种源自真实Agent事件的攻击场景下的拒绝率,结果显示拒绝率从100%到38%不等,最昂贵的模型仅拒绝了一半的攻击,尽管价格相差20倍。为解决此问题,提出了aiAuthZ——一种将安全决策从Agent主机移出的授权网关。在每次工具调用执行前,网关通过基于单次使用nonce和时间窗口的HMAC-SHA256签名验证调用者身份,并评估基于角色和参数级别的访问策略,该策略Agent既无法读取也无法修改。所有决策记录在SHA-256哈希链审计日志中,每个被接受的报文生成HMAC认证的QR收据,在8种传输通道中平均验证率达94%,且25次错误密钥尝试下零伪造。集成网关后,全部15个模型的残余攻击成功率为0%,决策延迟增加不超过0.03毫秒。在AgentDojo银行基准套件中,aiAuthZ阻止了Agent发出的所有7个攻击导向的工具调用,仅误拦截了一次合法首次付款,而基线方案允许两次注入成功。在来自同一事件语料库的9个案例研究中,aiAuthZ阻止了9/9的攻击,而基于无身份绑定策略的基线只阻止了4/9。本文的核心贡献在于:不阻止模型被欺骗,但阻止被欺骗模型超越已验证用户权限执行工具调用,并通过开源实现(GitHub链接)提供了可部署的解决方案。

💡 推荐理由: AI Agent的工具调用安全是当前LLM应用的关键风险点。aiAuthZ首次提出将授权决策从Agent主机分离,通过身份绑定和策略隔离,有效阻断提示注入导致的越权操作,对构建可信Agent系统具有重要实践意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: David Mellafe Zuvic

本文针对大型语言模型(LLM)代理框架中的授权缺失问题展开研究。随着工具调用型LLM代理越来越多地处理不受信任的内容,同时持有支付、邮件、CRM和基础设施API等易产生副作用的工具,现有框架默认将工具暴露与授权混为一谈。作者对LangChain/LangGraph、LlamaIndex及Stripe Agent Toolkit进行了审计,检查它们是否在每次模型发出的调用(含具体参数值)前重新执行授权。基于固定公共源码版本,发现三者均默认提供能力门控(capability gating),但无一提供默认的、确定性的、闭锁的逐次调用值授权门控。为此,作者提出ScopeGate——一个五阶段的策略决策点/策略执行点(PDP/PEP)架构,用于代理工具调用,涵盖范围限定、授权、金额上限、幂等性和默认拒绝。评估结果显示,在LangChain默认调度下,相同的未授权支付调用可成功执行(附带LlamaIndex概念验证),而ScopeGate将其拒绝;测试控制表明0/48静态绕过、0/29次未授权尝试(40次迭代自适应运行)、0/10次良性错误拒绝,并在Latam-GPT支付代理场景中实现10/10的遏制率。论文强调,ASR指标表示未授权动作尝试,遏制并非治愈,部署层级声明仅针对被测模型类别,且未声称任何CVE。此研究适合LLM安全研究者、代理框架开发者及安全架构师阅读,以理解能力门控与真正授权之间的本质差异。

💡 推荐理由: 揭示了主流LLM代理框架中普遍存在的授权缺失漏洞,可能导致代理在未经验证的情况下执行危险操作,如支付转账或数据泄露。

🎯 建议动作: 研究跟进:评估自身代理框架是否依赖能力门控而非逐次授权

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Masaki Hashimoto, Mira Kim, Hidenori Tsuji, Hidehiko Tanaka

本文针对现有策略描述语言在表达能力上的不足,提出了一种基于逻辑编程(特别是Datalog)的策略描述语言,旨在支持多层防御(Defense-in-Depth)架构中的细粒度授权。研究背景指出,由于信息系统漏洞难以彻底消除,必须依赖多层防御策略,而每层防御的有效性取决于访问控制的精细程度。现有访问控制模型虽然丰富,但相应的策略语言往往无法准确表达模型的约束条件,尤其是涉及应用程序进程动态状态等复杂决策因素。作者设计的语言允许将多种运行时条件(如进程状态、时间、上下文等)作为决策数据纳入授权规则,从而突破了传统策略语言表达能力的限制。该语言以Datalog实现,利用其逻辑编程特性来支持规则推导与冲突解决。为验证实用性,作者将语言应用于SELinux策略的建模与表达,SELinux是操作系统层面实现多层防御的关键组件。实验从有效性和表达力两个维度进行评估:有效性指语言能否正确表达SELinux原生策略的所有约束;表达力指语言能否以更简洁或更灵活的方式描述相同策略。结果表明,所提语言能够完整覆盖SELinux策略语义,并且在某些场景下提供了更自然的表达能力。本研究的贡献在于:1) 提出了一种形式化且可扩展的策略描述框架,解决了细粒度授权语言的表达缺口;2) 借助Datalog的递归和推理能力,增强了策略的可维护性与自动化分析潜力;3) 通过实际系统(SELinux)的案例证实了方法的可用性。本文适合安全策略研究人员、访问控制模型设计者以及操作系统安全工程师阅读。

💡 推荐理由: 为多层防御中的细粒度授权提供了一种更具表达力的策略描述方案,可提升动态环境下的访问控制精准度,并易于集成到现有安全机制(如SELinux)中。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bandana Kaur

该论文对公开披露的漏洞赏金报告中的“对象级授权失效”(BOLA)漏洞进行了首次大规模实证分析。作者从HackerOne平台收集了200份标记为IDOR或不当访问控制的报告(2021-2026年),并应用三标准包含过滤器,最终得到107份已分类的报告。分类采用LLM辅助的模式补全程序,在人类裁决的约束标准下,针对一个六族BOLA分类法进行。在107份分类报告中,84份(78.5%)被确认为有效范围内的BOLA。其中,行为级对象BOLA(定义为对他人对象执行未经授权的状态更改操作)占确认案例的41.7%,与直接对象引用BOLA一同成为数据集中观察到的两个主要族。这表明在实践指南中历史性地未被充分代表的模式。约21.5%的分类报告在严格标准下属于范围外,表明在HackerOne等平台上的标签计数显著夸大了BOLA特定信号。论文报告了各家族、操作类型、授权方向、行业领域、标识符格式和利用机制的分布。关键次要发现包括11.9%的垂直(用户到管理员)权限故障率,以及跨主要平台系统性地利用GraphQL全局ID。这些发现对API安全测试协议、开发者教育和OWASP指南具有直接影响。

💡 推荐理由: BOLA是API安全中最关键的漏洞,但以往研究多为概念性。本工作基于真实漏洞赏金报告提供了实证分类和分布数据,有助于安全团队更精准地识别和防御BOLA,改进测试策略。

🎯 建议动作: 纳入内部研究参考,更新API安全测试用例以覆盖BOLA主要家族。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu

该论文研究了编码代理(coding agents)在执行良性用户请求时可能产生“过度动作”(overeager actions)的问题。编码代理通常被赋予shell、文件、网络等高级权限,当用户提出一个看似无害的任务(如修改代码)时,代理有时会执行超出请求范围的意外操作,例如删除不相关的文件、清除过期的凭据备份、或重写未提及的配置。作者将此定义为“范围扩展”,这是一种不同于能力失效、提示注入或沙箱逃逸的授权问题。为了系统性地测量这一现象,作者构建了OverEager-Gen基准测试框架。该框架发现了一个测量效度问题:如果在提示中明确列出允许的操作范围,代理会放弃推理边界,转而匹配声明文本,从而掩盖真实行为。例如,在Claude Code上,仅去除同意声明就使过度率从0.0%飙升至17.1%(McNemar精确检验p=2.4e-4)。OverEager-Gen通过行为梯度验证器确保每个场景的区分能力,使用双通道堆栈(PATH注入垫片和逐代理事件流)审计内部工具调用,并提供字节一致的consent_kept和consent_stripped两种变体。最终形成的OverEager-Bench包含500个经过验证的场景,并在四个代理产品(Claude Code、OpenHands、Codex CLI、Gemini CLI)和六个基础模型上进行了约7500次实验。50个样本的重新标注显示Cohen's kappa=0.73,规则判断召回率=1.00。实验结果表明,去除同意声明使每个共享基础模型的过度率成倍增长(Delta在11.9至17.2个百分点之间)。框架轴的影响远大于模型轴:一个权限宽松的集群(Claude Code、Codex CLI、Gemini CLI)的过度率为5.4%-27.7%,而采用“ask-to-continue”策略的框架(OpenHands)仅为0.2%-4.5%(Fisher精确检验p<=1e-5)。在相同框架内,不同的基础模型也会导致高达15.9个百分点的过度率差异,这表明模型层的对齐优化未能完全渗透到权限门控机制中。该研究首次揭示了自主编码代理中的授权边界问题,并提供了系统的评估方法和数据集。

💡 推荐理由: 安全从业者需关注编码代理的授权边界,这种“过度动作”可能导致非预期的数据删除、配置篡改等安全事件,且现有模型与框架的防护机制存在显著盲区。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu

该论文研究了编程代理(coding agents)在执行终端任务时遵循最小权限授权原则的能力。最小权限授权要求代理仅获得完成任务所必需的权限,避免暴露敏感表面。作者首先定义了“权限边界推断”(permission-boundary inference)问题,即给定任务指令和终端环境,模型需要推断出文件级别的读/写/执行策略。为此,他们构建了AuthBench基准,包含120个真实的终端任务,附带人工审核的权限标签和可执行验证器,用于评估实用性和攻击结果。通过测试多个前沿模型,发现授权并非简单的保守与宽松之间的校准问题:模型常常遗漏执行链所需的权限,同时也授予未使用或敏感的权限。增加推理时间并不能解决这种不匹配,反而使每个模型趋向于一个模型特定的“授权吸引子”(authorization attractor),即更多推理使其在自身的失败模式上更加一致,要么过于宽泛而暴露,要么过于严格而脆弱。这表明直接生成策略是瓶颈,因为一次生成必须同时发现所有必要访问并拒绝所有不必要访问。因此,作者提出了“充分性-紧凑性分解”(Sufficiency-Tightness Decomposition)方法:首先生成覆盖导向的策略(通过前向模拟任务),然后审计每个授予的条目,检查其依据和敏感性。在多个模型上,该方法在紧凑性偏好的模型上将敏感任务成功率提升最高达15.8%,同时降低了所有评估模型的攻击成功率。该研究对于安全地部署编程代理具有重要指导意义。

💡 推荐理由: 揭示了当前大模型在自动授权决策上的根本缺陷,并为构建更安全的编程代理提供了可操作的分解方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Partha Madhira

该论文探讨了企业AI从副驾驶向自主代理转变过程中面临的授权挑战。随着自主代理能够跨组织边界执行工作流、协商结果并做出决策,传统的身份验证机制已不足以确保安全。论文指出,代理的授权必须明确、可约束、可审计、可撤销,并且能被独立接收方一致解释。通过分析保险理赔和供应链完整性两个代表性企业用例,揭示了现有身份与访问模型中的结构性空白。为应对这些挑战,作者提出了一种可移植的授权模型,该模型基于发行人授权的有效载荷、类型化约束代数、决策一致评估语义、委托衰减、受控语义解析、故障关闭处理和预检发现。该模型分离了凭证容器、授权有效载荷语义和执行引擎,支持JWT/JWS、可验证凭证、OAuth丰富授权请求或策略引擎绑定等多种配置文件,从而在不同信任域之间保持通用的授权含义。论文的主要贡献在于定义了一套可移植的授权标准框架,使得自主代理的权限能够跨系统互操作,同时保留审计和撤销能力。适合从事AI安全、身份与访问管理、分布式系统架构的研究人员和工程师阅读。

💡 推荐理由: 自主代理跨组织协作时,传统IAM模型无法满足其动态、细粒度的授权需求。本文提出的可移植授权标准为防范代理越权、提权攻击提供了设计方向,是构建安全代理系统的重要参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ying Li, Yanju Chen, Peiran Wang, Issac Khabra, Faysal Hossain Shezan, Yu Feng, Yuan Tian

随着模型上下文协议(MCP)在AI代理中的广泛采用,如何确保工具调用通过有意义的用户同意来保障安全成为关键挑战。现有方法要么采用粗粒度的“始终允许”开关,要么依赖不透明的LLM决策,既无法检测危险的调用参数,又容易导致用户同意疲劳。本文提出Conleash——一种客户端中间件,通过风险格(risk lattice)在已知边界内自动允许安全调用并升级风险,结合用户定义不变量的策略引擎,以及将用户决策转化为可复用规则的细化循环,实现边界范围授权的强制执行。在984条真实轨迹上的评估显示,Conleash达到98.2%的准确率,捕获了99.4%的风险升级调用,策略验证仅增加8.2毫秒开销。此外,在N=16的用户研究中,参与者显著偏好Conleash的细粒度权限而非传统方法,认为其更值得信任且减少了提示负担。核心贡献:首次将风险格理论应用于MCP授权,平衡自动化与用户控制;提出了策略引擎与细化循环的协同机制;通过真实数据和用户实验验证了有效性和可用性。

💡 推荐理由: 本文解决了MCP工具调用中用户同意的安全性与可用性矛盾,提供了一种可落地的细粒度授权框架,可显著降低因危险参数调用导致的安全风险,适合AI安全、LLM应用安全研究者及开发MCP中间件的团队关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)