👥 作者: Genliang Zhu
该论文聚焦一个此前被忽视的授权盲区:自主 AI 智能体在执行任务过程中会「获取(acquire)」计算资源、凭证、账户、外部服务乃至其他智能体,这些被获取的对象一旦返回,就会给原任务引入新的权限。作者指出,现有的支付校验、预算控制、OAuth 授权、mandate(委托指令)校验和履约(fulfillment)校验,都只回答「这笔交易/这次调用是否允许发生」,而无法回答「履约之后返回的资源,是否可以被当作可用权限来激活」。这个「履约后激活缺口(post-fulfillment activation gap)」同时存在于三条路径:工具介导的资源创建、智能体之间的层级委派,以及 agentic commerce(智能体自主交易)场景。
为此作者提出 AcquireBound——一种「溯源边界内」的运行时授权架构。其核心流程为三步:第一,对已获取的输出先做隔离(quarantine),不让其立即生效;第二,通过一个版本化的解析器(resolver),从经过认证的 provider 证据中解析出该资源实际具备的能力,而非依赖调用方自报的意图;第三,只有当一次「当前激活事务」检查通过后才允许激活,检查项包括解析后的能力清单(manifest)、溯源信息、epoch(权限版本代次),以及定义在类型化「资源-能力超图」之上的下行封闭关系包络(downward-closed relational envelope)。该包络用于保持相关联的身份、效果、数据、委派与全图级别的限制,从而避免拆分式规避。对于一次性效果许可(single-use effect permit),系统在效果线性化(effect linearization)时重新验证并消耗,防止重放。
在显式假设下,作者证明了八条安全属性:隔离、背书(backing)、非放大(non-amplification)、拆分不可规避(split non-evasion)、崩溃/重试一致性、退款、epoch 语义、效果封闭(effect confinement)。
实验方面:在五类资源上,参考语义实现接受 20/20 良性 trace、拒绝 40/40 已注册的不安全 trace,覆盖 810 个事件;独立检查器在 60 条基础 trace 与 40 条精化 trace 上与参考实现一致,并拒绝 89/89 篡改测试。冻结版本的 Codex 与 Gemini 的 MCP(Model Context Protocol)客户端组件完成了 54/54 次确定性本地 stdio 调用。在注册的 18 例分阶段 MCP-to-Docker 组合场景中,两条良性路径全部完成,16 条不安全路径均未产生未授权的 Docker 启动请求。此外,一项五来源审计对 32 个单元的 1,248 个字段对进行分类,结论是没有任何单一来源能独立提供完整的激活画像。
适合阅读人群:智能体安全、智能体身份与权限(IAM)、MCP/工具调用运行时防护、agentic commerce 与云资源自动化方向的研究者与架构师。
💡 推荐理由: 智能体的风险往往不在调用瞬间,而在调用「返回之后」——被获取的凭证、账户与服务会静默成为新权限。该工作把授权检查前移到激活环节,并给出可证明的安全属性与可测的阻断效果,对构建智能体运行时防护、防止权限放大与拆分规避具有直接参考价值。
🎯 建议动作: 研究跟进;评估将「获取后隔离—能力解析—激活事务」模型纳入内部智能体运行时授权与 MCP 网关设计。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang
该论文关注编码智能体(coding agent)过程溯源问题。现有做法多为对智能体最终产出的补丁(patch)打水印,只能为提交的产物提供来源证据,却无法验证产生该产物的可见执行轨迹(trajectory)是否被篡改;而行为水印方法通常只给出全局性的"是否检测到"或"恢复标识符"信号,因此当轨迹被局部编辑后,仍可能保留足够的归属证据,却无法指出哪一段受保护区域已变得不一致。为此作者提出 TrajMark:一种无需训练、对称密钥、且对用户可见(visible-only)的轨迹水印框架,其核心思想是将"鲁棒的归属认定"与"脆弱的局部完整性校验"解耦为两层。第一层是稀疏所有者层,通过把自然发生的部分 READ 动作改写成带密钥的线性方程,来编码一个六比特的部署标识符;第二层是定位层,插入相互链接的普通、分组与终结"封条",以对受保护的关键动作片段作出承诺。两层分离带来两个性质:归属证据可以跨轨迹稳健累积;而局部修改会扰动附近带密钥的承诺,从而暴露受影响的具体协议区域。论文还给出所有者可恢复性、完整性碰撞概率、结构开销与定位行为的设计层分析。实验覆盖三种编码智能体框架与三种大模型:在所有干净且完整含水印的批次中均能恢复出准确所有者;在穷举式合格单点攻击下检测出 95.5%~100% 的编辑;在随机单动作破坏下,能把 95.8% 的篡改位置定位到一个被接受的协议区域(而非具体到单个动作)。所有者标记不增加额外轨迹动作,完整性层增加显式的只读封条;匹配条件下 Pass@1 为 26.9%,未加水印对照为 26.3%,说明性能开销很小。
💡 推荐理由: 编码智能体轨迹正成为审计与追责的关键证据,但现有水印只保护最终产物、不认证过程。TrajMark 把"谁拥有"与"哪里被改"拆成两层,可在几乎不影响任务成功率的前提下同时支持归属认定与篡改区域定位,对智能体供应链审计、事件溯源与合规取证有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kentaro Oda
该论文提出 Attestream,一种基于区块链的架构,用于间歇性交付的数据集流,解决持续产生且商业价值高的数据(如传感器流、遥测数据、机器学习训练数据)提供商无法验证数据是否被实际使用的问题。核心思想是将持续交付与可验证的使用报告绑定:数据集准备、双重签名交付、衍生品创建(如模型)及分发等全生命周期事件,均以不可否认且相互关联的生命周期记录追加到链上注册表中。该机制要求可证明的转移而非代币化,普通合约存储、ERC-721 代币及锚定链下收据可作为同一协议的可互换表示。一个使用感知门控会在报告窗口内未注册衍生品创建记录时暂停消费者流,该门控在下一交付交易中惰性评估,不增加额外交易开销。此外,一个模态可插拔的指纹层可将任何泄露副本绑定到对应消费者的双重签名交付记录,已针对表格/地理空间数据、图像和文档实现。作者用 Solidity 合约配合 EIP-712 双重签名实现了注册表并评估:完整生命周期普通记录消耗 657k gas(rollup 上约 0.13 美元;ERC-721 代币化每记录增加约 30k gas);在 50 消费者池中,泄漏归因在 40 条泄露表行下达到 100% 准确率并抵御中等噪声,能抵抗 JPEG 质量 30 的重新压缩,对文档的改写容忍度高达 30%。论文适合关注数据安全、区块链应用、机器学习数据供应链和数字版权管理的读者。
💡 推荐理由: 针对数据流泄露与不可见使用问题提出链上可验证生命周期方案,创新地将门控与指纹结合,为安全社区提供了一种可审计的数据分发与溯源思路,尤其对敏感数据交易场景有参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Jafrin Hossain, Nur Al Hasan Haldar
长期运行的大语言模型(LLM)智能体在与不受信任的内容、持久化内存、外部状态和敏感工具交互时,面临严重的安全风险。现有的安全分析往往以恶意输入与下游动作之间的执行步数来衡量攻击的距离,但本文指出,对于有状态的智能体,这种时间上的距离可能高估了安全隔离效果。为此,作者提出了一种基于溯源(provenance)的执行图,通过确定性状态、标识符和工具溯源将智能体事件关联起来,并定义了“影响距离”(DI),即从不可信源到敏感动作的最短结构路径。他们将其与常用的“序列距离”(DT,即在有序轨迹中最短的注入-汇聚路径)进行比较。由于影响图包含所有序列边,因此 DI ≤ DT;它们的差距 Gap=DT-DI 量化了被步数隐藏的安全分离。作者在 AgentDojo 数据集上进行了大规模实验,使用 OpenAI 的 gpt-4o-mini 和 gpt-4o 以及 Claude 的 Haiku 4.5 和 Sonnet 4.6 等模型,涵盖 360 条长期轨迹中的 454 对注入-汇聚点。结果显示,96.9% 的对具有 Gap>0,中位数为 9 跳;即使移除最大的仅溯源边类别,91.0% 的对仍然解耦。在 AgentDojo 的银行测试套件中,377 条轨迹中的 231 对中有 33.8% 通过不同的溯源机制解耦。在 274 对 OpenAI 数据中,控制 DT、攻击类型和后端后,Gap 不能独立预测攻击成功(β=0.066,p=.088)。在匹配阈值 k=2,3 时,基于 DI 的确定性预执行门控能够阻止仅序列门控遗漏的 5 个攻击汇聚点,且没有额外的良性阻断,但配对增益不显著(p=.0625)。因此,执行结构揭示了被步数掩盖的接近性,可以支持有针对性的运行时干预。本文度量的是候选影响路径,而非因果归因。这项工作为 LLM 智能体的安全评估提供了新的视角和工具。
💡 推荐理由: 该研究首次从执行结构与溯源视角量化长周期 LLM 智能体的安全暴露,揭示仅依赖步骤数会严重低估风险的接近程度,为安全团队设计运行时门控和攻击面评估提供了更精确的度量基础,对构建安全的智能体系统具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhongrui Sun, Jiahao Chen, Oubo Ma, Yuwen Pu, Zhou Feng, Haibo Hu, Shouling Ji
本文针对大型语言模型(LLM)在再分发、适配和透明API服务场景下所有权难以验证的问题。由于模型可能被微调、量化或通过黑盒API提供服务,传统的基于内部权重或部署记录的验证方式不再可靠,因此需要一种可通过黑盒交互观察的行为签名。现有黑盒指纹方法通常依赖固定查询-密钥关联,将模型身份压缩为少数记忆化关联,与模型日常行为脱节,导致鲁棒性差且容易被察觉。为此,作者提出PROSE(Provenance through Relational Organization of Semantic Expression,通过语义表达的关系组织进行来源验证)方法。PROSE摒弃固定查询集,转而使用目标语义域,并把脆弱的响应密钥替换为模型内在化的语义结构,这些结构表现为域条件的响应行为。指纹不是体现在特定词汇或规定输出上,而是体现在模型如何语义组织其域内结论。具体地,PROSE构建一个私有域特定语义模板库,通过混合微调让模型在结构干净且经过验证的响应中内化这些模板;验证时,通过检测模型对保留的自然查询的响应中是否出现指定结构来判定所有权。作者在多种模型架构、规模和目标域上进行了大量实验,结果显示:在未修改的模型上指纹检测率达100%,且无误报;模型原有能力保持完好;在经历下游微调、量化等修改和输出变换后,指纹依然具有强可检测性。这表明PROSE以分布式、自然诱发的方式在高语义层面表达模型身份,比传统固定指纹更隐蔽、更鲁棒。该工作为LLM模型溯源和知识产权保护提供了新思路。
💡 推荐理由: 随着LLM被广泛复用和API化,模型所有权盗用和知识产权纠纷日益突出。PROSE提出基于语义结构的黑盒指纹,在不损害模型能力且难以被察觉的前提下实现高置信度溯源,为模型提供方、监管方和审计方提供了一种实用的技术验证手段,对AI资产保护具有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yijie Lin, Ching-Chun Chang, Isao Echizen, Hui Li, Chin-Chen Chang
本文针对机器学习即服务(MLaaS)平台上生成模型快速普及所带来的合成媒体溯源难题,提出了一种无需修改生成器架构或参数的自引用逆合成框架,用于可解释的AI溯源取证。该框架假设生成器固定(fixed-generator setting),通过联合优化的编码器-解码器对实现自嵌入机制,支持往返一致性验证。具体而言,客户端输入先经编码器处理,再由目标生成器生成高视觉保真度的输出;在取证验证阶段,将重合成图像与查询图像进行一致性分析,以判定查询图像是否源自该目标生成模型。该方法避免了水印嵌入或对生成过程的任何改动。实验结果表明,由编码输入生成的图像在视觉质量上与原始生成器输出相当,而解码后的图像能够可靠地回溯到对应的源输入。此外,该框架为生成内容的来源提供了可解释的证据,为可解释的生成式AI取证建立了实用工具。本文的核心贡献包括:提出一种固定的生成器设置下的溯源取证框架、设计自嵌入与往返一致性验证机制、以及通过实验证明其在视觉保真度和溯源可靠性上的有效性。适合AI安全研究人员、取证分析人员以及依赖生成内容溯源的蓝队工程师阅读。
💡 推荐理由: 为防御方提供了一种无需修改生成器即可追溯合成媒体来源的可解释技术,有助于识别由特定AI模型生成的内容、支撑虚假信息溯源及版权保护,蓝队可据此增强对生成内容滥用的检测与响应能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jun He, Deying Yu
持久化 AI 智能体通过反思、检索与整合构建自传式状态,但这种持久化仅改变信息的可用性,并未提升其认知地位——存储或检索到的内容并不能自动获得有效支持。因此,不受信任的输入、提示注入以及模型自身的推断都可能渗入持久状态,并在后续被系统误当作智能体的过往历史或用户的真实承诺。针对这一风险,论文提出一套类型化来源(typed provenance)与断言护栏(assertion guardrails)机制,用于实现“自传式断言有界性”(autobiographical assertion boundedness)——这是一种系统相对的释放性质,要求任何关于智能体、用户或指定关系的受控声明,都必须满足可接受证据、时间有效性与披露策略。其核心架构包括:类型化来源图,用于区分来源、依赖血统、认知角色、有效性与披露范围;解析器(resolver),负责评估授权状态投影,返回证据状态以及正交的冲突/过时/隐藏标志,并生成受保护的决策见证;生成-验证-修订(generate-verify-revise)中介,在候选语义单元被释放前对其进行一致性检查,并根据策略渲染状态响应。作者在显式假设(提取正确性、谓词正确性、解析健全性、视图去分类、信道中介等)下证明了一个条件性断言有界性契约。实验中,他们构建了24个手工编写的合规用例,相比flat/prior和source-tag比较规则(分别放行19/19和18/19个不安全候选),类型化中介在19个不安全机会中零个未被限定地通过,同时保留了全部5个受支持控制项。这些实验结论验证了解析器和中介的设计义务,但并不构成对语言模型或检索系统的端到端评估。
💡 推荐理由: 该研究直击AI智能体安全的核心盲区:持久化记忆可被提示注入污染,使未经验证的内容成为'事实'。安全团队在设计LLM工作流、记忆系统或自动化代理时,必须考虑证据来源与断言边界,该作者的方案提供了一种可借鉴的架构验证思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Oleksandr Hrabar, Hossein Arshadi Soufiani, Henry M. Kim, Chien-Chih Chen, Ali Vazirizadeh, Hjalmar Turesson
本文报告了 OreProof 的设计科学实践:一个面向关键矿物(以黄金为实例)供应链的可追溯性平台原型。核心问题在于供应链中存在结构性矛盾:监管方和买家要求可验证的来源,而上游参与者不愿透露供应商身份、品位/产量和价格等敏感信息。OreProof 旨在解决这种“可验证性与披露性”之间的权衡。架构上采用混合链上/链下数据模型,利用 Groth16 零知识证明实现选择性披露,使用 Merkle 批量锚定管线提升吞吐量,并在公共 zkEVM 测试网上签发符合 UNTP(联合国可追溯性协议)的可验证凭证。实验对比了透明基线,在既定攻击者模型下,可直接推断的机密属性从四类中的三类降至零;批量锚定显著提高了处理量。论文贡献包括原型工件和四条初步设计原则:1)对承诺数据进行证明而不是暴露数据;2)仅验证原始来源并标记混合商品中的未知输入;3)从一开始就签发符合标准的凭证;4)按供应链角色划分披露权限。适合对供应链安全、零知识证明应用、可追溯性系统和隐私保护设计感兴趣的研究人员与从业者阅读。
💡 推荐理由: 该研究为供应链溯源中“既要验证又要保密”的难题提供了一种可行的架构方案,对涉及敏感商业数据的矿业、贸易及合规审计场景具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jona te Lintelo, Lichao Wu, Stjepan Picek
大型语言模型(LLM)水印技术为文本溯源提供了机制,使模型所有者能够识别机器生成内容并归属到特定水印模型。然而,现有LLM水印方法主要依赖推理时采样器,且聚焦于密集模型。这类方法仅在文本通过模型所有者受控API显式生成时有效,在模型被窃取或泄露后即失效:一旦攻击者获得模型权重,可完全控制推理并直接运行未修改的采样器,绕过水印,使窃后归属无法实现。针对这一问题,本文提出了“专家水印”(Watermarking of Experts, WoE),一种利用稀疏混合专家(Mixture-of-Experts, MoE)模型独特结构特性的黑盒文本溯源方法。WoE通过偏置特定专家的词汇分布,将水印信号嵌入模型参数内部,而非依赖可绕过的推理封装,从而确保水印与模型参数固有绑定。即使攻击者使用被窃权重、泄露检查点,或从被窃架构蒸馏出次级密集模型,防御者仍可在无需访问攻击者部署环境或权重的情况下,对生成的文本进行归属。研究在8个MoE模型上评估WoE,结果显示在1%假阳性率下,平均真阳性率达90.1%,最高可达94.9%,同时基本保持模型通用能力。此外,WoE在对抗性监督微调、模型提取和输出级释义下仍保持可检测性,迫使恶意攻击者在削弱归属信号时不得不付出额外模型适配或文本重写代价,否则将牺牲输出质量。本文的方法为模型泄露后的文本溯源提供了一种不依赖推理时控制的新范式。
💡 推荐理由: 模型泄露已成为AI安全重大风险,现有水印在权重泄露后失效。WoE首次针对MoE架构实现参数内嵌水印,即使在黑盒场景下也能溯源,为蓝队、SOC和安全工程师提供了一种可落地的模型泄露归属手段,能显著提升AI供应链安全事件的事后取证能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kimberly Milner, Minghao Shao, Nanda Rani, Haoran Xi, Venkata Sai Charan Putrevu, Meet Udeshi, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri
该论文针对当前基于CTF(夺旗)基准评估大语言模型(LLM)智能体攻防能力时存在的评估浅层化问题展开研究。现有评估通常仅依赖二值化的成功/失败判断或聚合分数,忽略了智能体从初始状态到达flag的完整轨迹,导致真实漏洞利用行为与直接暴露flag、记忆背诵、外部查询、猜测或无依据声明等捷径相混淆,可能显著高估智能体的网络安全能力。为此,作者提出了CTF-ABACUS——一个基于轨迹的智能体审计框架。它使用证据锚定的求解画像(evidence-grounded solve profile)重构每一次运行过程,将智能体行为分解为渗透测试阶段和具体技术类别,从而精确识别:漏洞利用发生在何处、flag首次出现的位置、以及最终恢复的flag是否得到了实际演示行为的支持。通过跨智能体聚合求解画像,生成挑战签名,可判断成功是通过预期利用路径达成,还是经由捷径路径。作者在6个前沿及开源模型、240个挑战、共1,435次CTF尝试上应用了该框架,在两个裁判视角下生成了2,870个求解画像。结果表明,在所有基准中,经轨迹验证的真实利用仅占恢复flag总数的62%至87%,而捷径恢复对应的轨迹深度显著较浅。这些发现将CTF评估从“统计恢复flag数量”转向“验证实际利用行为”,为设计更好隔离出真实攻击能力的基准提供了基础。本文适合从事LLM智能体安全评估、红队自动化、AI安全基准设计的研究人员,以及关注AI攻防能力客观测量的蓝队成员阅读。
💡 推荐理由: 该研究揭示了当前AI智能体安全评测中普遍存在的“分数虚高”问题,帮助蓝队、SOC和评估人员避免被不真实的成功指标误导,更准确地度量LLM在渗透测试中的真实能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Arulnidhi Karunanidhi
本文研究了大型语言模型(LLM)智能体中持久记忆机制的安全漏洞:一旦虚假信息被写入记忆,它会在未来会话中被检索,导致错误持久化。作者在LongMemEval语料库中通过单次注入、无需任何指令或触发器,仅用1.2%的明显虚假断言即可将模型准确率从0.850降至0.300。他们设计了一个四阶段的写入时内容筛选流水线,对间接提示注入的检测召回率达0.832,同时误报率低(仅1.5%),但该流水线对360条中毒记忆全部放行,未拒绝任何一条。这表明仅依赖内容筛选无法区分虚假和真实断言,需要外部事实依据。进一步,作者评估了基于来源(provenance)的加权检索:默认权重在统计上与无防御无异(p=0.80);增大权重虽在混合来源语料(大部分不可信内容为良性)中将准确率从0.3167提升至0.7000,但当答案的关键证据本身来自不可信来源时,证据召回降为零,准确率跌至0.0417。在实测相似度区间内,加性的来源惩罚项没有可用设置:既能抵抗查询型中毒的权重也会压制合法的不可信证据。因此,作者主张在检索时采用有界占用约束(bounded occupancy constraints)而非加成式来源惩罚,并公开了测试工具、语料和汇总报告。该研究揭示了面向LLM智能体的新型攻击面,对安全防御设计具有重要参考价值。
💡 推荐理由: 该研究首次系统量化了持久记忆中毒对LLM智能体的破坏性,并证明内容筛选和来源加权等常规防御均存在根本性局限,对构建健壮的智能体防护体系具有直接启示。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lingzhi Wang 0002, Xiangmin Shen, Weijian Li 0002, Zhenyuan Li, R. Sekar 0001, Han Liu 0001, Yan Chen 0004
该论文针对基于溯源(provenance)的入侵检测系统(PIDS)中规则方法检测精度不足、误报率高的问题展开研究。现有规则型PIDS虽然具备轻量级、实时性强和可解释性等优势,但规则通常过于粗糙且缺乏针对具体环境的配置,导致在实际部署中难以区分正常与恶意行为。为此,作者提出CAPTAIN系统,一个能自动适应多种环境的规则型PIDS。其核心创新在于引入三个自适应参数,分别从节点(node)、边(edge)和告警生成阈值三个层面动态调整检测配置。作者构建了一个可微分的标签传播框架,并利用梯度下降算法基于训练数据对这些自适应参数进行优化,从而使系统能够学习环境的特定行为模式。实验基于DARPA Engagement数据集和模拟环境进行评估,结果表明CAPTAIN在保持规则型PIDS低开销和可解释性优势的同时,显著提升了检测准确率,降低了检测延迟和运行时开销,整体性能优于现有最先进的PIDS。对于蓝队和SOC而言,该研究提供了一种兼顾效率与精度的入侵检测思路,尤其适用于需要高可解释性且资源受限的部署场景。
💡 推荐理由: 规则型PIDS在生产环境误报高的问题长期存在,CAPTAIN通过梯度优化自动调参,既保留可解释性与低开销,又提升检测精度,对希望落地溯源检测的蓝队团队有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: R. Sekar 0001, Hanke Kimm, Rohit Aich
该论文针对现代高级网络攻击中审计日志采集系统存在的性能与安全问题展开研究。作者首先通过实验评估了当前主流的审计数据采集工具(如Linux auditd、sysdig以及其他研究原型),发现它们普遍存在三大缺陷:一是运行时开销过高,可使工作负载变慢2至8倍;二是在持续高负载下会丢失大部分事件;三是日志在写入持久化存储之前存在被篡改的窗口,攻击者可能趁机关闭或删除尚未落盘的日志条目,导致关键取证数据缺失。为克服上述挑战,论文提出了一种基于eBPF(扩展伯克利包过滤器)框架的新型审计数据采集系统eAudit。eBPF已内置于现代Linux内核,因此无需修改内核代码即可在大多数发行版上直接部署,具备良好的可移植性与易用性。论文详细介绍了其系统设计、内核态与用户态协同的采集架构,以及多项调优和优化技术(包括事件批量提交、高效的缓冲区管理、数据压缩与去重等),从而实现了高吞吐、低开销的审计日志采集。实验结果表明,eAudit能够承载比现有系统导致严重数据丢失的负载强度高一个数量级的工作负载,且开销仅为现有系统的一小部分,同时大幅降低了数据冗余,并将日志篡改窗口缩短了约100倍。该研究的主要贡献在于提供了一种快速、可扩展且易于部署的审计数据采集方案,为后续的溯源分析和入侵取证奠定了坚实的数据基础。适合系统安全研究人员、蓝队工具开发者以及需要高保真审计日志的SOC工程师阅读。
💡 推荐理由: 审计日志是溯源取证的核心依据,但现有采集工具在高负载下会丢数据、开销高且存在篡改窗口。eAudit基于eBPF实现低开销、高可靠、抗篡改的采集能力,直接提升蓝队对攻击的可见性和事后分析质量。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sanjay Kariyappa, Severin Klingler, G. Edward Suh
本文研究了工具型智能体(tool-using agents)在消费外部数据时面临的安全问题。这类智能体会从不同可信级别的来源获取数据,但工具响应通常不标明每个响应单元的来源或预期语义,导致智能体可能被攻击者控制的内容污染。作者将这种攻击定义为“状态破坏攻击”(state-corruption attacks):攻击者注入的内容在环境状态方面做出超出其响应组件信息权威的断言,从而扭曲智能体对环境的认知,使后续动作在现有防护机制看来是合理的。针对此问题,论文提出 PIPES(Provenance-Informed, Prior-Enforced Screening,即来源感知与先验强制的筛查机制)。PIPES 利用语义先验和来源元数据对响应单元进行筛查:当 schema 提供稳定预期时使用静态字段契约;对于开放式内容,则依据响应前轨迹和可信来源元数据来决定是否过滤。PIPES 会标记违反语义先验或来源层级的单元,部署时可选择移除、警告、阻断或升级处理。实验采用原子移除方式,在 VitaBench 和 AgentDyn 的多个数据集上以 Gemma 4 31B IT 作为目标智能体,评估了针对自适应 PAIR 风格攻击的防御效果。结果显示,PIPES 将平均攻击成功率从 84.7% 降至 2.3%,同时保持了较高的良性任务效用(无防御时为 90.6%,启用 PIPES 后为 92.5%)。该研究揭示了工具型智能体安全中一个被忽视的信任边界问题,并提出了一种基于来源与先验的实用防御机制,为构建更安全的智能体系统提供了新思路。主要贡献包括:定义状态破坏攻击、提出 PIPES 筛查框架、并通过实验验证其有效性。适合关注智能体安全、LLM 应用安全以及可信 AI 的研究人员和从业者阅读。
💡 推荐理由: 该研究揭示了工具型智能体在混合可信数据下存在的‘状态破坏’攻击路径,现有护栏可能被绕过。PIPES 提供轻量级筛查思路,对构建安全的 LLM 智能体系统具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jesus Salas
该论文针对智能体工作流(agentic workflows)评估标准过于单一的问题展开研究。传统上,系统是否成功仅取决于是否达到正确结果,但在机构化场景中,这一标准远远不够:一个动作即使结果正确,也可能依赖于错误的权威来源、包含未经证实的完成声明,或受到后续变更的影响而失效。为此,作者提出“受治理执行”(governed execution)概念,要求工作的决策、完成状态及对变更的响应都必须有可检查的来源证明(provenance)支撑。论文实现了名为 Matrix 的确定性因果状态层,它能够记录权威依赖与事实依赖、验证完成证据,并有选择性地使受影响的工作失效。通过受控对比实验,论文发现:治理路径与直接路径虽然常常得到相同的结果,但只有治理路径能够一致地保留治理证据、拒绝未经支持的闭环操作,并将恢复范围限制在依赖任务上。此外,在角色分离的迁移挑战中,一个强制的完整性契约因其确定性执行特性,过度拦截了在作者上下文之外生成的合成数据包,暴露出治理机制在跨场景泛化时的局限。作者明确表示,Matrix 并非通用的准确性增强器,其核心价值在于作为机构完整性层,使智能体工作可审计、可独立验证。该研究适合关注 LLM 安全、AI 治理、可审计智能体系统的安全工程师、研究者和合规人员阅读。
💡 推荐理由: 提示我们:智能体仅达成正确结果并不够,在监管与审计场景中,来源完整性与可验证治理证据至关重要,这直接影响 AI 系统的可信度与合规性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyan Feng, Yanjun Zhang, He Zhang, Leo Yu Zhang, Shirui Pan
本文针对大语言模型(LLM)生成文本的溯源与篡改检测问题,提出了一种新型互补水印方法。现有水印技术通常对文本编辑具有鲁棒性,能够保持溯源属性,但这种鲁棒性也带来安全漏洞:攻击者可以在保留水印归属的同时对关键内容进行篡改,即所谓的“piggyback spoofing”(搭便车欺骗)。为此,作者设计了一种同时提供溯源证据和篡改证据的水印方案。该方法在每个生成的token中共同嵌入两种信号:一种鲁棒信号和一种脆弱信号。两种信号共享相同的机制(无偏锦标赛重加权),但使用独立的密钥以及不同的基于归一化文本的种子窗口,从而使鲁棒信号对编辑不敏感,而脆弱信号对读者可见的改动敏感。通过多轮无偏锦标赛重加权保持预期的生成分布,并采用周期性的轮次分配模式来调节两种信号之间的权衡。在检测阶段,两种信号的得分构成二维空间,支持三种决策结果:完整(Intact)、被篡改(Tampered)和无水印(No-Watermark)。在两个大语言模型和两个提示数据集上的实验表明,该方法在评估的各类方法中取得了最高的篡改检测率,同时保持了具有竞争力的溯源鲁棒性和困惑度(perplexity)。消融研究进一步证明,可靠的三态检测需要明确定义的“完整性”概念、两种信号的共同嵌入以及对编辑的互补敏感性。本文适合关注LLM内容安全、模型溯源、数据完整性验证的研究人员与安全工程师阅读,为在开放环境中防止内容被恶意篡改同时保留责任归属提供了新思路。
💡 推荐理由: 该研究直接针对LLM输出水印的现有安全缺陷(piggyback spoofing),在不牺牲溯源鲁棒性的前提下实现篡改检测,对AIGC内容完整性验证和责任追溯具有重要价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Paul R. B. Houssel, Olivier Levillain, Sylvie Laniepce, Nicolas Dejon, Hervé Debar
本论文围绕安全取证场景下的系统溯源(provenance)展开,系统性地研究了主流内核遥测(kernel telemetry)采集方案。作者首先梳理了现有的溯源捕获方法,对比了基于内核模块、硬件辅助、以及 eBPF 等技术路线的优劣,认为 eBPF 是最具前景的采集机制。为了验证这一判断,他们设计了微基准测试,重点评估 eBPF 在不同过滤机制下的性能开销,例如限制仅采集特定容器的事件流,以衡量捕获粒度与开销之间的权衡。在此基础上,论文进一步对八个溯源系统和五个可作为采集层的代理工具进行了分类,分析其底层采集架构、采用的过滤策略、以及对事件完整性和可用性的保障能力。研究发现:这些工具在捕获层的实现上高度异构,大部分工具无法在事件层面提供严格的完整性保证(如抗篡改、防丢失),也缺乏对采集过程本身可用性的保障,因而在实际生产环境中难以满足安全导向用例的严格要求。该论文的贡献在于:一是给出了内核遥测方案的横向对比和性能数据;二是提出了一套按捕获方式和过滤机制对溯源系统进行分类的框架;三是揭示了现有溯源工具在安全属性上的共同短板,为后续设计高可靠性溯源架构提供了参考依据。适合系统安全研究者、溯源工具开发者和需要部署审计能力的蓝队人员阅读。
💡 推荐理由: 溯源是入侵检测和取证的关键能力,本文对比了 eBPF 等采集方案并暴露出现有工具在事件完整性与可用性上的缺陷,能帮助安全团队在选择或构建溯源系统时避免踩坑,并将需求导向高可靠内核遥测方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Muhammad Awan, John Collomosse
该论文提出了一种用于图像来源信息(provenance)的“软删除”(soft redaction)机制,旨在解决C2PA等来源标准中透明度与隐私之间的冲突。C2PA标准通过附加签名记录来声明图像的来源、编辑历史和权利信息,但这些断言可能泄露创作者或拍摄环境的敏感信息。作者创新性地利用零知识证明(ZKP)技术,在不暴露原始敏感数据的前提下,证明隐藏数据的某些属性。论文重点研究了距离证明:首先,利用切比雪夫多项式近似在ZKP电路中实现位置断言,证明某个位置靠近公共参考点;其次,将L2距离证明扩展到生物特征嵌入(如人脸嵌入),实现隐私保护的相似度声明,用于支持人格权(如肖像权)的行使;最后,将相同的距离证明构造应用于感知哈希(视觉指纹),用于在水印恢复被剥离的来源元数据时提供防欺骗能力。实验结果表明,这种基于ZKP的图像来源软删除机制与C2PA兼容,可在数秒内构建证明,并在毫秒级完成验证。该研究为在保持来源可信度的同时保护隐私提供了实用方案。
💡 推荐理由: 该研究为图像来源透明与隐私保护之间的平衡提供了新思路,使安全从业者能够在不泄露敏感元数据的情况下验证关键属性,对涉及数字内容取证、隐私合规和身份保护场景具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lorenzo Guerra, Thomas Chapuis, Guillaume Duc, Pavlo Mozharovskyi, Van-Tam Nguyen
该论文系统研究了基准测试与评估协议如何影响基于溯源(provenance)的入侵检测系统(PIDS)的性能结论。作者指出,许多 PIDS 在论文中宣称高检测性能,但这些结论往往对所选数据集和评估方式极为敏感。为了揭示这一依赖关系,他们在满足审计、标签和校准要求的公开数据集上重新评估了若干代表性 PIDS,重点使用了经过审计的 DARPA TC E3 数据集。他们设计了一套统一的评估协议,包括时间上分离的测试周期、仅基于验证集进行模型检查点选择和阈值校准,并以此考察了哪些架构层面上的主张能得到实证支持。研究发现,告警成功与调查效用可能严重不一致:一些系统虽然能发出攻击告警,却无法提供足够的过程上下文来支撑取证调查。更关键的是,在四个主要数据集中的三个上,一个仅用训练集可执行文件名和路径构建的简单允许列表,就在关键运行点指标上达到甚至超过了所选学习基线,这说明这些模型测得的大部分性能反映的是词汇新颖性,而非更丰富的溯源建模能力。为了解释为何只有一部分数据集能体现架构差异,作者通过特征完整性和字段熵度量了语义信号质量,分析表明,部分 E3 数据集虽然能区分告警行为,但难以可靠区分不同模型架构;而 Theia 数据集兼具最强的语义信号质量和参考模型在排序及节点级恢复上的最明显提升。由此得出结论,在解释 PIDS 的架构声明时,必须同时考虑产生该结果的基准特性和评估协议。该研究为安全评估方法学提供了重要参考,提醒实践者谨慎对待孤立指标,重视评估协议的影响。
💡 推荐理由: 该研究表明,许多 PIDS 的高性能指标可能源于基准和评估协议带来的偏差,而非真正的语义理解。安全团队在选用此类系统或评估内部检测模型时,若忽视评估协议,极易高估实际效果,从而影响入侵检测的防御决策。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinghan Xu, Yiyong Xiao, Wanru Shao, Hankai Liu, Xinjin Li
本文研究大型语言模型(LLM)智能体的长期记忆机制引入的新安全风险:记忆来源清洗(memory provenance laundering)。在LLM智能体中,长期记忆允许智能体重用之前的偏好和工作流程,但同时也将不可信的观测内容转化为持久的行动上下文。作者发现,在基于LLM的记忆整合过程中,外部观测可能被改写为看似用户历史记录或工作流支持的内容,从而保留动作触发器但抹去了低信任来源,而来源本应限制该动作的权限。现有提示过滤器、内容清洗工具和工具守卫均无法在损失性记忆整合之后强制执行来源权威不放大(source-authority non-amplification)的边界。作者形式化了该边界,并实现为保留来源的记忆防火墙(Provenance-Preserving Memory Firewall, PPMF),一种轻量级记忆中间件,它保留平台维护的来源信息,并通过将动作风险与相关记忆的权威级别匹配来授权工具调用。在基于固定风险策略的schema化评估中,易受攻击的整合记忆攻击成功率(ASR)高达1.000;而在保留完整平台来源、确认信息和风险标签的情况下,所有未授权的危险动作均无法通过PPMF门控,同时已确认的良性动作和受控的低风险记忆使用仍可执行。该论文适合研究LLM智能体安全、记忆系统设计以及安全中间件开发的从业者和研究者阅读。
💡 推荐理由: LLM智能体长期记忆的信任边界缺失可能导致未授权操作,该研究揭示了一种新型的提示注入变体,并提供了实用防御中间件,对构建安全代理架构有直接借鉴意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Federico Valletta, Giacomo Longo, Enrico Russo, Alessio Merlo
安全运营中心(SOC)越来越依赖自动化工具将网络威胁情报(CTI)报告映射到MITRE ATT&CK框架,但提取器的输出仍然存在错误,且通常不附带证据、溯源和验证历史,导致难以判断单个映射的可信度。本文提出TRACE-CTI,一个事后提取声明治理框架,它保留运行级预测,聚合成配置级图断言,将重复配置去重后的验证结果作为共识断言,并仅暴露受政策合规验证支持的图断言。该框架保留了原生证据粒度、完整的提取溯源、带版本的可信决策以及非破坏性撤销历史。作者在两个公开CTI语料库(共65份报告、5303个句子)上评估了TRACE-CTI,使用2×3的检索器与生成器组合矩阵,并分6个图版本增量摄入。所有设置无需修改模式即可集成,溯源路径保持完整,操作范围互不重叠,每个可信图断言都有活跃的合格验证基础。跨生成器家族的设置对相比同家族对表现出更大的输出多样性。在最终图状态下,将设置支持从k≥1增加到六方一致,使gold-aligned精度从25.3%提升至90.6%,而召回率从88.2%下降至16.3%。该图还能直接回答关于溯源、可信度、版本控制、依赖关系、分歧和审查队列的七个问题,而评估的最小扁平输出在没有增强或重新处理的情况下无法完全回答这些问题。结果表明,所提出的框架能够对提取的TTP声明进行显式、可审计的治理;观察到的验证轨迹是描述性的,不建立统计独立性或因果模型族效应。
💡 推荐理由: 当前自动化CTI映射缺乏可审计性和信任机制,TRACE-CTI通过知识图谱保留完整证据链和验证历史,使SOC分析师能够基于可信度做出决策,显著提升攻击行为映射的可靠性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tristan Bilot, Baoxiang Jiang, Zefeng Li, Nour El Madhoun, Khaldoun Al Agha, Anis Zouaoui, Thomas Pasquier
本文对当前最先进的基于溯源的入侵检测系统(PIDS)进行了全面分析。研究背景是,尽管PIDS在检测复杂攻击方面表现出色,但其方法日益复杂,导致部署和解释困难。核心问题是:现有复杂方法是否真正优于更简单的替代方案?作者选取了多个代表性系统(如StreamSpot、Sleuth、Unicorn等),从检测精度、运行效率、可解释性等方面进行系统比较,并引入了一种简化的基线方法。实验证明,该简化方法在多个数据集上取得了相当甚至更优的性能,且开销显著降低。主要贡献包括:1)首次系统化比较多种PIDS的设计权衡;2)揭示过度复杂化可能带来边际收益递减;3)提出并验证了优先考虑简洁性的设计原则。适合安全研究人员和SOC分析师阅读,以在部署PIDS时做出更务实的决策。
💡 推荐理由: 为SOC团队选择或设计基于溯源的入侵检测系统提供了实证指导,避免盲目追求复杂模型而忽视实际效果。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Feng Dong 0008, Shaofei Li, Peng Jiang 0007, Ding Li 0001, Haoyu Wang 0001, Liangyi Huang, Xusheng Xiao, Jiedong Chen, Xiapu Luo, Yao Guo 0001, Xiangqun Chen
本文首次从工业界视角系统评估了基于溯源的端点检测与响应(P-EDR)系统的有效性与局限性。研究通过一对一的专家访谈、在线问卷调查、相关文献调研以及系统性的测量实验四部分展开。结果显示,所有工业界专家均认为P-EDR系统比传统EDR更有效,但普遍担忧其运营成本。研究进一步揭示了学术界与工业界之间的三大鸿沟:(1)忽视客户端开销;(2)告警分类成本与解释成本不平衡;(3)服务端内存消耗过高。论文提供了P-EDR系统有效性的客观数据,并指出了工业界部署所需的关键改进方向。适合安全运维团队、EDR产品开发者和APT防御研究人员阅读。
💡 推荐理由: 该研究首次以工业界视角系统评估P-EDR系统,揭示了学术界与工业界的认知差距,为安全团队评估和采用P-EDR系统提供了重要参考。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: J. Peter Brady, Sean W. Smith
本文提出 PAPI(Provenance-Aware Parse Insertion),一种基于来源感知的解析插入方法,用于实现语言安全(LangSec)的中间件。该方法通过追踪数据来源,在解析过程中动态插入安全控制,以防范协议混淆和注入攻击。PAPI 在解析器中介入,利用来源信息判断解析路径的合法性,从而在不显著影响性能的情况下增强安全性。实验表明,该方法能有效检测并阻止多种针对协议解析的攻击,为 LangSec 中间件设计提供了新思路。
💡 推荐理由: 针对协议解析和注入攻击提供新颖的中间件防护,可应用于网络协议解析和 API 安全场景。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Neyamul Islam Shibbir, Deepak K Tosh
本文针对工业控制系统(ICS)中信息技术(IT)与操作技术(OT)融合带来的多阶段网络攻击威胁,指出现有基于溯源(Provenance)的入侵检测系统(PIDS)虽然在IT环境中有效,但在工业信息物理系统(CPS)中应用受限,主要原因在于缺乏同时捕获主机级因果行为、工业网络语义和物理过程状态的数据集。为解决这一问题,作者设计并实现了一个开源、硬件在环(HIL)的CPS测试床,该测试床复制了工业化学反应器控制架构,跨越Purdue模型各层。基于该测试床,提出了ProvICS——一个专为CPS入侵检测构建的多模态溯源数据集。该数据集同步采集四个数据流:来自监控主机和资源受限PLC的完整系统溯源图、解码后的Modbus深度包检测记录,以及物理过程遥测数据。数据集包括48小时的正常阶段和22小时的攻击阶段,覆盖4个攻击战役、20种ICS ATT&CK技术和32个攻击事件,攻击类型涵盖侦察到物理过程操纵。对比分析表明,ProvICS是少数几个同时具备多主机内核级溯源、真实PLC硬件在环执行、解码Modbus流量、物理过程状态测量和原始PCAP踪迹的ICS/CPS基准数据集。基线检测实验验证了跨模态融合能够检测所有32个标注攻击事件(F1=0.913,假阳性率=1.40%),证明该数据集能够暴露跨模态的互补攻击信号,填补了先前基准的空白。
💡 推荐理由: 该研究填补了ICS/CPS领域缺乏多模态溯源数据集的空白,为开发跨主机、网络和物理层的融合检测方法提供了关键基准,有助于提升工业环境对多步攻击的检测能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jun Zeng 0006, Chuqi Zhang, Zhenkai Liang
本文提出PalanTír系统,旨在通过硬件增强的系统可观测性来优化攻击溯源。现有的攻击溯源方法主要依赖软件级日志(如系统调用跟踪),但软件日志存在高开销、被篡改风险以及缺乏底层语义等问题。PalanTír利用现代处理器提供的硬件性能监控单元(PMU)和Intel Processor Trace等硬件特性,以低开销捕获细粒度的系统执行信息,从而构建准确的攻击传播图。核心创新包括:1)硬件辅助的因果追踪机制,利用硬件事件关联系统状态变化;2)基于硬件日志的溯源图压缩算法,在保证完整性的前提下显著降低存储和查询开销;3)原型系统在Linux上的实现,并在真实攻击场景(如提权、数据泄露)中验证了效果。实验表明,PalanTír相比于纯软件方案(如CamFlow、SPADE)在追踪精度上提升约40%,同时性能开销降低超过60%。本文适合系统安全、攻击溯源和硬件安全交叉领域的研究者阅读。
💡 推荐理由: 硬件辅助的可观测性为攻击溯源提供了新的低开销高精度方案,可能推动下一代安全监控系统的设计。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohammad Faizan, Dalal Alharthi
随着检索增强生成系统在问答任务中广泛应用,其提供的引用往往无法反映真实的信息来源影响。本文提出ProvenAI框架,将多跳问答中的透明度分解为三个独立可测量的层次:答案正确性(answer correctness)、引用保真度(citation fidelity)——衡量引用是否匹配基准支持证据,以及逐文档影响(per-document influence)——通过留一个资源出的干预实验评估每个文档对答案的实际贡献。针对HotpotQA distractor基准,ProvenAI构建包含七阶段流水线(数据标准化、检索索引、引用感知答案生成、归因审计、基于消融的影响估计、批量评估、交互检查)的系统,在509,300段落的经典语料库上评估了7,405个验证样本。系统达到53.53%的答案准确率和71.55%的平均引用保真度分数。通过一个工作示例,揭示了引用-影响差距:某被引用来源仅有微弱影响,而七个未引用来源却显著改变了输出。论文通过声明的忠实性条件形式化了表面代理与token级KL散度目标之间的关系,将框架扎根于因果中介分析和数据库来源理论,并讨论了三个测量层如何与自主科学发现中出现的加密来源架构组合。ProvenAI表明,检索增强问答中有意义的透明度要求将检索到的、引用到的和行为上有影响的证据作为三个独立、独立测量的层进行可追溯链接。
💡 推荐理由: 检索增强生成系统在安全情报分析中广泛应用,但其引用未必反映真实证据来源,可能导致误信或错误决策。ProvenAI提供的三层透明度框架可帮助安全工程师识别虚假引用和实际影响源,提升RAG系统输出的可信度。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ian C. Moore, Fernando Paredes Garcia
本文提出并分析了 Parent-Hash 有向无环图(PHDAG),这是一种用于链上注册表的追加型数据结构,其中每次追加操作只需对之前未触及的存储槽进行恒定数量的写入操作。此前,PHDAG 从未被作为独立原语进行形式化分析,也未被明确边界常数,更未与标准的增量 Merkle 树(IMT)进行基准比较。作者形式化证明 PHDAG 的追加操作在 gas 成本上为 O(1),与注册表大小和树深度无关,而 IMT 的每次插入成本则是关于叶子索引的随机变量,作者推导出其均值和方差的闭式表达式。通过在 Base Sepolia 测试网上对 1 至 25 层树深度进行实验验证,观察到 PHDAG 的 gas 消耗恒定在约 76,276 gas(标准差约 6 gas),而 IMT 成本随深度线性增长。交叉点(IMT 更便宜)远低于所有已调查生产注册表的深度。此外,本文还建立了从公共事件日志中无需信任地重建注册表的方法,时间复杂度为线性,且无需链下依赖。该研究首次将 PHDAG 与 IMT 进行了系统的理论和实证对比,为链上数据结构的成本优化提供了重要参考。
💡 推荐理由: 该研究为链上注册表(如证书透明度、软件供应链)的数据结构选择提供了严格的成本分析,帮助开发者理解 PHDAG 在深度较大时的 gas 优势,从而优化智能合约设计。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiqi Wang, Jiaqi Zhang, Taotao Cai, Zirui Liu, Qingqiang Sun, Zequn Sun, Zhangkai Wu, Mingkai Zhang, Yanming Zhu
本文系统综述了基于大语言模型(LLM)的智能体中证据追踪与执行溯源问题。随着LLM智能体通过与外部工具、检索系统、记忆模块、环境及其他智能体交互解决复杂任务,其自主性增强,但行为验证、调试和审计难度增加。仅靠最终答案正确性无法解释输出如何产生、每个主张依赖哪些证据、工具调用是否合理、记忆如何影响后续决策、以及执行失败的根源。证据追踪与执行溯源通过建模智能体执行过程中检索证据、工具输出、记忆项、环境观察、中间主张、动作与最终答案之间的关联来弥补这一空白。本文提出统一溯源视角,连接检索归因、主张支持、工具使用安全、记忆谱系、可观测性、调试、审计与恢复。引入分类法涵盖追踪来源、证据与执行单元、溯源关系、追踪粒度与时机、表示形式及信任函数。综述关键方法论方向,包括溯源表示、证据归因、工具使用溯源、运行时护栏、携带溯源的记忆、基于轨迹的可观测性及故障诊断。同时映射现有基准、数据集与评估指标至溯源相关能力,讨论评估如何从最终答案正确性转向过程级问责。最后,概述开放挑战,如统一轨迹模式、主张级与语义溯源、感知溯源的安全机制、真实执行轨迹基准、面向恢复的评估及隐私感知审计基础设施。本文适合AI安全、LLM可靠性及智能体治理领域的研究者和工程师阅读。
💡 推荐理由: 该综述系统梳理了LLM智能体可解释性与可信性的核心挑战,提出了统一溯源框架,为构建可审计、可调试的智能体系统提供了理论基础,对AI安全从业者理解智能体行为追踪与风险管控具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shubhashis Sengupta, Benjamin McCarty, Milind Savagaonkar, Rhine Andotra
这篇论文探讨生成式AI(GenAI)对内容真实性带来的系统性风险。作者提出了“真实性债务”(authenticity debt)概念:组织在部署AI生成内容时,若未保留可验证的来源、完整性和问责机制,将累积机构性负债,未来可能在监管、法律或市场审查下暴露。论文首先构建了生成式AI危害与攻击向量的多维分类法,涵盖真实性、来源(provenance)、完整性和问责四个层面。随后,系统评估了现有技术控制手段的能力与局限性,包括数字水印(如DALL-E水印)、来源框架(C2PA、Adobe CAI)和检测技术(AI生成文本/图像检测)。核心论点是:在开放、对抗且不断演化的环境中,没有任何单一机制足以保障内容真实性。受零信任架构和企业治理框架启发,作者提出一个分层参考架构,融合密码学来源(如数字签名、区块链)、人在回路验证和持续治理,以实现大规模可防御的真实性。论文还分析了欧美监管环境(EU AI Act、美国FTC指南、NIST AI RMF),并为组织提供实践指导原则,建议将真实性建设视为机构基础设施而非事后补救。该研究适合安全架构师、合规官和AI系统设计者阅读,以理解GenAI时代内容信任的挑战及系统性解决方案。
💡 推荐理由: 为防御者提供了系统性框架来管理AI生成内容的风险,尤其适合SOC和合规团队用于构建内容溯源和完整性验证策略。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo
本文是一篇针对大型语言模型(LLM)领域内指纹识别与水印技术的综述论文,旨在统一术语、生命周期阶段和评估目标,为LLM资产保护与溯源建立结构化基础。LLM的研发需要大量数据、算力和专业知识,且正被部署于高风险场景,因此保护LLM相关资产并追踪其来源至关重要。现有工作已在数据集溯源、模型所有权验证和生成内容检测等方面快速扩展,但该领域仍存在碎片化现象:指纹识别与水印的术语使用不一致,方法通常仅在孤立的资产特定场景中研究。为弥补这一差距,论文引入“隐式身份”(implicit identity)作为统一抽象概念,指LLM系统中可验证但不可直接观察的身份信号。区分了两种类型:指纹识别(从内在特性中提取的非侵入式身份)和水印(有意嵌入数据、模型或生成内容中的侵入式身份)。基于此,提出了一个生命周期分类法,将技术按数据集、模型和生成内容三个层面组织,并进一步按验证语义(基于相似性的归因VS基于密钥的验证)细分。最后,建立了一个以可识别性、鲁棒性和可部署性为核心的评估框架,总结了在现实访问和变换场景下的代表性指标。通过统一术语、生命周期阶段和评估目标,该综述为研究LLM身份技术以及开发更可靠的资产保护和溯源机制提供了结构化基础。适合LLM安全研究人员、模型开发者、内容归因系统设计者阅读。
💡 推荐理由: LLM资产保护与溯源成为关键需求,本文首次系统梳理指纹与水印技术,统一术语与评估框架,有助于安全社区建立共识、推动可靠防护方案落地。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kolawole Quadri
该论文提出了KYA(Know Your Agents),一个框架无关的自主系统信任与治理层,旨在解决AI智能体运行中可能出现的错误、偏离、数据泄露或恶意行为等问题。K YA由五个核心原语组成:(1) 四门入站应用管道,结合Ed25519签名验证与多锚点固定、持久时间过期、仅收紧组合以及默认操作员批准;(2) 在三级多租户层次结构(平台默认、租户覆盖、签名外部推荐)上的仅收紧组合代数;(3) KYP(Know Your Principal),一个跨人类用户、AI智能体和服务账户的统一信任评分模式;(4) 可审计的交互乘数放大,基于AIVSS形状的加性基线,带有稳定审计码的有界非对称每交互乘数;(5) 双轴委托归因,结合静态观察门控委托信任溢价与三个SDK钩子表面的零配置运行时编排器责任归属。KYA框架无关,兼容22个智能体框架。纯函数评分器p99延迟小于1毫秒,系统在20个并发工作线程下维持约1800 ops/秒,HMAC链完整性端到端保持。四门入站应用管道在所有测试中拒绝伪造、过期、宽松和未批准的推荐(1200/1200),SQLite上p99延迟小于1毫秒。KYA能检测89%的对抗性探测(来自PyRIT和Garak的1200个探测),包括最近发布的拓扑引导多智能体攻击。该系统以Apache 2.0许可证发布,作为veldt-kya包在PyPI上可用(提交时为候选版本,稳定版v0.1.0即将发布)。
💡 推荐理由: KYA为自主系统的安全治理提供了框架无关的标准化信任层,可对抗智能体漂移、数据泄露和恶意行为,对蓝队监控和治理多智能体环境具有重要意义。
🎯 建议动作: 关注研究进展,评估将KYA集成至现有智能体治理管道的可行性
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gustav Olaf Yunus Laitinen-Fredriksson Lundström-Imanov, Nurana Abdullayeva
本文提出一个统一的证据框架,将密码学内容来源、鲁棒统计水印和零知识证明映射到三个法律体系(国际军事行动法、国内诉讼程序、产品监管)的证明要求中。该框架定义了一个五级威胁模型,涵盖从朴素再生、对抗性清洗、跨模型再生、主动水印移除到内部来源伪造。作者发布了包含12000个生成项(涵盖图像、音频、视频模态)的公开基准,并经过六种清洗管道处理,得到72000个评估样本。他们对四种代表性方案进行了评估,报告了在固定假阳性率下的真阳性率、鲁棒性曲线下面积、计算开销以及针对不同法律体系的条件法律充分性评分。最终将实证检测边界转化为法律充分性阈值,用于武装冲突法中的指挥决策、国内刑事和民事程序中的可采性,以及欧盟人工智能法案下的持久性审计。该成果提供了一个可复现的参考管道、公共基准和模型附件,可供律师、工程师和操作人员共同部署。
💡 推荐理由: 本文首次将AI生成内容的可验证来源与水印技术系统性地映射到法律证据要求,为安全从业者提供了跨学科的技术-法律评估基准,有助于在合规场景中设计可辩护的防御方案。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre Fernandez
本文提出 TextSeal,一种用于大型语言模型(LLM)的本地化水印方案,旨在解决模型输出的来源追踪与蒸馏保护问题。该方法基于 Gumbel-max 采样,通过引入双密钥生成机制恢复输出多样性,并利用熵加权评分和多区域定位技术提升检测精度。TextSeal 支持推测解码和多 token 预测等服务优化,且不引入任何推理开销。在检测强度上,TextSeal 严格优于 SynthID-text 等基线方法,对文本稀释具有鲁棒性,即使在人类与 AI 内容高度混合的文档中也能实现可靠的本地化检测。方案理论上是无失真的,在推理基准测试中下游性能保持不变;跨 5 种语言的 6000 次 A/B 人类评估显示无感知质量差异。除了用于来源检测,TextSeal 还具有“放射性”:其水印信号会通过模型蒸馏传递,从而能够检测未授权的模型使用。该工作适合 LLM 服务提供商、内容认证机构及模型安全研究人员阅读。
💡 推荐理由: 为 LLM 输出提供一种高效、鲁棒的本地化水印方法,在无推理开销的前提下实现强检测与蒸馏保护,对内容溯源和知识产权保护具有重要实践意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hailun Ding, Juan Zhai, Dong Deng 0001, Shiqing Ma
本文提出了一种利用机器学习技术优化溯源图存储系统的思路。传统溯源图存储面临规模大、查询慢等挑战。作者设计了一种学习型索引结构,通过对图数据的分布进行建模,实现了更高效的存储与检索。实验表明,该方法在存储压缩比和查询延迟上优于传统方法。该研究为安全取证中的大数据分析提供了新的工程方向。
💡 推荐理由: 溯源图是攻击溯源的核心技术,其存储效率直接影响安全运营中的实时查询能力。本工作将学习型索引引入该领域,有望提升大规模溯源数据的处理速度,值得蓝队关注。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
提出基于溯源访问的子账户系统 PASS,通过 Inbox-Outbox 机制实现外部动作可验证溯源且内部转账私密,用于区块链钱包的灵活共享访问。
💡 推荐理由: 当前区块链钱包的私钥全权控制模式在 AI 代理、企业托管等场景中脆弱;PASS 提供可验证的溯源控制,有助于安全地实现多角色协调,减少秘密暴露和内部活动泄露风险。
🎯 建议动作: 研究跟进
排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.5)