#auditability

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Theodoros Moutesidis

该论文研究一个面向 LLM 驱动攻击性安全代理(offensive-security agent)的工程问题:在代理流水线中加入"验证器—接受阶段"(verifier-and-acceptance stage),即由一个模型充当验证器给出判定、再由确定性代码强制执行该判定,是否会改变代理最终报告的漏洞发现。作者采用预注册(pre-registered)的实验范式,分三步开展:第一步是 15 次运行的探索性试点;第二步是预注册的 20 次运行确认性消融实验(confirmatory ablation);第三步是预注册的 2×2 因子研究,在两个刻意配置为易受攻击的实验室靶标上共进行 40 次运行。 确认性实验的核心结果是:将验证器—接受阶段移除后,"报告前抑制"(pre-report suppression)现象消失,每次运行的中位发现数从 2 降至 0,单侧精确检验 p = 0.00003;同时,在模型盲审(model-blinded)条件下最终"发货"的精度从 0.471 降至 0.353,p = 0.0087。但对一份冻结但不完整的 ground-truth 列表的召回率没有显著差异(双侧 p = 0.158),且研究未建立等效性,作者也强调该召回端点证据不充分。 因子研究进一步做归因分解:抑制作用主要来自模型验证器本身(Holm 校正后 p = 0.004);仅靠确定性接受规则并未抑制任何误报;两者之间未检测到交互作用(p = 0.72)。完整设计保留了 93.8% 的经模型裁定的真实候选,但未达到预先注册的非劣效性标准——单侧 95% 置信下界为 0.875,低于 0.90 的门槛,因此不能宣称"不劣于"无验证器配置。 在安全与审计方面,作者在两个研究中部署了带埋点的金丝雀(instrumented canary),在 60/60 次运行中记录到零次接触,偶发的外部接触单独披露。对保留的盲审数据包的人工独立裁定仍在进行中,因此精度与灵敏度端点目前只是支持性证据而非最终结论。作者还主动披露了六处审计追踪失败,其中一处发生在评估工具自身。论文的结论刻意收窄:验证器改变的是"系统最终交付什么",确定性代码提供的是强制执行与可审计性;该结果并未证明其优于其他代理,也未证明可推广到实验室靶标之外。 论文适合关注 LLM 代理安全评估方法学、代理流水线治理与可审计性设计的研究者与安全工程师阅读,尤其适合负责设计"模型输出—代码执行"门控与审计链路的团队。

💡 推荐理由: 它给出一个可复用的代理安全治理范式:模型判定与确定性强制执行分离、预注册消融验证效果、金丝雀监测与审计追踪。对设计 LLM 代理的发布门控与可审计性有直接参考价值,同时提醒精度/召回端点需人工裁定才能定论。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Muntaser Syed, Markus Zanker, Marius Silaghi

本文研究审议性民意调查(deliberative poll)中参数选择机制的可审计性问题。当提交的论证数量超出任何个人的阅读能力时,必须有一种机制决定每个选民看到哪些论点,这一过程实际上掌握了大部分决策权。现有实践常常依赖不透明的学习型排名器,使得选民无法重新计算或质疑影响其投票的曝光过程。作者提出,机制应当是一条发布的规则,基于公开可计算的证据,且参数由选民持有,并将可读性(legibility)作为可用机制的可接受性条件,而非与准确性对立的优化目标。论文将民意调查形式化为基于双极论证集(bipolar justification sets)的投票问题,从理由覆盖率、到达顺序和捕获的支持量(endorsement mass)三个维度评价候选名单(slate),并提出公民推荐器(civic recommender)的七项可检查标准,以及一个满足这些标准的规则:由关系权重函数参数化的单跳反向背书流(one-hop reversed endorsement flow)。作者构建了智能体模拟器,在约17,000个种子配对运行中记录每次投票的名单。结果显示,该规则的服务名单与标签读取上限(上界所有选择过程)仅差0.035,说明任何不受约束的排名器的优势都是有界且有限的。在仅覆盖率方面,在非退化创作下,该规则与随机名单无法区分,这归因于其无视顺序和无视慈善的仪器设计;但在其他两个指标上则以每个前缀领先,且差距随对抗性压力扩大,质量优势达到3.3倍。当合理比例的提交不包含理由时,覆盖率差距会恢复并增长。标签同质淹没(label-homogeneous flooding)在平坦权重策略下将完整性从0.81降至0.34,而在作者数量归一化下仅降至0.44,表明权重函数作为安全控制可价值10%的完整性。论文强调,排名臂之间的选择是覆盖率与质量前沿上的位置选择,只有可读的规则才能将这一选择交给受影响的人。该规则可映射至开源的点对点平台。

💡 推荐理由: 在AI系统日益影响公共决策的背景下,该研究证明可审计、用户可配置的规则能够以极小代价接近不可透明排名器的性能上限,同时抵御特定操纵攻击;对构建透明、可控的推荐与决策系统具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nizam Kadir

该论文针对大语言模型(LLM)辅导系统中一类特殊的失败模式:模型给出的回答虽然正确且有帮助,却可能在未经授权的情况下提前泄露答案或关键推理步骤。作者将这种状态与动作相关的失败形式化定义为“教学泄漏”(pedagogical leakage),并提出一种“授权感知的完整中介边界”(authorization-aware complete-mediation boundary)来加以控制。系统架构由三部分组成:选择器(selector)输出五种披露契约之一,受信任的策略门控(trusted policy gates)控制特权模式,渲染器(renderer)生成语言表达;最终通过一个单一的发布函数执行可检查的检查项、可选的累积验证以及针对具体动作的回退机制。可重放的追踪日志将选择、生成、验证与执行失败分离开来,从而支持基于组件归因的安全-效用前沿分析。实验基于599个固定的Gemini 3.5提案,严格中介(strict mediation)将盲化的三模型专家小组多数投票泄漏标记数从181降至0,配对问题簇平均差异为-30.22分(95% CI [-35.00, -25.72]),但替换了581个回答并降低了有用性。仅依赖检查器触发的回退机制会产生11个多数标记;加入语义验证器后产生14个标记,没有可靠边际收益。全局A1脚手架(global A1 scaffold)实现0个多数标记和54个任意评委标记,在自动安全性和实用性上优于拟合Q函数。在外部时间戳的复制实验中,覆盖40个未见问题簇和480个攻击序列,高保证发布将多数标记从42降至8(差异-7.08,95% CI [-13.13, -2.29]),仍有7个失败残留,1个新引入失败,平均有用性下降0.192。作者强调这些结果确立了在声明式契约下的可审计发布边界与失败归因机制,而非普适的语义安全或学习增益。论文适合关注AI系统安全治理、可审计AI交互、教育场景中LLM安全控制的研究者与安全工程师。

💡 推荐理由: 为LLM辅导系统提供一种可审计、可回放的防泄漏发布控制机制,将安全约束从“结果是否安全”扩展到“过程是否按授权时机披露”,对教育AI和高风险交互场景有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 8.5
Conf: 50%
👥 作者: Enzo Fenoglio, Philip Treleaven

该论文针对跨组织联邦学习(cross-silo FL)中跨边界会话操作准入的审计难题,提出了一种可审计的会话准入网关(Session Admission Gateway)。当前常见的准入方式依赖中心化策略服务、平台配置或临时检查,这些方式随着时间推移容易产生偏差,且难以从边界可见的证据中进行审计。作者设计的网关在组织边界强制执行预批准的会话能力,并生成可验证的决策记录。具体而言,在会话建立阶段,参与组织批准角色和约束条件,并签发签名的会话能力令牌(session capability token),该令牌枚举了针对给定 session_id 允许的会话操作。运行时,每个请求携带令牌和基于请求的持有证明(proof-of-possession),网关通过请求绑定检测令牌重放和身份冒充。准入简化为网关上的无状态逐请求密码学验证和能力匹配,而会话建立和编排超出范围,由各组织自行处理。作者以 MNIST 作为替代负载,在跨组织 FL 工作流上进行了端到端验证,概念验证代码开源、容器化、支持基础设施即代码,并包含可复现的测试和证据日志。

💡 推荐理由: 该研究为跨组织联邦学习中的细粒度、可审计访问控制提供了密码学方案,解决了实际部署中策略漂移和审计证据不足的核心痛点。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Saviz Changizi, Nasibeh Mohammadzadeh, Mohammad Shojafar, Rahim Tafazolli

该论文研究将电信/IoT欺诈控制重新定义为区块链链接的可审计决策管理问题。传统欺诈控制研究通常止步于检测器级别的分类,而实际部署需要请求级别的策略决策、生命周期可追溯性和可审计性。论文提出一个框架,将每个合成部署记录映射为受管理请求,通过确定性硬欺诈门控阻塞显式越界情况,然后使用集中式机器学习(M1)、联邦元学习(M2)或LLM家族风险源(M3)对非硬欺诈请求进行评分,并通过共享五状态策略、两区优化机制和本地以太坊兼容审计层解析行动。实验使用独立的合成训练数据和10万条部署重放语料库,结果显示:在验证集上,M1在合法请求假阳性率(FPR)0.0890(操作上限0.10)和软欺诈召回率0.8341下表现最佳;但在标记部署重放中,合法FPR差距扩大:M1升至0.1646,M3-QLoRA升至0.1801,而M3-QLoRA将M3-Base的合法FPR从0.3915降至0.1801,软欺诈召回率达0.8240。区块链遥测表明,生命周期gas、成本、延迟和吞吐量差异由提交的链下决策配置文件驱动,而非欺诈逻辑变化。主要贡献是展示了QLoRA微调LLM分支比零样本提示更可用,但主要接近而非超越低成本的集中式集成。适合研究可审计欺诈决策管理和区块链集成安全的研究人员阅读。

💡 推荐理由: 该研究首次将区块链可审计性与LLM决策管理结合应用于电信/IoT欺诈控制,提供了请求级别策略解析和全生命周期可追溯性的实用框架,对需要合规审计的欺诈检测系统设计具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ravi Kiran Kadaboina

该论文提出了Pramana,一个用于自治代理网络中的声明验证的协议层解决方案。在受监管领域中,自主代理对每个关键输出必须产生一个可审计的验证工件,记录声明内容、来源、执行者、时间和方式。当前的生产验证分为两个未标准化的方向:概率性判决模式(如自一致性投票、评审LLM集成)产生判断而非工件;而工件产生模式(如RAG、工具增强轨迹、生成器-验证器循环)产生特定于供应商的记录,外部审计员无法在不进行定制集成的情况下重构。Pramana定义了缺失的线路格式:每个关键代理输出被封装在一个类型化的ClaimAttestation中,包含四种变体(测量、推理、类比、引用),每种都配有针对记录源的verify()操作。对于测量声明和引用声明,verify()是确定性的;对于推理声明和类比声明,确定性则取决于预言机(在LLM支持下可审计重放)。这种四类分类源于古典印度认识论(pramana,有效知识的来源)。生命周期在TLA+中指定,并通过TLC在三个对称缩减模型上进行了全面验证:总共38,563个不同的可达状态,零个不变性违反。Python参考实现通过了84个测试。一个A2A和MCP的线扩展清单层叠了三个部署级不变性:可达性、SLA边界和离线可重新验证。一个探索性试点(n=100,2,275次评审调用)探讨了LLM作为代码生成中的评判者。最显著的观察是跨越语料库的40个百分点的原始FPR差异,与参考解决方案质量显著一致。该试点本身并不验证Pramana;结构论证和形式验证做到了这一点。

💡 推荐理由: 该工作为自治代理的可审计性提供了形式化协议层设计,填补了声明验证标准化的空白,对监管合规和信任建立具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kemal Bicakci

这篇论文针对公共机构在资助评审中引入大语言模型(LLM)作为决策辅助工具时面临的治理难题:模型和评分标准不能暴露给申请人以防他们针对优化,但评审过程必须可审计、可质疑且可问责。作者提出了一种基于可信执行环境(TEE)的架构,通过远程证明技术协调上述矛盾。该架构允许外部验证者检查使用的模型、评分规则、提示模板和输入表示,同时不向申请人或基础设施操作者暴露模型权重、专有评分逻辑或中间推理过程。核心成果是“经证明的评审包(attested evaluation bundle)”:一个包含签名和时间戳的记录,关联原始提交哈希、规范化输入哈希、模型与评分规则度量以及评审输出。论文还考虑了场景特定的提示注入风险:申请人控制的文档可能包含隐藏指令影响LLM评估。为此,论文设计了规范化和净化层,用于标准化文档表示并在推理前记录可疑变换。作者将设计置于机密AI推理、可证明AI审计、零知识机器学习、算法问责制和AI辅助同行评议的背景下进行定位。论文的声明刻意狭窄:远程证明不能证明评审是公平或科学正确的,但可以使评审过程的部分环节变得外部可验证。

💡 推荐理由: 该论文直面AI辅助决策中的透明度与保密性矛盾,提出实用架构,对政府、基金机构部署可审计的LLM系统具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)

提出Sovereign Agentic Loops (SAL)架构,通过控制平面解耦LLM推理与执行,验证模型意图后再执行,防止不安全API调用。

💡 推荐理由: 当前LLM代理直接执行随机模型输出存在安全风险,SAL提供结构化的策略执行和审计机制,可显著降低误操作和恶意利用风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)