#trust-evaluation

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Botao Zhu, Xianbin Wang

在分布式系统中,选择可信赖的协作者对于高效完成任务至关重要,通常需要从过去的协作经验中推断其可信度。然而,协作者在过往协作中可能服务于不同设备、面临不同场景,导致其信任相关数据具有多源、异构且质量不均的特点。传统信任评估方法难以处理这种复杂情况,准确性不足。针对该问题,论文提出了一种基于多视角证据学习(MVE)的信任评估方法。首先,为了处理多源异构的信任数据,方法将每个与潜在协作者交互过的任务所有者视为一个独立的观察视角,从而评估协作者在该视角下的特定信任。其次,针对信任随环境动态演化的问题,利用Mamba模型强大的长序列建模能力,捕获每个视角中协作者信任状态的深层时间模式。再次,为了量化各视角信任评估的确定性水平,方法引入证据深度学习机制,在输出信任评估结果的同时,量化其背后的主观不确定性。最后,设计了一种动态证据融合策略,根据各视角量化的不确定性自适应地集成多视角证据,从而得出对协作者的最终信任评估。实验结果表明,MVE方法在信任评估准确率和任务成功率两方面均优于现有基线方法。该研究为分布式环境下的信任管理提供了新的思路,尤其适用于需要融合多维不确定信息的场景。

💡 推荐理由: 信任评估是分布式系统与协作安全的基础,MVE方法通过多视角建模和不确定性量化提升了评估鲁棒性,对设计防御性信任机制具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

本论文针对检索增强生成(RAG)系统中的安全性与可靠性缺口展开研究。RAG 通过引入外部知识来增强大语言模型(LLM)的输出,但现有系统往往盲目信任检索结果,导致高语义相关性并不保证事实真实性,从而形成安全-可靠性缺口。攻击者可利用知识投毒(Knowledge Poisoning)的方式,插入恶意文档,诱导模型生成定向错误信息。为此,论文提出一种评估代理(Evaluation Agent)作为中间件,结合自然语言推理(NLI)事实核查、包含加权聚合的五信号毒物检测器,以及信任指数 T = 0.4F + 0.35C + 0.25(1-P),并对高污染场景引入非线性阻尼器。在 TruthfulQA 基准上使用 Llama 3.3 70B 模型,该代理达到 91% 的准确率和 100% 的精确率,对指令注入(Instruction Injection)的召回率达到 100%;但对实体替换这类就地编辑(in-place edits)仍难以检测。在三个不同 LLM 上,信任指数保持区分度,ROC-AUC 介于 0.73 至 0.81;实验表明,生成风格比模型规模影响更大,且针对不同 LLM 校准阈值可恢复接近基线的竞争性准确率。而在较弱 FEVER 数据集上的结果则说明跨数据集泛化需要领域特定校准。在软件工程场景中,基于 OWASP Top 10 和 CWE 的安全编码助手,该代理能可靠阻止不安全建议的指令注入(F1 分数 92%),但矛盾信息与细微语义弱化仍然难以识别。研究强调,代理主要测量生成前对毒化上下文的检测能力,而非 LLM 是否实际采用了注入的错误信息。论文已发布相关方法、攻击生成器及实验工件。本文适合研究 RAG 安全、LLM 可信度评估及对抗性机器学习的读者参考。

💡 推荐理由: RAG 系统在生产环境迅速普及,但检索信任缺失导致知识投毒与误导信息风险极高。该评估代理提供了一种可落地的中间件方案,能有效检测指令注入等典型攻击,直接提升 LLM 应用的安全基线,值得安全工程师和 AI 平台团队关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)