#benchmarking

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Beatrix Koltai, Gergely Acs, Andras Gazdag

现代车辆通信网络的日益互联使得保护车内通信网络成为关键挑战。入侵检测系统(IDS)作为检测控制器局域网(CAN)总线恶意活动的防御机制被广泛研究。然而,由于实验设置不一致和缺乏标准化基准测试框架,CAN IDS 方法的评估仍然困难。因此,报告的性能往往依赖于数据集特定特征,可能无法反映检测方法在不同环境下的表现。本文引入了一个基准测试框架,用于跨多个数据集对 CAN IDS 进行一致评估。利用该框架,我们整合了在不同实验条件下收集的七个公开 CAN IDS 数据集,并对五种概念上不同的 IDS 方法进行了跨数据集评估。我们的结果强调了检测性能在不同数据集间可能显著变化,证明了跨数据集基准测试对于评估 CAN IDS 方法的鲁棒性和泛化能力的重要性。

💡 推荐理由: CAN IDS 评估的不一致可能导致实际部署中性能失真,该工作通过系统化的跨数据集基准测试,为工业界和学术界提供了更可靠的评估标准,有助于提升 IDS 的实际防御效果。

🎯 建议动作: 研究跟进,考虑将框架应用于内部 IDS 评估流程

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shijing Hu, Liang Liu, Zhu Meng, Zhicheng Zhao

本文提出了 ToolPrivacyBench,一个用于评估使用工具的 LLM 智能体(Agent)在目的绑定隐私保护方面的基准。现有评估主要关注任务完成度和 API 正确性(如函数调用基准)或最终响应中的隐私泄露(如隐私判断基准),但忽略了在多工具执行轨迹中信息流是否严格遵循“按需知道”原则。ToolPrivacyBench 的核心思想是:一个智能体在执行多步骤任务时,每个工具应当仅接收完成其明确目的所必需的信息,而非过度暴露无关的私有数据。为此,基准将每个测试用例表示为一个策略知识库(policy knowledge base),定义了任务相关的私有原子(task-private atoms)及其授权流向。智能体在模拟业务后端执行后,评估器会比较记录的工具参数和后端审计日志与策略知识库,检测是否存在隐私过度披露(privacy over-disclosure)。基准包含 2,150 个用例:1,150 个完全合成的隐私敏感业务工作流,以及 1,000 个改编自现有多工具和函数调用基准的用例。作者评估了 9 个广泛使用的智能体(如 ReAct、AutoGPT 等),结果表明任务成功并不等同于隐私保护得当——某些智能体在完成任务的同时通过中间工具调用传输了不必要的私有信息。该基准的形式化贡献在于定义了“按需知道”的披露边界,并通过轨迹级审计来识别多工具工作流中的隐私过度披露问题,为构建更安全的 LLM 代理系统提供了新的评估维度。适合人工智能安全、隐私保护、LLM 代理开发与评估的研究者和工程师阅读。

💡 推荐理由: 现有基准只关注任务完成或最终回答的隐私,忽略了工具调用链中的信息过度共享。该工作填补了多工具轨迹隐私评估的空白,有助于发现代理在实际部署中无意泄露敏感信息的风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)