#ai-sandbox

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Inderjeet Singh, Haitham Mahmoud, Andrés Murillo

本文提出了一个针对AI沙箱的威胁模型、分类法和测量框架。随着AI系统越来越多地在受限环境中进行评估(结合隔离、仿真、检测、监督和证据捕获),尤其是物理AI、AIoT和网络物理系统,测试环境的可信度和安全性变得至关重要。作者首先形式化了沙箱边界的概念,并定义了将各维度证据组合成有界部署声明的最弱链规则。接着,他们区分了主要的沙箱原型(如数字AI沙箱、具身自主沙箱和网络物理沙箱)。在此基础上,提出了一个涵盖物理过程和网络设备的网络物理威胁模型,该模型不仅考虑对被测系统的攻击,还考虑对保证装置本身的攻击(例如操纵传感器数据、干扰通信链路或欺骗监督机制)。最后,引入了一个测量框架,包括保真度、可控性、可观察性、隔离性、可重复性和治理工件等维度,并通过三个真实沙箱的案例研究进行了实例化。该框架帮助从业者理解沙箱能够有效测试什么、可以控制哪些风险以及能支持哪些形式的安全、安保和监管保证证据。本文的主要贡献在于为AI沙箱的安全评估提供了系统化的理论基础和实践指导,适合AI安全工程师、测试验证团队及监管机构阅读。

💡 推荐理由: AI沙箱是评估AI系统安全性和可靠性的关键手段,但沙箱本身可能成为攻击目标。本文首次系统化地分析了沙箱的威胁模型和测量方法,帮助蓝队和安全工程师构建可信的测试环境,确保评估结果不被篡改或欺骗。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)