#tabular-data

共收录 7 条相关安全情报。

← 返回所有主题
推荐 11.5
Conf: 50%
👥 作者: Yuntao Du 0002, Ninghui Li 0001

该论文围绕表格数据合成技术展开系统评估。数据合成被视为在保护数据隐私的前提下利用数据的重要手段,近年来涌现出大量表格数据合成器(synthesizers),其中部分满足差分隐私(Differential Privacy)约束,另一些则仅基于启发式方式提供隐私保护。然而,由于现有评估指标本身存在缺陷,加之新开发的合成器(如基于扩散模型和大型语言模型的方法)缺乏与最先进统计合成器的直接对比,导致研究界对这些合成器的实际优缺点缺乏全面深入的理解。论文旨在通过系统化的评估框架,对多种合成器进行公平、全面的横向比较,揭示其在数据效用、隐私保护能力及可用性等方面的表现。研究可能涵盖对评估指标本身的反思,提出更合理的评估维度,并为合成器的选择提供科学依据。该工作对于隐私保护机器学习、数据发布等应用场景具有重要的参考价值,有助于研究者与从业者摆脱对单一指标或单一算法家族的盲目依赖,从实证角度理解不同技术路线(统计方法、扩散模型、大语言模型)在表格数据合成中的真正潜力与边界。由于当前仅有论文摘要,没有公开详细实验设置与结果,因此本摘要基于摘要信息进行概括,具体结论需参考完整论文。

💡 推荐理由: 表格数据合成是隐私保护技术的重要分支,安全从业者需要评估合成器能否真正防止敏感信息泄露。本论文系统对比了统计、扩散模型和LLM类合成器,揭示了评估指标中的潜在盲区,有助于在选择数据发布方案时避免误用弱隐私保护方法。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yihao Zheng 0001, Haocheng Xia, Junyuan Pang, Jinfei Liu, Kui Ren 0001, Lingyang Chu, Yang Cao 0011, Li Xiong 0001

本文研究面向机器学习训练所用的表格数据集的版权保护问题,提出名为 TabularMark 的水印方法。传统表格数据水印方法在可检测性、非侵入性和鲁棒性等期望属性上存在不足,并且通常仅从数据统计层面保留数据效用,而忽略了水印对下游机器学习模型性能的影响。为此,作者试图回答一个核心问题:能否在不显著损害表格数据集用于训练机器学习模型效用的前提下,为数据集添加水印,同时防止攻击者在被攻击(含水印)的数据集上训练出可用的机器学习模型?TabularMark 方法的核心贡献在于设计了一种兼顾数据统计效用与下游模型性能的水印嵌入机制,使得合法用户在加水印数据上仍能训练出精度可接受的模型,而未经授权使用该数据的攻击者即便得到数据,也难以训练出有效模型。论文通过实验验证了所提方法在可检测性、数据效用保持、鲁棒性以及对抗训练攻击方面的表现。该研究适合数据隐私保护、数据资产管理、机器学习安全以及模型知识产权保护领域的研究者与工程师阅读,属于数据水印与机器学习交叉方向的前沿探索。由于当前仅获取到论文摘要,无法得知具体实验细节与定量结果,整体判断为一项尚处于研究阶段的方法学成果。

💡 推荐理由: 数据是机器学习的关键资产,表格数据水印若能在保护版权同时不影响模型性能,将帮助企业安全团队识别数据泄露源头并遏制未授权模型训练。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jeffery Opoku, David Banahene

该论文提出 SynthGuard-ReleaseBench,一个针对合成表格数据发布的审计框架。传统上,合成数据通常通过真实性、隐私性或下游任务分数来评估,但这些指标无法回答一个关键问题:对于特定的使用场景、目标人群和威胁模型,该发布是否得到支持。为此,作者设计了一个锁定审计流程,在评估之前预先确定用途、候选面板、容差和审计时间表。框架对比真实训练与合成训练的流程在受保护数据上的表现,为有界损失差距提供联合有限样本界,要求设置对照组,并将效用、经验隐私风险、机制声明和人类发布权限分离管理。在四个美国社区调查(ACS)研究、五个非ACS记录、两个时间顺序诊断和一个密封原型中,该基准保留了有利、不利和排除的结果。透明基线通过部分锁定审计,紧凑学习模型在声明预算下失败,一个健康表案例因阴性对照通过而被排除。后续审计扩展实验跨三个生成种子重复,显示相同的锁定标准在足够数据下允许学习模型,同时始终拒绝破坏依赖性的对照,从而证明标准具有区分能力而非简单拒绝;同一重复也撤销了更细粒度的单种子排序。理论部分增加了审计前样本量规则、自适应方差和随时有效的证书(在相同锁定证据上将界收紧2到10倍)、时间顺序审计的时间证书,以及两个下界:普通有界查询在查询预算达到审计规模时可重构受保护审计,且面板大小校正是必要的而非保守的。该工作的贡献是一个可复现的面向特定用途的发布证据工作流,而非声称任何生成器是私有的、安全的或可部署的。适合负责合成数据发布评估、隐私审计和模型治理的研究人员与安全工程师阅读。

💡 推荐理由: 为合成数据发布提供了一个严格的审计框架,锁定用途、对照和预算,弥补了现有评估指标无法回答‘特定场景是否可用’的空白,对数据发布安全治理有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Xin Che, Lingyang Chu, Qiqi Zhang, Xinyu Ma, Xuan Luo, Jian Pei

该论文针对生成式表格数据的水印技术面临的重训练攻击问题,提出了一种具有放射性的水印方法RaMark。现有水印方法在攻击者利用带水印数据集重新训练生成模型后,生成的高效用数据会丢失水印,导致所有权验证失效。RaMark通过将正弦依赖性作为数据分布的内在组成部分嵌入,使水印与底层数据分布耦合,从而确保任何保留数据效用的生成模型也必须保留水印。理论分析表明,移除水印会以高概率降低数据效用并改变数据分布。在两个真实表格数据集上,基于大规模所有权验证场景(包含10^5个独立数据所有者)的实验证明,RaMark在抵抗重训练攻击和数据修改攻击方面显著优于七种最新方法。该研究为隐私敏感数据共享中的所有权保护提供了新途径,适合从事数据安全、生成模型水印研究的学者和工程师阅读。

💡 推荐理由: 首次提出放射性水印概念,从根本上解决了生成式表格数据水印在重训练攻击下失效的问题,强化了数据所有权验证的鲁棒性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vinícius Gabriel Angelozzi, Héber H. Arcolezi

该论文针对差分隐私(DP)合成表格数据中的公平性问题进行了首次系统性基准评估。研究背景是机器学习模型在高风险领域(如金融、医疗)的部署日益普遍,隐私和公平性成为关键关注点。差分隐私已成为隐私保护数据分析的金标准,而公平性机制旨在减轻对弱势群体的歧视。然而,这两项目标可能相互冲突:DP通常放大不同人口统计学群体间的差异,而现有公平性干预措施在DP约束下的有效性尚不清楚。论文的核心方法是以自适应迭代机制(AIM)作为最先进的基于边缘的DP合成器,在四个数据集上、多种群体公平性指标、三类缓解策略(预处理、处理中、后处理)以及广泛的隐私预算下评估公平性干预。比较了四种管线配置:(1)基线(原始数据训练);(2)仅DP(DP合成数据训练);(3)仅公平(在原始数据上应用公平性机制);(4)DP+公平(结合公平性机制与DP合成数据)。主要实验结果表明:仅DP会损害效用和公平性,但应用公平性干预可以部分恢复公平结果。其中,后处理方法在不同隐私预算和合成器下提供更稳定的公平-效用权衡,在保持竞争力的效用同时实现强公平改进。论文贡献包括首次全面评估、开源代码和数据以支持可复现性,并为隐私-公平-效用权衡的未来研究提供基础。适合关注差分隐私、公平性机器学习以及数据合成的研究人员和从业者阅读。

💡 推荐理由: 该研究揭示了差分隐私与公平性之间的冲突,并系统评估了在不同隐私预算下公平性干预的有效性,为安全从业者在隐私保护与公平性之间的权衡提供了实用指导。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Matan Ben-Tov, Daniel Deutch, Nave Frost, Mahmood Sharif

该论文提出了CaFA(Cost-aware Feasible Attacks)系统,旨在评估神经网络表格分类器在实际应用中对抗攻击的鲁棒性。表格数据具有结构化特征和复杂的相互关系,现有对抗攻击方法往往忽略攻击的可行性(即对抗样本在问题空间中是否可实现)以及攻击者的成本(如扰动特征数量和幅度)。CaFA通过两个核心组件解决这些问题:(1)TabPGD算法,一种针对表格数据定制的投影梯度下降变体,能够生成特征空间中的对抗扰动,同时考虑表格特征的异质性(如分类和连续特征);(2)利用数据库技术中自动挖掘的完整性约束(如函数依赖、否定约束等)将特征空间的对抗样本投影到满足这些约束的可行区域,从而确保生成的对抗样本在现实世界中可实现。在三个数据集(如信用卡欺诈检测、贷款审批等)和两种神经网络架构上的实验表明,CaFA相比基线方法(如FGSM、PGD等)具有更高的可行成功率(即被误分类且满足约束的样本比例),同时扰动的特征数量更少、幅度更低,使得攻击更隐蔽且成本更低。此外,CaFA挖掘的约束在声音性和完备性方面优于先前工作。论文还开源了CaFA系统,希望为机器学习工程师提供通用工具,评估模型对可实现攻击的鲁棒性,从而提升部署模型的信任度。

💡 推荐理由: 表格数据在金融、医疗等领域广泛使用,但现有对抗攻击方法常忽视现实可行性。CaFA通过数据库约束确保攻击可实现,为评估表格分类器真实鲁棒性提供了更严格的方法,对构建可信AI具有直接价值。

🎯 建议动作: 研究跟进:评估CaFA对自身表格模型的测试效果,并考虑将其纳入鲁棒性评估流程。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Behrad Tajalli, Stefanos Koffas, Stjepan Picek

机器学习中的后门攻击旨在通过向训练数据中植入恶意样本,使模型在遇到特定触发器时产生攻击者指定的输出。现有研究多聚焦于图像等同质数据,而表格数据因同时包含数值和类别特征,其异构性使得攻击设计更具挑战。本文提出CatBack,一种针对表格数据的通用后门攻击方法。核心创新在于提出一种新的类别特征编码技术:将类别值转换为浮点数表示(而非传统的独热或序数编码),该编码能保留足够信息以保证正常模型的准确率。基于此编码,攻击者可以构建一个基于梯度的通用扰动,该扰动可同时作用于数值和类别特征,形成统一的触发器。在训练阶段,将带有此扰动的样本(后门样本)注入训练集,并标记为攻击目标标签;模型学习后,任何输入若被施加该通用扰动,都会预测为目标标签。作者在5个数据集(涵盖分类与回归任务)和4种流行模型(如决策树、神经网络等)上评估了CatBack,实验显示无论在白盒还是黑盒设置(包括在Google Vertex AI平台上)下,攻击成功率均高达100%。更关键的是,该方法能有效绕过现有多种防御机制,包括Spectral Signatures、Neural Cleanse、Beatrix和Fine-Pruning,以及常见的异常检测方法(如孤立森林)。与已有工作Tabdoor相比,CatBack在攻击成功率、隐蔽性和通用性上均有显著提升。本文揭示了表格数据在机器学习安全中的一个严重脆弱性,表明传统的防御手段在此类新型攻击面前失效,亟需针对异构数据设计更鲁棒的防御方案。

💡 推荐理由: 表格数据在金融风控、医疗诊断、工业检测等关键领域广泛应用,此攻击能绕过现有主流防御,威胁真实ML管线的安全性与可靠性,值得安全从业者高度关注。

🎯 建议动作: 研究跟进,评估自身表格模型对此类攻击的脆弱性,关注未来可能出现的新防御方法。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)