#multimodal-synthesis

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Kai Chen, Josephine Lamp, Somesh Jha, Tianhao Wang

本文研究差分隐私(DP)下的成对表格-图像多模态数据合成问题。在医疗、金融等真实场景中,常存在图像与结构化表格记录配对的数据,但现有DP合成方法多数只单独处理表格或图像,难以同时保证两种模态的保真度以及跨模态依赖关系。针对这一挑战,作者提出DP-TabImage,一个模态专用私有配对合成框架。该方法将联合分布p(x,y)分解为p_T(y)p_I(x|y),其中表格分布采用私有概率图模型(PGM),图像分布使用表格条件扩散模型,通过DP-SGD训练。由于裁剪和噪声梯度的干扰,条件扩散较难训练,文章进一步提出在私有表格-图像原型上进行预训练:先从差分隐私方式构建属性条件图像,并将私有表格模型得到的表格向量与之配对,在不增加隐私预算的情况下提升条件学习。实验基于三个真实数据集,从表格保真度、图像保真度和跨模态对齐三个维度评估。结果证明DP-TabImage相对现有基线实现了更优的平衡。消融分析表明,视觉预热主要提高边缘图像质量,而对齐的表格-图像预热对于跨模态一致性的提升更为重要。代码开源。这项工作的核心贡献是首次为配对表格-图像数据提供专用DP合成框架,解决多模态在不同隐私机制下的兼容性问题,可作为隐私保护数据发布、数据增强等应用的潜在方案。适合研究差分隐私、生成式模型以及医疗、自动驾驶等敏感多模态数据的从业者阅读。

💡 推荐理由: 多模态敏感数据(如医疗影像+病历)的隐私发布长期缺乏专用工具,DP-TabImage 提供第一个实用框架,让合成数据在保护隐私的同时保持跨模态对齐,对数据安全共享、模型训练有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)