#medical-ai

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

该论文关注医疗AI中多模态数据(图像+文本)的去标识化(de-identification)问题。随着医疗视觉语言模型的发展,图像中可能包含可见的受保护健康信息(PHI),如患者姓名、病历号等,而文本侧也可能泄露隐私。现有方法往往将去标识化与下游任务性能分开评估,缺乏端到端的隐私保护框架。作者提出ClinX,一个面向医疗图像-文本数据的多模态PHI清洗框架。ClinX首先使用光学字符识别(OCR)检测图像中的可见标识符,构建二进制PHI掩码,然后应用ClinX-PRISM模块——一种无跳跃连接(no-skip)的生成式修复模块,结合面向隐私的后处理来抑制烧录的标识符。同时,文本侧通过渐进式去标识化层级减少PHI泄露:包括正则表达式掩码、上下文感知掩码和重写式清洗。作者在医学视觉问答(MedVQA)任务上评估ClinX,联合测量图像侧、文本侧及组合去标识化设置下的PHI泄露和下游效用。实验结果表明,仅使用OCR掩码不足以作为独立解决方案,而基于生成式修复的清洗方法能更好地保留临床相关视觉上下文,同时大幅降低可恢复的PHI。该研究为医疗AI隐私保护提供了新的端到端思路,适合医疗AI开发者、隐私保护研究者和多模态安全从业者阅读。

💡 推荐理由: 医疗多模态数据在训练与推理中面临PHI泄露双重风险,现有掩码方法不足,ClinX提出的生成式修复与渐进式文本清洗为蓝队提供了可借鉴的隐私防护思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lena D. Swamikannan, Akshay Bhagwan Sonawane, Jay S. Patel, C. S. Mani, Lakshmi Narayana, Lakshman Tamil

该论文提出并实现了一个面向智能手机口腔癌筛查的联邦学习(FL)框架,旨在解决医疗AI领域因数据隐私法规和患者数据敏感性导致的高质量临床影像获取困难的问题。传统集中式训练需要汇聚分散在各医疗机构的患者数据,这存在严重的隐私泄露风险,而联邦学习通过仅在本地训练模型并共享模型更新参数,避免了原始数据的集中存储和传输。作者构建了一个实际可运行的FL系统:使用Tailscale作为安全组网层,实现跨地理区域的客户端节点间加密通信和实时协作;服务端聚合采用Flower框架,而客户端部署与调度为手工配置,未使用任何企业级FL平台,体现了轻量化、可复现的特点。为了适配基于智能手机的筛查应用,论文评估了多种轻量级移动端友好架构,包括MobileNetV2、MobileNetV3Large和MobileNetV4-Conv-Small。在FedAvg全局聚合策略下,基于MobileNetV4-Conv-Small构建的全局模型(GM-V4)表现最佳,取得了AUC 0.929和准确率87%的优异成绩。这项工作展示了联邦学习在口腔癌筛查领域的实用可行性,为医疗影像AI的协作开发提供了一套开源、可落地的技术路线,尤其适用于数据分散且隐私要求严格的场景。研究面向医疗AI研究人员、联邦学习工程师以及移动健康应用开发者,核心贡献在于验证了轻量化模型在联邦框架下的有效性,并给出了具体的网络和聚合配置方案。

💡 推荐理由: 该研究展示了联邦学习在医疗影像筛查中的实际落地路径,特别是结合轻量级模型和加密组网,解决了隐私与协作的矛盾,对边缘医疗AI应用有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

该论文聚焦于医疗语言模型(LMs)的隐私评估问题。现有隐私评估往往只关注训练文本的恢复,而非现实威胁模型下的信息泄露。作者提出了一个临床接地的隐私评估框架,按敌手访问权限的梯度分级(从公开可推断的人口统计数据到泄露的笔记片段),在每个级别测量患者特定文本的逐字记忆和敏感诊断的语义泄露。将框架应用于一个在37.8万份临床笔记上预训练的LM,发现常规就诊元数据(如姓名、出生日期、提供者、诊所、就诊日期)能高概率地触发患者时间线内的逐字记忆和敏感诊断恢复(堕胎 AUROC 0.91,HIV 0.81)。同时,精确匹配的记忆可能夸大了信息披露:36%的记忆化标记来自模板化文档。该工作强调了在纵向临床数据上训练的风险,为医疗LMs的上下文隐私评估提供了实用框架。适合医疗AI安全研究员、隐私工程师和临床数据管理者阅读。

💡 推荐理由: 为医疗语言模型提供了贴近临床现实的隐私评估方法,揭示了常规元数据即可导致高度敏感信息泄露,对医疗AI部署中的隐私合规有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)