该论文针对心理健康困扰日益普遍、而各类机构(教育机构、职场、诊所等)虽积累了大量心理健康问卷数据却难以联合建模的问题展开研究。核心矛盾在于两点:一是隐私约束使得原始问卷回答无法集中汇聚;二是各机构的问卷设计高度异构——问题措辞、评分量表、数据格式都不一致,导致数据在语义层面无法直接拼接整合,传统联邦学习(FL)也因模型输入维度与语义不统一而受限。作者提出一种"schema 感知的拆分学习(split learning, SL)"框架,其关键思路是用大语言模型(LLM)充当跨机构的共享语义编码器,将不同来源的异构问卷 schema 对齐到统一表示空间。具体做法是:把每一条问卷记录序列化为一段自然语言描述,从而把彼此不同的问卷结构统一成同一种可被 LLM 理解的文本格式;随后以低秩适配(LoRA)方式对 LLM 进行心理困扰评估任务的微调;再将该模型按拆分学习范式切分到客户端与服务器两侧——客户端本地保留原始问卷回答,只运行一个轻量级前端模块,因此原始记录永远不会离开采集它的机构;而计算密集的模型主干部署在服务器端执行,从而把客户端的算力与内存开销压到最低。实验采用 LLaMA-3.2-3B-Instruct 作为基座,在仅使用 2,000 条训练样本的条件下取得平均 ANLS 0.708 的成绩,在九个实验设置中的八个上优于联邦学习基线,同时将单客户端计算量降低约三个数量级,并展现出对未见数据集的泛化能力。总体而言,该工作为异构、隐私敏感的跨机构协作学习提供了一条"语义统一 + 模型拆分"的可行路径,兼顾了准确性、隐私保护与资源效率。
💡 推荐理由: 它给出了一套可复用的范式:用 LLM 做 schema 语义对齐、用拆分学习把原始敏感数据留在本地,从而在异构且受合规约束的数据源之间完成联合建模。对处理医疗、心理、HR 等敏感问卷数据的安全团队而言,这既是可借鉴的架构,也引入了新的客户端-服务器信任边界与模型供应链风险。
🎯 建议动作: 研究跟进