传统机器学习训练需要把海量数据集中到同一台服务器,但医疗、金融、政务等领域的数据高度敏感,难以跨机构集中。联邦学习提供了一条新路径:模型在本地设备或机构各自训练,只把加密后的参数上传到中心服务器聚合,原始数据始终不出本地。这样既避免了数据搬迁带来的合规风险,又能让分散的数据共同哺育一个更强大的模型,实现「数据可用不可见」的目标。
联邦学习主要分为横向与纵向两类。横向联邦适用于不同机构拥有相同特征、不同样本的场景,比如多家医院各自持有病人的病历数据,可以共同训练一个疾病预测模型。纵向联邦则适用于样本重叠但特征互补的场景,例如银行和电商平台拥有同一批用户的不同维度信息,可以联合刻画用户画像。理解这两类模式,有助于企业在具体业务中选对协作架构。
联邦学习虽然理念成熟,落地仍有门槛。通信开销是一大难点,模型参数在多个节点间反复传输,网络不稳定会拖慢训练。异构性是另一重挑战,不同参与方的数据分布、设备算力差异很大,需要算法能够自适应。此外,隐私保护机制如差分隐私、安全多方计算与联邦学习的结合仍在演进中。随着算力成本下降和标准逐步完善,联邦学习有望在医疗、金融风控、智慧城市等领域率先规模落地。