# 聚合之外:FedAvg算法困境与数据不均衡的多元解法
联邦学习在过去五年间从“分布式隐私训练”的单一叙事,裂变为包含统计异质性、系统异质性、参与异质性、目标异质性的复杂问题域。FedAvg作为奠基性算法,其加权平均框架在独立同分布假设下优雅有效,但面对真实世界的数据不均衡,这一假设几乎从不成立。理解FedAvg的边界,并追踪此后衍生出的修复路径,是把握联邦学习演进脉络的关键。
## FedAvg的核心假设与先天困境
FedAvg的核心操作极为简洁:服务器聚合各客户端本地更新,以**数据量加权**形成新一轮全局模型。这一设计隐含两项强假设:其一,各客户端数据分布独立同分布,本地梯度是全局梯度的无偏估计;其二,客户端参与概率与其数据量正相关,加权平均可自然逼近全局经验风险最小化。
然而真实场景中,**数量不均衡**与**类别不均衡**构成双重挑战。部分客户端数据量稀缺<"gmb.p5k3.org.cn">导致局部更新方差过大;更多情形下,客户端仅持有少数类别的样本,本地优化目标与全局目标严重偏离。FedAvg在此类非独立同分布(Non-IID)环境下,全局模型易偏向占据主导的类别或客户端,尾部类别与稀缺客户端被系统性忽视。实验表明,极端异构场景下FedAvg准确率可骤降10%至30%。
## 解法路径之一:模型修复与原型校准
针对类别不均衡导致“弱类别被淹没”的问题,**模型修复**思路从全局模型入手,在聚合后对分类边界进行主动校准。2025年提出的FedMR(Federated Learning Based on Model Repair)是此方向的代表性工作。
FedMR在每轮全局聚合之后、本地训练之前插入**修复步骤**。各客户端使用同一特征提取器生成局部原型(prototype),即各类别特征向量的均值中心。这些原型差异较小,以此微调全局分类器,使模型对样本量稀少的类别恢复响应能力。修复后的分类器重新聚合后分发,所有客户端从更均衡的共识点启动本地训练。这一设计将修复时机置于全局模型广播后,既规避了原始数据共享,也使弱类别在每轮迭代中获得“被关注的机会”。
## 解法路径之二:个性化联邦学习
当数据异质性严重到全局单模型无法同时适配所有客户端时,**个性化联邦学习**成为自然转向。其核心认知是:放弃“一个模型通吃全局”的目标,转而为每个客户端维护差异化模型。
FedALA是近年个性化联邦学习的重要进展,其自适应局部聚合机制为每个客户端学习一个**私有权重**,精细化控制全局模型对本地模型的贡献程度。此机制使本地模型在继承全局知识的同时,向本地数据分布偏移。在此基础上,pFedALA进一步优化同步等待期间的计算资源利用,令快速客户端在等待期间继续本地训练,平均测试准确率较FedALA提升约1%。
另一条个性化路径是**联邦互学习**(FML),为每个客户端配备“meme模型”与“个性化模型”双架构。前者负责与服务器同步全局知识,后者在本地数据上专精优化,两者通过深度互学习双向取经。在CIFAR-100极端非IID设置下,FML全局模型准确率达51.86%,高于FedAvg的50.36%与FedProx的49.51%;个性化模型在本地私有数据上精度提升15%至20%。
## 解法路径之三:参与异质性与陈旧更新利用
数据不均衡的另一维度是**参与异质性**——部分客户端因算力、电量、网络条件等原因极少参与训练。FedAvg仅聚合本轮参与客户端的“新鲜”更新,完全丢弃未参与客户端的过往贡献。
FedStale算法正视这一问题,将全局模型更新构造为**参与客<"dbrf.p5k3.org.cn">户端新鲜更新与非参与客户端陈旧更新的凸组合**。通过调整组合权重,FedStale可在FedAvg(仅新鲜)与FedVARP(平等对待新鲜与陈旧)之间平滑插值。理论分析揭示:陈旧更新的价值随数据异质性降低、参与异质性升高而衰减;收敛误差受参与频率最低的客户端制约。这一视角将“参与不均”从工程约束升格为可优化的算法变量。
## 解法路径之四:服务器端数据辅助
当客户端数据普遍稀缺时,无论加权平均还是个性化调整均难为无米之炊。2024年提出的FedDS(Federated learning with entropy-weighted ensemble Distillation and Self-supervised learning)另辟蹊径:**利用服务器端无标注数据**增强模型泛化能力。
FedDS以集成蒸馏方式将多个客户端模型<"xvv.p5k3.org.cn">的知识迁移至服务器模型,并提出**熵加权法**——对置信度更高的伪标签赋予更大权重。同时引入自监督损失项,提升服务器模型表示能力。在数据稀缺设定下,FedDS较FedAvg在CIFAR-10提升12.54%,在CIFAR-100提升18.68%。此路线启示:联邦学习的数据不均衡问题,未必只能在客户端侧求解;服务器侧未利用的无标数据是待开发的资源。
## 收敛条件与优化器的再审视
算法改进之外,联邦学习优化环节的基础设施同样值得反思。传统单机深度学习中的主流优化器(Adam等)在联邦异构环境下表现未必最优。针对FedAvg、FedALA、pFedALA的对比实验表明:**SGD、ASGD、AdaGrad在非独立同分布数据下展现出更强的适应性与鲁棒性**,而Adam的优势并不显著。这一发现提示,联邦学习系统的性能瓶颈未必来自聚合规则,也可能潜藏于局部更新环节的优化器选择。
## 联邦学习的工具箱化
回顾FedAvg至今的演进脉络,一个清晰趋势是**从单一算法向工具箱的转变**。面对数据不均衡,不再寻求某种“终极解法”,而是在模型修复、个性化、陈旧更新利用、服务器辅助等多个维度上积累可组合的模块。FedMR修复分类器,FedALA学习私有权重,FedStale回收陈旧更新,FedDS激活服务器数据——这些方法互不排斥,未来联邦学习框架或将允许开发者根据自身数据分布特征,勾选所需组件。
联邦学习的未来,不在对FedAvg的彻底替代,而在对FedAvg隐含假设的逐层松绑。每解除一项“理想条件”,工具箱中便多出一件应对现实的武器。