FedCC: Towards Addressing Label Distribution Skews in Distillation-Based Federated Learning

📄 arXiv: 2608.23031v1 📥 PDF

作者: Wenxuan Ye, Onur Ayan, Xueli An, Georg Carle

分类: cs.LG, cs.AI

发布日期: 2026-08-24

备注: Accepted to Globecom 2026


💡 一句话要点

提出FedCC以解决蒸馏基础联邦学习中的标签分布偏斜问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 联邦学习 标签分布偏斜 蒸馏训练 模型校准 不确定性处理 机器学习 数据隐私

📋 核心要点

  1. 现有的基于蒸馏的联邦学习方法在面对异构本地数据时,容易导致标签分布偏斜,影响模型的准确性。
  2. FedCC允许客户端将模糊样本标记为'未知',通过引入这一额外类别来缓解误分类问题,从而提高模型的鲁棒性。
  3. 在极端情况下,每个客户端仅持有十个类别中的一个样本时,FedCC的准确率达到67.3%,而基线方法几乎随机预测,表现大幅提升。

📝 摘要(中文)

联邦学习(FL)使得分布式客户端能够在不共享原始数据的情况下协作训练模型,适用于通信网络中的大量设备。在基于蒸馏的FL中,每个客户端在未标记的公共数据集上应用其本地模型,并仅与服务器共享预测结果。然而,异构的本地数据导致标签分布偏斜,使得客户端模型偏向于多数类,从而可能导致不准确的预测。由于公共数据集中缺乏真实标签,服务器无法校准预测,最终降低整体性能。为此,本文提出了FedCC,一种简单有效的算法,用于减轻客户端的误分类。客户端可以将模糊样本标记为“未知”,这一额外类别与公共数据上的校准伪标签相结合,平衡了对多数类的信心与对少数类的不确定性。大量实验表明,FedCC在严重标签偏斜的情况下显著优于现有方法。

🔬 方法详解

问题定义:本文旨在解决基于蒸馏的联邦学习中,由于标签分布偏斜导致的客户端模型偏向多数类的问题。现有方法在缺乏真实标签的情况下,难以有效校准预测,影响整体性能。

核心思路:FedCC的核心思路是允许客户端将模糊样本标记为“未知”,从而避免错误传播。通过引入这一额外类别,结合公共数据上的校准伪标签,平衡对多数类的信心与对少数类的不确定性。

技术框架:FedCC的整体架构包括客户端模型的训练、模糊样本的标记以及伪标签的生成。客户端在本地进行模型训练后,将预测结果发送至服务器,服务器根据这些结果进行全局模型的更新。

关键创新:FedCC的主要创新在于引入了“未知”类别,允许客户端在面对不确定样本时不进行分类,从而有效减少误分类的风险。这一设计与传统方法的本质区别在于不强制分类,降低了错误传播的可能性。

关键设计:在FedCC中,关键参数包括模糊样本的识别阈值和伪标签的生成策略。损失函数设计上,结合了对多数类的信心损失和对未知样本的处理,确保模型在训练过程中能够有效学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,FedCC在极端标签偏斜的情况下表现优异,准确率达到67.3%。相比之下,基线方法的表现几乎接近随机预测,显示出FedCC在处理标签分布不均时的显著优势,提升幅度明显。

🎯 应用场景

该研究的潜在应用领域包括医疗诊断、金融欺诈检测和智能交通系统等,尤其是在数据隐私和安全性要求较高的场景中。FedCC能够有效提升模型在不平衡数据分布下的性能,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Federated Learning (FL) enables distributed clients to collaboratively train models without sharing raw data, making it promising for leveraging massive devices in communication networks. In distillation-based FL, each client applies its local model on an unlabeled public dataset, and shares only prediction results with the server. While heterogeneous local data introduces label distribution skew, thus biasing client models toward majority classes and leading to potentially inaccurate predictions. The lack of ground-truth labels in the public dataset hampers the server's ability to calibrate predictions, which ultimately degrades overall performance. To address this, we propose FedCC, a simple and effective algorithm for mitigating client misclassification. Instead of being forced to classify and risking error propagation, clients are allowed to tag ambiguous samples as 'unknown'. This additional class, together with calibrated pseudo-labels on the public data, balances confidence in majority classes against uncertainty in under-represented ones. Extensive experiments demonstrate that FedCC significantly outperforms existing methods, especially under severe label skew. In the extreme scenario where each client holds samples from only one of ten classes, FedCC achieves 67.3% accuracy, while baselines collapse to near-random results.