Page 407 - 《软件学报》2026年第3期
P. 407
1370 软件学报 2026 年第 37 卷第 3 期
● 带宽损耗. 我们在具有带宽约束的条件下进行实验来测试 FedAlt 和其他 3 种基线方法的性能. 由图 6 可知,
无论在 CIFAR-10 还是 CIFAR-100 上, 当给定一定带宽损耗进行联邦学习训练之后, FedAlt 相比于其他基线方法
都拥有最好的性能. 例如, 对于 CIFAR-10 数据集, 当给定带宽预算不超过 90 GB 时, FedAlt 训练出的全局模型的
最高测试精度为 81.52%, 而 FedAvg、FedProx、MOON 和 BOSE 训练出的全局模型的最高测试精度分别为
78.52%、79.60%、80.09% 和 80.76%; 对于 CIFAR-100 数据集, 当给定带宽预算不超过 90 GB 时, FedAlt 训练出
的全局模型的最高测试精度为 52.67%, 而 FedAvg、FedProx、MOON 和 BOSE 训练出的全局模型的最高测试精
度分别为 51.26%、48.45%、48.55% 和 51.89%, 我们的方法相比于基线方法平均提高了约 2.64% 的精度. 这是因
为大部分基线方法在服务器和客户端之间传输的始终是完整的模型, 而 FedAlt 在全局轮次开始时服务器只向客
户端发送部分模型块, 所以 FedAlt 相对于这些基线方法大大减少了带宽的损耗.
55
80
50
75
测试精度 (%) 70 测试精度 (%) 45
65
40
60 FedAvg FedAvg
FedProx
FedProx
MOON 35 MOON
55 FedAlt FedAlt
BOSE BOSE
50 30
30 60 90 120 150 30 60 90 120 150
带宽 (GB) 带宽 (GB)
(a) 在 CIFAR-10 数据集上具有带宽约束的测试精度 (b) 在 CIFAR-100 数据集上具有带宽约束的测试精度
图 6 不同方法在 CIFAR-10 和 CIFAR-100 上具有带宽约束的测试精度
● 不同 non-IID 程度的影响. 在不同的 non-IID 程度下, 我们统计了不同方法在 CIFAR-100 数据集上经过固定
轮次 (例如 200 轮) 的全局训练得到的模型的测试精度. 根据表 1, 在 IID 设置下, FedAlt 训练出的全局模型的测试
精度与其他 4 种方法几乎相同. 然而, 通过使用块级多输出正则化和知识自蒸馏技术, FedAlt 在 non-IID 设置下可
以实现最高的测试精度. FedAlt 相对于 4 个基线方法的测试精度提升会随着 non-IID 程度的增加而增加. 例如, 在
极端 non-IID 设置 (即 ε = 9) 下, CIFAR100 上 FedAlt 的测试精度为 40.4%, 而 FedAvg、FedProx、MOON 和
BOSE 的测试精度分别为 37.6%、37.9%、38.6% 和 39.25%. 因此, FedAlt 有效缓解了由 non-IID 问题导致的模型
训练性能下降问题.
表 1 不同 non-IID 程度 ε ( ) 下不同方法训练得到的全局模型的测试精度
ε FedAvg FedProx MOON BOSE FedAlt
0 56.32 56.46 56.26 56.29 56.31
5 52.40 52.62 54.54 54.66 55.37
7 51.07 49.89 50.65 51.74 53.07
9 37.61 37.96 38.62 39.25 40.41
δ 对训练性能也会产生影响. 在实
● 温度超参数的影响. 客户端本地损失函数中知识蒸馏项中的温度超参数
验中, 我们通过使用不同的温度来测试 FedAlt 的性能. 表 2 展示了不同的温度值在两种数据集 CIFAR-10 和
CIFAR-100 上对 FedAlt 训练出的全局模型的性能影响. 可以看到, 在 CIFAR-10 数据集上进行训练时, δ = 2.5 时训
练出的全局模型拥有最好的性能; 在 CIFAR-100 数据集上进行训练时, δ = 1.0 时训练出的全局模型拥有最好的性
能. 注意, 我们在其余实验过程中统一使用 δ = 1.0 与其余基线方法进行对比.

