Page 264 - 《软件学报》2026年第2期
P. 264

余欢 等: Antelope: 基于  GPU  的三方隐私保护机器学习框架                                           743


                    安全训练: 表    3 和表  4 分别展示了一些已有的开源架构          FALCON、CryptGPU, 以及最先进的     Piranha-FALCON
                 (以下简记   Piranha) 和本文工作安全训练的运行时间和总通信量. 其中              TI 指的是  TinyImageNet 数据集, C-10  指的
                 是  CIFAR-10  数据集. 对于  LeNet/MNIST、AlexNet/CIFAR-10  和  AlexNet/TI 的训练批量大小均为    128, VGG-
                 16/CIFAR-10  的训练批量大小为     32, VGG-16/TI 的训练批量大小为     8. 由于  FALCON  不支持输出层的梯度计算,
                 因此其运行时间仅包括不含输出层的计算时间. 此外, 可以看到本文较                      CryptGPU  方案的总通信量有一定程度的
                 减少, 但是跟   FALCON  和  Prianha 相比, 本文的总通信量较高. 正如上文的分析, 我们的安全比较协议虽然在一定
                 程度上增加了通信量, 但交互轮数少的优势仍能显著减少整体运行时间.

                              表 3 实验设置信息                      表 4 在不同模型和数据集上安全训练的时间对比                 (s)

                   数据集     网络模型 优化器 学习率 批量大小 训练轮数                     LeNet/ AlexNet/ AlexNet/ VGG-16/  VGG-
                                                                架构
                   MNIST     LeNet  Adam  0.001  64   20              MNIST CIFAR-10  TI  CIFAR-10  16/TI
                  CIFAR-10  AlexNet  SGD  0.01  128   30       FALCON  15.43  60.98  368.73  426.48  377.47
                 Tiny ImageNet VGG-16  SGD  0.005  256  50    CryptGPU  1.62  2.35  10.05   11.28  12.85
                                                               Piranha  0.83  1.29   6.37   5.33   5.79
                                                               Antelope  0.52  0.73  3.61   4.21   4.80
                    具体来说, 与    FALCON  相比, 由于  GPU  的并行计算能力, Antelope 的运算速度提高了          29–101  倍. 可以看出,
                 与  FALCON  相比, Antelope 在训练深度网络和大型数据集时具有很大的优势. 与               CryptGPU  相比, 在浅层网络和
                 小规模数据训练      (即  LeNet/MNIST  和  AlexNet/CIFAR-10) 时, Antelope 比  CryptGPU  快  3  倍左右. 随着网络层数和
                 输入数据大小的增加, 通信所消耗的时间进一步增加, 但                 Antelope 仍保持更快的运行速度, 平均较         CryptGPU  快
                 2.5  倍. 与  Piranha 相比, 我们在浅层网络  LeNet 和  AlexNet 上的运行速度快  1.6  倍左右, 而在深层网络     VGG-16  上
                 快  1.2  倍.
                    安全推理: 表    5  展示了  FALCON、CryptGPU、Piranha 和本文工作安全预测的运行时间, 且所有实验都运行
                 在批量大小为     1  的设置下. 从表   5  中数据可以看出, CryptGPU     在浅层网络和小数据集上          (即  LeNet/MNIST  和
                 AlexNet/CIFAR-10) 的性能表现要差于    FALCON. 随着模型加深和数据规模的进一步扩大               (即  VGG-16/CIFAR-10
                 和  AlexNet/TI), CryptGPU  的表现仍然不如  FALCON. 只有在深层网络和大规模数据的预测上                (VGG-16/TI),
                 CryptGPU  比  FALCON  快  4.5  倍. 原因是在小规模计算中, CryptGPU  不能很好地利用     GPU  的计算能力, 并花费额
                 外时间将   64  位整数转换为浮点数. 此外, FALCON       是基于   C++实现的, 与   Python  相比, C++在速度上更有优势.

                                       表 5 在不同模型和数据集上安全训练的总通信量                (GB)

                             架构     LeNet/MNIST  AlexNet/CIFAR-10  AlexNet/TI  VGG-16/CIFAR-10  VGG-16/TI
                           FALCON       0.35         0.62        1.78        2.35        1.78
                           CryptGPU     0.67         0.69        5.59        6.20        6.24
                            Piranha     0.42         0.58        3.30        4.26        4.28
                           Antelope     0.56         0.82        4.69        5.58        5.61

                    然而在   CryptGPU  表现较差的网络模型中, Antelope 的性能仍然优于          FALCON, 较  FALCON  快  1.6–11.3  倍.
                 在深层网络和大规模数据         (VGG-16/TI) 上, Antelope 比  FALCON  快  35  倍. 这表现了  Antelope 协议在不同规模计
                 算中的稳定性. 此外, Antelope 比    CryptGPU  最多快  15  倍, 平均快  11  倍. 与  Piranha 相比, Antelope 最多快  3.5  倍,
                 平均快   2.8  倍.
                    为了进一步分析 Antelope 在不同数据规模下的适用性, 我们对比了小规模数据集                      (LeNet/MNIST、AlexNet/
                 CIFAR-10) 和大规模数据集     (AlexNet/TI、VGG-16/CIFAR-10、VGG-16/TI) 上的运行时间变化趋势. 从表      3 和表  5
                 的实验结果可以观察到以下几点.
                    (1) 小规模数据集    (LeNet/MNIST、AlexNet/CIFAR-10): 在计算较少的浅层网络中, Antelope 的优势主要体现
                 在计算加速, 而通信量的影响较小. 相较于 CryptGPU, Antelope 在 LeNet/MNIST 和 AlexNet/CIFAR-10 上的训练
                 速度加快约 3 倍, 推理速度加快 6.2 倍. 这说明即使在较小数据集上, Antelope 依然能够利用 GPU 并行计算能力,
                 提高计算效率.
   259   260   261   262   263   264   265   266   267   268   269