Page 265 - 《软件学报》2026年第2期
P. 265

744                                                        软件学报  2026  年第  37  卷第  2  期


                    (2) 大规模数据集    (AlexNet/TI、VGG-16/CIFAR-10、VGG-16/TI): 随着数据规模和网络深度的增加, Antelope
                 在计算上的加速优势进一步显现. 例如, 在 VGG-16/TI 上, Antelope 的训练时间比 CryptGPU 快 2.6 倍, 比 FALCON
                 快  78.6 倍, 比 Piranha 快 1.2 倍. 此外, 在推理任务上, Antelope 在 VGG-16/TI 上比 FALCON 快 35 倍, 比 CryptGPU
                 快  8 倍, 比 Piranha 快 3 倍. 这表明尽管数据规模增加带来了更高的通信成本, Antelope 依然能保持稳定的计算优势.
                    (3) 通信开销的影响: 如表      4 所示, Antelope 在大规模数据集上的通信量相较于 CryptGPU 仍然较高            (如 VGG-
                 16/TI 上高 10%). 尽管如此, 由于 Antelope 采用了高效的 GPU 并行计算, 其整体运行时间依然比 CryptGPU 更短.
                 这表明, 即使在通信量相对较高的情况下, Antelope 仍然能够通过优化计算速度来抵消通信开销的影响.
                  4.3   协议基准测试
                    为了更清楚地展示本文协议的优势, 我们在本节提供协议层面的详细对比, 与                         CryptGPU  及  Piranha 进行矩阵
                 相乘、卷积运算和       ReLU  的运行时间对比.
                    ● 矩阵相乘: 在矩阵相乘的实验中设计了两组对比实验. 在第                  1  组实验中, 比较不同维度的方阵相乘所需要的
                 时间; 在第  2  组实验中, 比较不同维度的矩形阵相乘所需时间, 这里矩形尺寸为                   n  代表考察  (n/16)×n  规模的矩阵与
                 n×(n/16) 规模的矩阵相乘. 结果如图      3 所示, 可以看到方阵和矩形阵的实验结果类似, 即当矩阵维数较小                   (≤256) 时
                 本文矩阵相乘算法的速度大概是            CryptGPU  的  4  倍, 但是随着矩阵维度的进一步增大, 速度提升趋于           2  倍. 主要原
                 因在于矩阵乘法中通信所消耗时间的占比越来越重, 而本文线性层协议着重提升本地计算的效率, 所以加速比有
                 一定的降低; 比起     Piranha, 矩阵相乘算法的速度提升平均是         1.2  倍, 这是由于两种协议都是通过专门为矩阵乘法运
                 算编写   CUDA  核来实现线性层, 因而不会产生类似于            CryptGPU 采用多个浮点数编码时带来的开销, 而            Antelope
                 着重利用了 GPU 的存取特性, 将数据放在存取较快的线程块内共享内存上进行运算, 因而在各种规模下都具有相
                 对更快的运算速度.

                                  Antelope  Piranha  CryptGPU                         10.0 10.4
                            10                                                      9.6
                                                                                 7.8
                             8
                                                                               7.4
                           运行时间的对数  6                            3.7  4.6  5.0  5.6
                                                                            6.8
                             4
                                        2.1     2.2     2.5  2.5  2.9
                             2                     1.5  1.8
                                           1.0 1.1
                                    0  0
                             0
                                      64     128      256     512     1 024   2 048   4 096
                                                            方阵尺寸
                                                           (a) 方阵相乘

                             8    Antelope  Piranha  CryptGPU
                                                                                         7.1
                                                                                       6.6
                                                                                    6.2
                           运行时间的对数  4                                    3.3  4.1  4.6  4.9
                             6


                             2          2.0     2.0     2.3     2.8  2.2  2.5
                                                   1.0 1.0  1.0 1.0
                                    0  0    0  0
                             0
                                     128     256      512    1 024    2 048   4 096   8 192
                                                            矩形尺寸
                                                          (b) 矩形阵相乘
                                              图 3 安全矩阵乘法的运行时间比较
   260   261   262   263   264   265   266   267   268   269   270