Page 265 - 《软件学报》2026年第2期
P. 265
744 软件学报 2026 年第 37 卷第 2 期
(2) 大规模数据集 (AlexNet/TI、VGG-16/CIFAR-10、VGG-16/TI): 随着数据规模和网络深度的增加, Antelope
在计算上的加速优势进一步显现. 例如, 在 VGG-16/TI 上, Antelope 的训练时间比 CryptGPU 快 2.6 倍, 比 FALCON
快 78.6 倍, 比 Piranha 快 1.2 倍. 此外, 在推理任务上, Antelope 在 VGG-16/TI 上比 FALCON 快 35 倍, 比 CryptGPU
快 8 倍, 比 Piranha 快 3 倍. 这表明尽管数据规模增加带来了更高的通信成本, Antelope 依然能保持稳定的计算优势.
(3) 通信开销的影响: 如表 4 所示, Antelope 在大规模数据集上的通信量相较于 CryptGPU 仍然较高 (如 VGG-
16/TI 上高 10%). 尽管如此, 由于 Antelope 采用了高效的 GPU 并行计算, 其整体运行时间依然比 CryptGPU 更短.
这表明, 即使在通信量相对较高的情况下, Antelope 仍然能够通过优化计算速度来抵消通信开销的影响.
4.3 协议基准测试
为了更清楚地展示本文协议的优势, 我们在本节提供协议层面的详细对比, 与 CryptGPU 及 Piranha 进行矩阵
相乘、卷积运算和 ReLU 的运行时间对比.
● 矩阵相乘: 在矩阵相乘的实验中设计了两组对比实验. 在第 1 组实验中, 比较不同维度的方阵相乘所需要的
时间; 在第 2 组实验中, 比较不同维度的矩形阵相乘所需时间, 这里矩形尺寸为 n 代表考察 (n/16)×n 规模的矩阵与
n×(n/16) 规模的矩阵相乘. 结果如图 3 所示, 可以看到方阵和矩形阵的实验结果类似, 即当矩阵维数较小 (≤256) 时
本文矩阵相乘算法的速度大概是 CryptGPU 的 4 倍, 但是随着矩阵维度的进一步增大, 速度提升趋于 2 倍. 主要原
因在于矩阵乘法中通信所消耗时间的占比越来越重, 而本文线性层协议着重提升本地计算的效率, 所以加速比有
一定的降低; 比起 Piranha, 矩阵相乘算法的速度提升平均是 1.2 倍, 这是由于两种协议都是通过专门为矩阵乘法运
算编写 CUDA 核来实现线性层, 因而不会产生类似于 CryptGPU 采用多个浮点数编码时带来的开销, 而 Antelope
着重利用了 GPU 的存取特性, 将数据放在存取较快的线程块内共享内存上进行运算, 因而在各种规模下都具有相
对更快的运算速度.
Antelope Piranha CryptGPU 10.0 10.4
10 9.6
7.8
8
7.4
运行时间的对数 6 3.7 4.6 5.0 5.6
6.8
4
2.1 2.2 2.5 2.5 2.9
2 1.5 1.8
1.0 1.1
0 0
0
64 128 256 512 1 024 2 048 4 096
方阵尺寸
(a) 方阵相乘
8 Antelope Piranha CryptGPU
7.1
6.6
6.2
运行时间的对数 4 3.3 4.1 4.6 4.9
6
2 2.0 2.0 2.3 2.8 2.2 2.5
1.0 1.0 1.0 1.0
0 0 0 0
0
128 256 512 1 024 2 048 4 096 8 192
矩形尺寸
(b) 矩形阵相乘
图 3 安全矩阵乘法的运行时间比较

