Page 254 - 《软件学报》2026年第2期
P. 254
余欢 等: Antelope: 基于 GPU 的三方隐私保护机器学习框架 733
design and implementation of GPU-friendly protocols for linear and nonlinear computations. To eliminate overhead associated with integer
operations, 64-bit integer matrix multiplication, and convolution are implemented using CUDA extensions in PyTorch. A most significant
bit (MSB) extraction protocol with low communication rounds is proposed, based on 0-1 encoding. In addition, a low-communication-
complexity hybrid multiplication protocol is introduced to reduce the communication overhead of secure comparison, enabling efficient
computation of ReLU activation layers. Finally, Antelope, a GPU-based 3-party framework, is proposed to support efficient privacy-
preserving machine learning. This framework significantly reduces the performance gap between secure and plaintext computation and
supports end-to-end training of deep neural networks. Experimental results demonstrate that the proposed framework achieves 29×–101×
speedup in training and 1.6×–35× in inference compared to the widely used CPU-based FALCON (PoPETs 2020). When compared with
GPU-based approaches, training performance reaches 2.5×–3× that of CryptGPU (S&P 2021) and 1.2×–1.6× that of Piranha (USENIX
Security 2022), while inference is accelerated by factors of 11× and 2.8×, respectively. Notably, the proposed secure comparison protocol
exhibits significant advantages when processing small input sizes.
Key words: data privacy; machine learning; secure multi-party computation; secure comparison
随着数字设施的快速发展, 数据的数量和价值不断增长. 机器学习是挖掘数据使用价值的重要工具, 而神经网
络是最流行的机器学习算法, 它促进了科学研究、商业活动和政府决策的发展. 然而数据泄露事件在全球范围内
日益增多, 频繁发生的数据泄露事件增加了公众对数据安全的需求. 隐私保护机器学习是指在不公开模型参数和
[2]
数据的情况下完成模型训练或获得推理结果, 在医疗 [1] 和金融行业 中有着广泛的应用场景.
解决数据的价值挖掘和隐私保护之间的矛盾, 并最终实现将隐私数据转化为可访问资源, 构成了当前研究工
作的重点. 现代密码学为我们提供了在计算过程中保护数据隐私的解决方案. 这些解决方案包括同态加密 (homo-
[3,4] [5,6]
morphic encryption, HE) 以及安全多方计算 . 但是上述解决方案都有不同的局限性.
HE 是一种加密方法, 允许任何人在加密数据上进行同态运算, 而无需解密数据, 因此也不会泄露数据隐私. 但
HE 的密文膨胀和高计算复杂度限制了其在大规模神经网络中的应用, 同时当前基于同态加密的隐私保护机器学
习框架与明文机器学习存在很大差距 [7,8] . MPC 是一种多方协作计算函数的安全技术, 其本地计算复杂度低. 然而
MPC 的性能常受限于通信复杂度 [9,10] .
本文关注使用 GPU 硬件加速基于 MPC 实现的隐私保护机器学习框架. 在 MPC 的多种实现技术中, 秘密分
享模式 [11] 具有通信复杂度适中、局部计算复杂度低的优点, 这使得基于秘密分享的 MPC 在隐私保护应用中更为
实用 [12,13] . 从本质上讲, n-方秘密分享将数据 x 划分为 n 份, 每一方 p 只持有若干份分享作为自己的本地数据 [[x]] p ,
安全的划分算法保证每方无法获知多于本地数据之外的额外信息, 并配备有算法 x ← Reconstruct([[x]] p : p ∈ P)
用于根据足够多的秘密分享恢复原始数据. 然后, 多方共同执行简单的加法和乘法计算, 并组合这些基础运算以实
现复杂函数的精确或者近似计算, 进一步支持神经网络层的前向、后向传播, 即可完成神经网络的训练和预测任务.
明文机器学习任务通过利用 GPU 大大提高了性能, 导致传统的明文机器学习和隐私保护机器学习之间存在
很大的性能差距. 使用硬件加速隐私训练和推理在缩小这一差距方面发挥着关键作用. 然而使用 GPU 硬件加速保
护机器学习与明文机器学习之间的差距高达 1 000 倍 [14] . 另一方面, 基于秘密分享的隐私保护机器学习常需要使
用更大的内存空间. 这是因为数据被分享成多个秘密份额用于存储和计算, 因此需要使用更多的 GPU 内存. 然而
GPU 的内存资源非常稀有 (通常为 16 GB), 这限制了其在复杂网络和大批量训练上的应用. 因此在保证协议计算
精度的同时, 尽量减少协议的交互轮数和内存开销对于秘密分享安全计算协议的性能提升十分关键. 本文主要研
究 GPU 友好的安全计算协议的设计和实现. 具体来说, 本文的主要工作和创新点如下.
(1) 高效的线性计算. CryptGPU [14] 通过将整数分解为浮点数进行线性计算, 增加了计算开销的同时加剧了 GPU
内存的消耗. 为避免额外的转换开销, 减少 GPU 内存消耗, 本文延续 Piranha 的实现方法, 为 64 位整数类型的线性
计算编写专门的 CUDA 核函数, 具体使用了 PyTorch 的 CUDA 扩展, 实现自定义 CUDA 算子, 支持 64 位整数类型
的矩阵乘法. 在此基础上, 本文将卷积运算转换为矩阵乘法计算, 实现了快速卷积运算, 减少了线性层的运算时间.
(2) GPU 友好的安全比较协议. 安全比较一直是 MPC 领域的重大挑战. 为了提高 GPU 的利用率, 本文关注于
减少最高符号位获取协议的通信轮数, 提高 ReLU 等需要进行比较计算的协议的计算速度. 本文将获取最高符号
位的任务转化为两个正数的大小比较问题, 并采用仔细设计的编码方法来解决这个问题, 最后大大减少了安全比

