Page 153 - 《软件学报》2026年第3期
P. 153
1116 软件学报 2026 年第 37 卷第 3 期
时间仅为 17 s, 而 20 倍数据集大小的 MSMARCO 的训练时间也仅为 223 s, 这使得这种训练方法在特定场景下具
有不错的表现.
对于残差微调与无监督学习结合对比组, 我们同样在这两个数据集上进行了全面的比较. 首先, 我们随机生成
1 000 条向量作为模拟向量构成训练集进行训练, 之后将训练好的模型在两个数据集上进行评估. 在这一部分, 单
个码本的大小被设置成 64. 结果如表 5 所示.
表 5 各量化方法的通用量化器在两个数据集上的量化损失
量化损失
数据集 量化方法
码本数量: 2 码本数量: 3 码本数量: 4
PQ 0.017 1 - 0.009 1
AVQ 0.016 3 0.012 6 0.008 9
Alpaca
RVQ 0.016 9 0.013 1 0.009 2
WRVQ 0.000 9 0.000 9 0.000 9
PQ 0.017 2 - 0.009 2
AVQ 0.016 4 0.012 7 0.009 0
MSMARCO
RVQ 0.017 0 0.013 1 0.009 2
WRVQ 0.000 9 0.000 9 0.000 9
从表 5 中我们可以观察到, WRVQ 在随机数据训练的情况下, 对各个数据集的量化能力达到了非常高的水平,
相较于结构相同的 RVQ 以及其他类型量化器, 其量化损失降低到了 1/10. 得益于 WRVQ 对码本的归一化调整,
其在低码本的情况下仍能发挥出不错的效果, 而相对而言, 其他类型量化器都没有达到较好的效果. 总体而言可以
发现, 残差微调与无监督学习结合对比组相较于线性残差微调对比组在量化能力上有了较大幅度的提升.
之后, 我们分别对两个数据集进行随机抽样, 各选取 1 000 条数据作为训练集, 在不同码本参数的情况下对量
化器进行训练, 并对两个数据集进行量化. 结果如图 5 所示.
10 −5 10 −5
6.2
WRVQ WRVQ
5.3 RVQ RVQ
PQ 6.1 PQ
AVQ AVQ
5.2
6.0
Loss 5.1 Loss 5.9
5.8
5.0
5.7
4.9
2 3 4 2 3 4
Number of quantizers Number of quantizers
(a) Alpaca数据集上量化位对量化损失的影响 (b) MSMARCO数据集上量化位对量化损失的影响
10 −5 10 −4
5.1
WRVQ RVQ PQ AVQ 6.0 WRVQ RVQ PQ AVQ
5.0
4.9 5.8
4.8 5.6
Loss 4.7 Loss
5.4
4.6
5.2
4.5
4.4 5.0
5 6 7 8 5 6 7 8 9
Code bits Code bits
(c) Alpaca数据集上编码对量化损失的影响 (d) MSMARCO数据集上编码对量化损失的影响
图 5 不同码本大小的抽样训练量化器在两个数据集上的量化损失

