Page 154 - 《软件学报》2026年第3期
P. 154
江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构 1117
在图 5(a) 中, 我们对比了 4 种量化器在相同码本大小 (32) 下, 不同码本数量在两种数据集上的性能表现, 发
现 WRVQ 相对来说获得了更好的表现. 但在实验过程中我们发现, 码本训练的收敛速度较快, 这是因为码本大小
过小导致各个量化器的性能没有被完全释放, 这导致最终结果差距不大. 在图 5(b) 的实验中, 我们冻结了码本数
9
5
量参数为 4, 通过调整码字的大小对码本大小进行调整, 评估了在不同码本大小 (2 –2 ) 下各量化器的性能, 可以发
现, WRVQ 相比于同一码本训练方式的其他量化器获得了更多的提升. 在 Alpaca 数据集的训练过程中, 这种提升
在 256 码本大小下出现了削弱, 说明训练集已经得到了充分的学习, 而在 MSMARCO 数据集中, 提升在 512 码本
大小下放缓. 最终在相同情况下, WRVQ 在充分学习训练集时获得了 10%–20% 的量化损失减少, 能够更加准确地
表示向量表征.
4.4 量化表征的表征能力实验结果与分析
这一部分实验中, 我们使用外部测评库对几种向量表征进行测评, 评估量化表征的表征能力.
测试结果的内容在图 6 中进行展示. 从测试中可以明显看出, 我们的表示方法在所有 7 项任务中都取得了接
近基准模型的结果. 我们观察到, 在分类、重新排序、聚类和对分类等任务中, 量化表示并未显著影响性能——在
某些情况下, 量化表示甚至达到或超过原始表征模型的性能. 然而, 在其余 3 项任务 (检索、STS 和 BittextMining)
中, 量化原始模型可能会导致表示性能的大幅下降. 在这些任务中, 我们的量化方法明显优于其他量化方法.
1.0 BGE-baseline
RVQ
0.8 PQ
weight RVQ
Score 0.6
0.4
0.2
0
AmazonReviews Classification (Acc) Classification (Acc) Reranking (MRR@10) Reranking (MRR@10) Reranking (MRR@10) STS (Pearson) STS (Pearson) STSBenchmark SummEval (Pearson)
MindSmall
SummEval
MTOPDomain
MTOPlntent
AskUbuntuDup
STS12
SICK-R
SciDocs
STS (Pearson)
Classification (Acc)
1.0 BGE-baseline
RVQ
0.8 PQ
weight RVQ
Score 0.6
0.4
0.2
0 Bornholm Tatoeba arXiv bioRxiv medRxiv
SprintDuplicateQ
TwitterSemEval
TwitterURLCorpus
BittextMining (Acc) BittextMining (Acc) Clustering (V_measure) Clustering (V_measure) Clustering (V_measure) PairClassification (Acc) PairClassification (Acc) PairClassification (Acc)
图 6 各量化表征在 MTEB 上的表征能力测试
4.5 量化表征增量更新实验结果与分析
为了进一步评估 WRVQ 方法在实际应用中的索引构建能力, 我们对其在增量索引构建场景下的性能表现进
行了系统实验. 具体而言, 我们采用不同的批量规模对 WRVQ 索引进行批量增量插入, 记录每个批次操作对应的
平均构建时间及平均 CUDA 内存消耗. 图中横轴为每批插入的向量数, 左纵轴为批次构建耗时 (s), 右纵轴为显存
占用变化 (MB). 为了便于展示索引增量带来的性能变化, 结果以相邻批次增量绝对值形式展示.

