Page 150 - 《软件学报》2026年第3期
P. 150
江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构 1113
表 1 表征能力评估数据集及衡量标准
任务 数据集 衡量标准
AmazonReviews
Classification MTOPDomain Accuracy
MTOPIntent
AskUbuntuDup
Reranking MindSmall MRR@10
SciDocs
SICK-R
STS STS12 Pearson
STSBenchmark
Bornholm
BittextMining Accuracy
Tatoeba
arXiv
Clustering bioRxiv V_measure
medRxiv
SprintDuplicateQ
PairClassification TwitterSemEval Accuracy
TwitterURLCorpus
ClimateFEVER
DBPedia
Retrieval MRR@10
FiQA2018
HotpotQA
在对比方法选取方面, 我们将 Faiss 索引库中的 PQIndex、IVFPQIndex、HNSWIndex、Chroma 向量数据库索
引作为参考基准, 比较索引的召回率、构建效率与检索效率. 对于 PQIndex、IVFPQIndex 两种基于量化的索引, 我
们对齐参数以保证索引与 WRVQIndex 之间的空间复杂度保持一致. 为了探索与验证 WRVQ 量化表征对检索索引
的提升, 我们基于线性残差微调以及残差微调与无监督学习结合这两种码本学习方式对 WRVQ 量化表征进行了详
细评测.
对于量化表征失真的测试任务, 我们主要采用了 ARPVQM 方法组 [36] 中的 RVQ、PQ、AVQ 作为残差微调与
无监督学习结合对比组的基准模型, 以及 vector-quantize-pytorch 方法组 [34,35] 中的 RVQ、PQ 作为线性残差微调对
比组的基准模型. 在这一任务中, 我们使用 Alpaca_data 与 MS MARCO 数据集作为原始数据集, 在经过基础嵌入
模型 bge-large-en-v1.5 后形成嵌入向量, 作为量化模型的输入. 之后对量化模型的输出与其输入计算量化损失进行
比较.
对于线性残差微调这一码本学习方式, 我们总是将全量数据集作为训练集进行训练, 而由于残差微调与无监
督学习结合这一码本方式, 为了检测我们的方法对向量学习能力的优化, 我们对数据集进行了不同大小的抽样作
为训练集, 并总是将训练轮次设置为 1 000, 这使得码本训练的时间消耗被限制在一定的范围. 但与此同时, 对于少
数收敛较慢的情况, 码本并未被训练足够充分, 对量化器的性能产生了一定的影响. 故而在这一测试任务中, 除了
量化器的量化性能, 其学习效率 (即收敛能力) 同样也是纳入考量的指标因素. 在这一部分, 我们使用学习率为
0.001 和默认参数的 Adam 优化器来训练模型以保证学习效率的相对统一, 当码本参数达到 4 (码本数量)×256 (码
本存储的向量数) 后, 我们使用学习率为 0.01 和默认参数的 Adam 优化器的附加实验进行对比. 同时, 每进行 100
次迭代, 模型会通过线性残差微调对码本进行修改.
本文所使用的实验平台为 AMD EPYC 7R32 48-Core Processor, 主频为 3.00 GHz, 内存为 512 GB.
4.2 检索索引的实验结果与分析
我们首先将基于残差微调与无监督学习结合码本学习方式的 WRVQ (T) 和基于线性残差微调码本学习方式
的 WRVQ (L) 构建索引体系, 与其他索引进行比较, 准确度、索引构建时间与检索效率如表 2 所示.

