Page 150 - 《软件学报》2026年第3期
P. 150

江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构                                                    1113



                                             表 1 表征能力评估数据集及衡量标准

                                    任务                      数据集                   衡量标准
                                                         AmazonReviews
                                 Classification          MTOPDomain               Accuracy
                                                          MTOPIntent
                                                         AskUbuntuDup
                                  Reranking               MindSmall               MRR@10
                                                           SciDocs
                                                           SICK-R
                                    STS                     STS12                 Pearson
                                                         STSBenchmark
                                                           Bornholm
                                 BittextMining                                    Accuracy
                                                           Tatoeba
                                                            arXiv
                                  Clustering               bioRxiv               V_measure
                                                           medRxiv
                                                        SprintDuplicateQ
                                PairClassification       TwitterSemEval           Accuracy
                                                        TwitterURLCorpus
                                                         ClimateFEVER
                                                           DBPedia
                                   Retrieval                                      MRR@10
                                                           FiQA2018
                                                           HotpotQA

                    在对比方法选取方面, 我们将         Faiss 索引库中的   PQIndex、IVFPQIndex、HNSWIndex、Chroma 向量数据库索
                 引作为参考基准, 比较索引的召回率、构建效率与检索效率. 对于                   PQIndex、IVFPQIndex  两种基于量化的索引, 我
                 们对齐参数以保证索引与         WRVQIndex  之间的空间复杂度保持一致. 为了探索与验证             WRVQ  量化表征对检索索引
                 的提升, 我们基于线性残差微调以及残差微调与无监督学习结合这两种码本学习方式对                            WRVQ  量化表征进行了详
                 细评测.
                    对于量化表征失真的测试任务, 我们主要采用了                ARPVQM  方法组   [36] 中的  RVQ、PQ、AVQ  作为残差微调与
                 无监督学习结合对比组的基准模型, 以及             vector-quantize-pytorch  方法组  [34,35] 中的  RVQ、PQ  作为线性残差微调对
                 比组的基准模型. 在这一任务中, 我们使用            Alpaca_data 与  MS MARCO  数据集作为原始数据集, 在经过基础嵌入
                 模型  bge-large-en-v1.5  后形成嵌入向量, 作为量化模型的输入. 之后对量化模型的输出与其输入计算量化损失进行
                 比较.
                    对于线性残差微调这一码本学习方式, 我们总是将全量数据集作为训练集进行训练, 而由于残差微调与无监
                 督学习结合这一码本方式, 为了检测我们的方法对向量学习能力的优化, 我们对数据集进行了不同大小的抽样作
                 为训练集, 并总是将训练轮次设置为           1 000, 这使得码本训练的时间消耗被限制在一定的范围. 但与此同时, 对于少
                 数收敛较慢的情况, 码本并未被训练足够充分, 对量化器的性能产生了一定的影响. 故而在这一测试任务中, 除了
                 量化器的量化性能, 其学习效率 (即收敛能力) 同样也是纳入考量的指标因素. 在这一部分, 我们使用学习率为
                 0.001  和默认参数的   Adam  优化器来训练模型以保证学习效率的相对统一, 当码本参数达到                    4 (码本数量)×256 (码
                 本存储的向量数) 后, 我们使用学习率为           0.01  和默认参数的   Adam  优化器的附加实验进行对比. 同时, 每进行            100
                 次迭代, 模型会通过线性残差微调对码本进行修改.
                    本文所使用的实验平台为          AMD EPYC 7R32 48-Core Processor, 主频为  3.00 GHz, 内存为  512 GB.
                  4.2   检索索引的实验结果与分析
                    我们首先将基于残差微调与无监督学习结合码本学习方式的                      WRVQ (T) 和基于线性残差微调码本学习方式
                 的  WRVQ (L) 构建索引体系, 与其他索引进行比较, 准确度、索引构建时间与检索效率如表                       2  所示.
   145   146   147   148   149   150   151   152   153   154   155