Page 154 - 《软件学报》2026年第3期
P. 154

江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构                                                    1117


                    在图  5(a) 中, 我们对比了   4  种量化器在相同码本大小 (32) 下, 不同码本数量在两种数据集上的性能表现, 发
                 现  WRVQ  相对来说获得了更好的表现. 但在实验过程中我们发现, 码本训练的收敛速度较快, 这是因为码本大小
                 过小导致各个量化器的性能没有被完全释放, 这导致最终结果差距不大. 在图                         5(b) 的实验中, 我们冻结了码本数
                                                                                  9
                                                                                5
                 量参数为   4, 通过调整码字的大小对码本大小进行调整, 评估了在不同码本大小 (2 –2 ) 下各量化器的性能, 可以发
                 现, WRVQ  相比于同一码本训练方式的其他量化器获得了更多的提升. 在                    Alpaca 数据集的训练过程中, 这种提升
                 在  256  码本大小下出现了削弱, 说明训练集已经得到了充分的学习, 而在                  MSMARCO  数据集中, 提升在     512  码本
                 大小下放缓. 最终在相同情况下, WRVQ          在充分学习训练集时获得了          10%–20%  的量化损失减少, 能够更加准确地
                 表示向量表征.
                  4.4   量化表征的表征能力实验结果与分析
                    这一部分实验中, 我们使用外部测评库对几种向量表征进行测评, 评估量化表征的表征能力.
                    测试结果的内容在图        6  中进行展示. 从测试中可以明显看出, 我们的表示方法在所有                  7  项任务中都取得了接
                 近基准模型的结果. 我们观察到, 在分类、重新排序、聚类和对分类等任务中, 量化表示并未显著影响性能——在
                 某些情况下, 量化表示甚至达到或超过原始表征模型的性能. 然而, 在其余                     3  项任务 (检索、STS   和  BittextMining)
                 中, 量化原始模型可能会导致表示性能的大幅下降. 在这些任务中, 我们的量化方法明显优于其他量化方法.

                          1.0   BGE-baseline
                                RVQ
                          0.8   PQ
                                weight RVQ
                         Score  0.6
                          0.4
                          0.2
                           0
                              AmazonReviews Classification (Acc) Classification (Acc) Reranking (MRR@10) Reranking (MRR@10) Reranking (MRR@10)  STS (Pearson)  STS (Pearson) STSBenchmark SummEval (Pearson)
                                                         MindSmall
                                                                                         SummEval
                                     MTOPDomain
                                            MTOPlntent
                                                 AskUbuntuDup
                                                                              STS12
                                                                       SICK-R
                                                                SciDocs
                                                                                  STS (Pearson)
                              Classification (Acc)
                          1.0   BGE-baseline
                                RVQ
                          0.8   PQ
                                weight RVQ
                         Score  0.6
                          0.4
                          0.2
                           0     Bornholm  Tatoeba  arXiv  bioRxiv  medRxiv
                                                                      SprintDuplicateQ
                                                                              TwitterSemEval
                                                                                     TwitterURLCorpus
                               BittextMining (Acc)  BittextMining (Acc) Clustering (V_measure) Clustering (V_measure) Clustering (V_measure) PairClassification (Acc) PairClassification (Acc) PairClassification (Acc)
                                           图 6 各量化表征在      MTEB  上的表征能力测试

                  4.5   量化表征增量更新实验结果与分析
                    为了进一步评估       WRVQ  方法在实际应用中的索引构建能力, 我们对其在增量索引构建场景下的性能表现进
                 行了系统实验. 具体而言, 我们采用不同的批量规模对                WRVQ  索引进行批量增量插入, 记录每个批次操作对应的
                 平均构建时间及平均        CUDA  内存消耗. 图中横轴为每批插入的向量数, 左纵轴为批次构建耗时 (s), 右纵轴为显存
                 占用变化 (MB). 为了便于展示索引增量带来的性能变化, 结果以相邻批次增量绝对值形式展示.
   149   150   151   152   153   154   155   156   157   158   159