Page 152 - 《软件学报》2026年第3期
P. 152

江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构                                                    1115


                    进一步地, 我们在不同索引方法的空间效率上进行了评测, 这里的内存占用指的是峰值消耗. 该值是指在查询
                 期间, 加载完整索引及相关数据结构后, 程序达到的最大内存用量. 如表                    4  所示.

                                             表 4 不同向量索引方法的空间消耗评测

                  数据集         索引方法          内存峰值消耗 (GB)       数据集           索引方法         内存峰值消耗 (GB)
                            PQIndex (Milvus)     8.6                     PQIndex (Milvus)      12.3
                          IVFPQIndex (Milvus)    6.7                    IVFPQIndex (Milvus)    -
                          HNSWIndex (Milvus)     15.2                   HNSWIndex (Milvus)     22.7
                  Alpaca                                     MSMARCO
                               Chroma            5.4                         Chroma            7.1
                              WRVQ (L)           5.9                       WRVQ (L)            9.9
                              WRVQ (T)           5.9                       WRVQ (T)            9.9

                    可以看出, PQIndex  和  WRVQ  方法的内存消耗受数据集规模的影响较大, 这是由于这些方法均采用了量化和
                 倒排结构作为核心索引机制. 量化能够有效减少存储需求, 但在处理更大规模数据集时, 仍然会导致一定程度的内
                 存增长; 倒排索引的存储开销则会随着数据规模的增加而扩大, 因此这些方法在存储成本上对数据集大小更为敏感.
                    相较之下, HNSWIndex    和  Chroma 的内存消耗对数据规模的变化相对不敏感. Chroma 在两个数据集上均展
                 现出较低的存储需求, 表明其索引结构在高效性与存储优化之间取得了良好平衡. HNSWIndex                          由于基于邻接图结
                 构进行搜索, 其索引规模主要取决于邻接关系的复杂性, 而不是直接受数据集规模的线性增长影响. 因此, 尽管其
                 存储成本变化较小, 但      HNSW  方法本身的索引结构需要大量内存, 导致其总体存储开销仍然较高.
                    然而, 在百万级别数据集的场景下, 我们提出的方法                (WRVQ) 仍然表现出较大的相对优势. WRVQ 在存储开
                 销上接近   Chroma 且优于   HNSWIndex  和  IVFPQIndex, 表明其在大规模数据场景下具备更好的空间效率. 因此, 在
                 需要权衡存储开销与检索性能的应用场景中, 我们的方法相较于其他方法仍然具有竞争力.
                  4.3   量化方法的量化能力实验结果与分析
                    为了探究    WRVQ  对向量表征的量化能力, 我们在两个数据集上对各个量化方法的量化损失进行了对比. 图                            4
                 展示了线性残差微调对比组在量化损失上的对比结果.

                       0.5                                      0.5
                                                      WRVQ
                                                      RVQ
                       0.4                            PQ        0.4
                                                                                                WRVQ
                       0.3                                      0.3                             RVQ
                     Loss                                      Loss                             PQ
                       0.2                                      0.2

                       0.1                                      0.1
                        0                                        0
                             2   4   6   8   10  12  14  16           2   4    6   8  10   12  14  16
                                    Number of quantizers                      Number of quantizers
                                  (a) Quantization loss (Alpaca)         (b) Quantization loss (MSMARCO)
                                   图 4 基于线性残差微调码本的量化器在两个数据集上的量化损失

                    在实验中, 我们对不同码本数量情况下的量化器进行测试, 可以看出, 在线性残差微调作为码本训练方法时,
                 PQ  的表现并不算良好. 随着码本数量的增加, 即使在             8  和  16  两种码本选择的情况下, PQ    的量化损失也仅有       0.03
                 左右的降低. 相比之下, 两种基于        RVQ  的方法获得了较大的提升, 但仍没有获得较好的结果, 这受限于轻量级的码
                 本训练策略. 但值得一提的是, 随着码本数量的增加, 如预想的一样, 传统                    RVQ  对向量的量化能力提升逐渐减弱,
                 而  WRVQ  仍保持着不错的量化能力提升, 在        15 码本到  16 码本的变化中, RVQ  的性能提升几乎可以忽略不计, 但         WRVQ
                 仍然获得了    0.05  左右的提升.
                    轻量化的码本训练策略虽然使码本的训练效率大幅提升, 即使在                     16  码本数量的情况下, Alpaca 的数据集训练
   147   148   149   150   151   152   153   154   155   156   157