Page 144 - 《软件学报》2026年第3期
P. 144

江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构                                                    1107


                 量检索的时空效率与准确性          [29,30] . 其中, Subramanya 等人  [31] 在索引构建过程中通过学习稀疏嵌入, 以优化全局判
                 别能力, 从而更精准地定位查询向量的潜在区域. 该方法为本文的研究提供了重要启发. 此外, 唐博等人                              [32] 提出了
                 一种半有序的高效样本索引方法, 以降低索引维护成本与时间开销. 这些研究成果为向量数据库的发展提供了有
                 力支撑, 并为未来的进一步优化奠定了基础.
                  1.3   向量量化
                    向量量化 (vector quantization, VQ) 是为了减少表示空间的基数, 特别是在输入数据为实值向量时, 能够有效降
                 低存储和计算成本. 形式上, 量化器可被视为一个函数, 其作用是将一个 d 维向量映射到一个离散的量化向量空间.

                                                        {                 }
                                                  d
                                                             d
                                              x ∈ R → c i ∈ c i ∈ R | i = 0,1,...,k −1                (1)
                    设量化向量 c 为簇中心, 簇中心的集合大小 k 被称为码本大小. 在实际应用中, 由于单一量化器在向量表示能
                 力上的局限性, 现有研究通常采用多个量化器对向量进行联合处理, 从而生成多个量化向量, 以更精确地表示原始
                 向量.
                    乘积量化 (product quantization, PQ) 是一种典型的向量量化方法, 其核心思想是将高维向量空间划分为多个
                 低维子空间, 并分别对每个子空间进行量化. 最终, 每个向量由其低维子空间量化后形成的短码组合表示                                [27] . 在此
                 基础上, 优化乘积量化 (optimized product quantization, OPQ) 通过最小化空间分解误差和量化码本误差, 进一步优
                 化 PQ 的空间划分方式, 从而降低量化失真           [3] . 此外, 累积量化 (additive quantization, AQ) 关注低维子空间之间的
                 相关性, 并优化量化向量与原始向量之间的计算方式, 以提高量化器的准确性                       [33] .
                    同时, 量化器码本的训练过程对于量化器的性能和效率具有重要影响. 针对特定数据源, 训练出能够精准拟合
                 数据分布的量化簇中心, 可以有效地降低量化误差. 一些轻量级量化方法采用基于数据源或残差的线性表示, 对码
                 本进行微调, 以增强量化效果         [34,35] . 此外, 部分研究结合无监督学习的梯度下降方法对码本参数进行优化, 使得码
                 本更新更加灵活, 从而提升向量量化的适应性和泛化能力                  [36] .

                  2   一种权重增强的量化表征技术

                    本节主要介绍在嵌入模型的输出结果上进行针对性量化的设计与实现. 在传统的向量量化方法中, 影响量化
                 失真的主要因素是码本的大小. 由于每个向量被映射为单个码字表示, 因此所有向量最终被量化到有限数量的码
                 字集合中. 然而, 在大多数情况下, 码本的大小远小于数据集的规模, 导致量化精度较低. 这一限制主要源于有限数
                 量的码字难以充分捕捉数据分布的复杂性, 从而降低了量化的准确性.
                    针对上述问题, 残差向量量化 (residual vector quantization, RVQ) 提出了一种改进策略. RVQ 通过引入残差量
                 化器, 使原始向量不再仅由单个码字表示, 而是通过多个码字的累加近似得到, 从而减少量化误差                              [37] . 然而, RVQ
                 的整体准确性仍然受到码本训练方式的影响, 且随着码本层数                     (即 RVQ 中的迭代次数) 的增加, 量化器的效率会
                 不可避免地下降. 一些研究尝试通过下界排序剪枝 (LBS-pruning) 和提前终止 (early termination, ET) 优化码本训
                 练过程, 以提高训练效率       [38] , 但这些方法虽然提升了码本的平均效率, 却未能从根本上解决量化损失高的问题.
                    本文提出了一种新的向量量化方法, 旨在针对传统向量量化方法中存在的问题进行优化与改进. 该方法在残
                 差向量量化的基础上重点提升量化的准确率, 并有效缓解                  RVQ  在多个量化轮次后准确率下降的问题.
                    本方法克服了      VQ  和  PQ  方法的关键局限性, 即在量化过程中可能导致嵌入特征的丢失. VQ                 和  PQ  往往无法
                 很好地保持嵌入向量之间的高余弦相似度, 使得量化后的表示在后续向量检索任务中的有效性降低. 本文提出的
                 方法在量化过程中更好地保留了嵌入特征, 使其能够为向量检索任务提供更可靠的支持. 此外, 本方法在计算效率
                 上进行了优化, 确保在保持较高量化准确率的同时, 兼顾量化比的合理性.
                  2.1   问题定义
                    向量量化的目标是将连续输入向量空间划分为有限数量的区域, 并为每个区域分配一个代表性的码字, 从而
                 实现紧凑的表示形式. 其本质在于最小化原始输入向量与其量化表示之间的失真或误差, 使得量化后的表示尽可
                 能保留原始数据的关键信息. 向量量化的主要挑战在于在量化比和准确率之间取得平衡. 较高的量化比可以有效
   139   140   141   142   143   144   145   146   147   148   149