Page 142 - 《软件学报》2026年第3期
P. 142

江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构                                                    1105


                 study  proposes  a  framework  based  on  weight  residual  vector  quantization  (WRVQ).  This  method  achieves  efficient  compression  and
                 storage  with  very  low  distortion  by  decoupling  the  quantization  direction  from  the  residual  magnitude.  It  stores  the  residual  direction  as  a
                 unit  vector  and  appends  a  weight  marker.  For  indexing,  a  three-layer  inverted  index  structure  tailored  to  the  characteristics  of  WRVQ  is
                 designed,  comprising  an  exact  match  layer,  a  fuzzy  match  layer,  and  a  search  layer.  This  structure  organically  integrates  asymmetric
                 distance  computation  (ADC)  with  nearest  neighbor  search  techniques  to  realize  approximate  nearest  neighbor  (ANN)  search  that  balances
                 both  high  accuracy  and  high  efficiency.  Experimental  results  on  large-scale  datasets  demonstrate  that,  compared  to  traditional  low-
                 dimensional  embedding  models  and  existing  quantization  methods,  WRVQ  achieves  significant  improvements  across  key  metrics,  including
                 quantization loss, storage compression ratio, and retrieval recall. Furthermore, it exhibits considerable advantages in both index construction
                 and query performance.
                 Key words:  vector database; vector quantization (VQ); approximate query processing

                    近年来, 信息技术的快速发展以及智能终端的广泛普及, 使得全球数据量呈现爆炸式增长, 显著推动了数据库
                 技术的不断创新和变革. 向量数据库通过将各类异质数据转换为向量表示, 并利用向量作为数据索引, 不仅实现了
                 对异质数据的统一管理, 还能够从原始数据中提取特征, 以便进行计算和比对. 向量数据库在生成式检索领域得到
                 了广泛应用, 其对数据特征的表征能力有效提升了数据相似性检索的质量, 并借助近邻搜索等技术, 为下游模型提
                 供了更具相关性的数据信息.
                    在向量数据库中, 向量的表征与检索是两个核心环节. 向量表征直接决定了数据的表示能力, 从而影响整体系
                 统的可靠性; 向量检索的准确性则直接关系到系统输出结果的质量. 随着数据规模呈指数级增长, 向量数据库在数
                 据存储和索引构建等方面仍然存在诸多性能瓶颈. 当前的向量数据库在存储、计算和检索过程中面临以下挑战:
                 (1) 随着数据量和多样性的不断增长, 存储索引的效率逐步下降, 并在大规模异质数据场景下带来较高的维护成本;
                 (2) 传统的索引构建方法结构庞大且复杂, 导致在大规模数据计算时内存消耗巨大; (3) 数据规模的扩张使得检索
                 算法在准确性和效率方面面临更大挑战.
                    近年来, 诸多研究提出了多种改进方案以优化向量数据库在大规模数据存储和检索过程中的性能问题. 量化
                 技术作为一种实现向量压缩和高效索引的有效手段得到较多探讨. Xiao                     等人  [1] 提出的逐步优化双粒度文档表示方
                 法通过对比量化生成稀疏嵌入, 实现了精确且高效的候选搜索; 同时, Zhang                    等人  [2] 开发的集成高维向量索引至关
                 系数据库, 利用松弛单调性构建索引, 有效支持了复杂的近似相似性查询. 尽管上述方法在缓解存储与计算瓶颈方
                 面取得了一定进展, 其适用性仍存在一定局限. 首先, 量化过程的失真往往导致检索准确性降低, 使得系统在高精
                 度需求场景下表现不足; 其次, 索引构建及维护往往较为复杂, 内存消耗增多, 且响应速度难以满足实时性要求; 最
                 后, 量化处理的灵活性不足, 限制了在多样的向量数据管理场景的适用.
                    针对以上难点, 本文提出了一种权重残差向量量化 (weight residual vector quantization, WRVQ) 方法, 旨在解
                 决大规模异构数据处理中的存储与检索问题. 本文的工作总体分为量化表征、存储索引和近似匹配这                                   3  个部分,
                 如后文图   1  所示. 在索引构建方面, 本文设计了适配          WRVQ  量化特性的    3  层倒排索引结构——精确匹配层、模糊
                 匹配层与搜索层. 在搜索匹配方面, 有机结合非对称距离计算 (asymmetric distance computation, ADC) 与近邻搜索
                 技术, 实现了高准确度与高效率兼具的近似最近邻检索. 本文方法通过将向量量化与近似最近邻 (approximate
                 nearest neighbor, ANN) 搜索过程分离, 构建出基于量化的向量表征, 实验结果表明, 新的方法不仅在较低失真率下
                 实现了高效压缩和存储, 同时支持针对不同数据及特定领域的定制化量化操作, 显著提升了系统的检索灵活性与
                 适应性, 为向量数据的管理提供了一条新路径              [3] .

                  1   相关工作和基本概念

                  1.1   向量表征
                    传统的文本嵌入模型通常被称为词嵌入模型, 典型方法包括 word2vec  和 GloVe . 这些模型分别采用基于
                                                                           [4]
                                                                                    [5]
                 矩阵分解的统计方法和基于浅层窗口的预测方法, 但由于缺乏对上下文信息的有效建模, 往往难以捕捉深层语义.
                 相比之下, Transformer 通过注意力机制连接编码器和解码器, 为当前先进的嵌入模型奠定了理论基础                         [6] . 注意力机
   137   138   139   140   141   142   143   144   145   146   147