Page 152 - 《软件学报》2026年第3期
P. 152
江宇轩 等: 权重残差向量量化: 向量压缩与分层索引结构 1115
进一步地, 我们在不同索引方法的空间效率上进行了评测, 这里的内存占用指的是峰值消耗. 该值是指在查询
期间, 加载完整索引及相关数据结构后, 程序达到的最大内存用量. 如表 4 所示.
表 4 不同向量索引方法的空间消耗评测
数据集 索引方法 内存峰值消耗 (GB) 数据集 索引方法 内存峰值消耗 (GB)
PQIndex (Milvus) 8.6 PQIndex (Milvus) 12.3
IVFPQIndex (Milvus) 6.7 IVFPQIndex (Milvus) -
HNSWIndex (Milvus) 15.2 HNSWIndex (Milvus) 22.7
Alpaca MSMARCO
Chroma 5.4 Chroma 7.1
WRVQ (L) 5.9 WRVQ (L) 9.9
WRVQ (T) 5.9 WRVQ (T) 9.9
可以看出, PQIndex 和 WRVQ 方法的内存消耗受数据集规模的影响较大, 这是由于这些方法均采用了量化和
倒排结构作为核心索引机制. 量化能够有效减少存储需求, 但在处理更大规模数据集时, 仍然会导致一定程度的内
存增长; 倒排索引的存储开销则会随着数据规模的增加而扩大, 因此这些方法在存储成本上对数据集大小更为敏感.
相较之下, HNSWIndex 和 Chroma 的内存消耗对数据规模的变化相对不敏感. Chroma 在两个数据集上均展
现出较低的存储需求, 表明其索引结构在高效性与存储优化之间取得了良好平衡. HNSWIndex 由于基于邻接图结
构进行搜索, 其索引规模主要取决于邻接关系的复杂性, 而不是直接受数据集规模的线性增长影响. 因此, 尽管其
存储成本变化较小, 但 HNSW 方法本身的索引结构需要大量内存, 导致其总体存储开销仍然较高.
然而, 在百万级别数据集的场景下, 我们提出的方法 (WRVQ) 仍然表现出较大的相对优势. WRVQ 在存储开
销上接近 Chroma 且优于 HNSWIndex 和 IVFPQIndex, 表明其在大规模数据场景下具备更好的空间效率. 因此, 在
需要权衡存储开销与检索性能的应用场景中, 我们的方法相较于其他方法仍然具有竞争力.
4.3 量化方法的量化能力实验结果与分析
为了探究 WRVQ 对向量表征的量化能力, 我们在两个数据集上对各个量化方法的量化损失进行了对比. 图 4
展示了线性残差微调对比组在量化损失上的对比结果.
0.5 0.5
WRVQ
RVQ
0.4 PQ 0.4
WRVQ
0.3 0.3 RVQ
Loss Loss PQ
0.2 0.2
0.1 0.1
0 0
2 4 6 8 10 12 14 16 2 4 6 8 10 12 14 16
Number of quantizers Number of quantizers
(a) Quantization loss (Alpaca) (b) Quantization loss (MSMARCO)
图 4 基于线性残差微调码本的量化器在两个数据集上的量化损失
在实验中, 我们对不同码本数量情况下的量化器进行测试, 可以看出, 在线性残差微调作为码本训练方法时,
PQ 的表现并不算良好. 随着码本数量的增加, 即使在 8 和 16 两种码本选择的情况下, PQ 的量化损失也仅有 0.03
左右的降低. 相比之下, 两种基于 RVQ 的方法获得了较大的提升, 但仍没有获得较好的结果, 这受限于轻量级的码
本训练策略. 但值得一提的是, 随着码本数量的增加, 如预想的一样, 传统 RVQ 对向量的量化能力提升逐渐减弱,
而 WRVQ 仍保持着不错的量化能力提升, 在 15 码本到 16 码本的变化中, RVQ 的性能提升几乎可以忽略不计, 但 WRVQ
仍然获得了 0.05 左右的提升.
轻量化的码本训练策略虽然使码本的训练效率大幅提升, 即使在 16 码本数量的情况下, Alpaca 的数据集训练

