Page 56 - 《软件学报》2026年第3期
P. 56
王嘉翼 等: 向量数据库的 K 近邻图高效更新方法 1019
从表 3 的结果可以看出, 阈值 θ 有较为灵活的取值空间, 在一个较大的取值空间中, 均可以在较低的错误率下,
较大幅度地减少实际距离计算的数量. 在实际使用时, 由于这一参数的取值与嵌入向量数据本身的分布有关, 可以
先在一部分采样数据上对该超参数进行选择, 然后再为余下的数据使用所选的取值.
4.8 不同微调幅度的影响
图 11 展示了在 Stack 数据集上, 不同微调幅度下, 各方法在对 K 近邻图调整 3 min 后的召回率表现. 微调幅
度通过对嵌入模型设置不同的微调轮次 (epoch) 实现.
Stale NN-descent NN-descent-init FastAdjust
100 100 100
96.4
95.0
95 95 95 93.4
召回率 (%) 90 84.0 85.0 89.0 召回率 (%) 90 83.5 86.7 召回率 (%) 90 84.8
85
85
85
80 80 82.0 80 79.0
78.0
75 75 75
(a) epoch=1 (b) epoch=2 (c) epoch=4
图 11 不同方法 K 近邻图召回率随微调幅度的变化
实验结果表明, 在微调幅度较小时, 本文提出的方法能够迅速适应嵌入变化对 K 近邻图结构的影响, 在极短
时间内将近邻关系恢复至与重新构建 K 近邻图相似的准确度, 验证了本文方法的高效性与有效性.
随着微调轮次的增加, 嵌入向量的变化幅度也随之增大, 导致每个数据点的近邻关系发生更显著的变化. 如
图 11 中 Stale 方法的结果所示, 基于微调前的数据构建的 K 近邻图在此情形下的召回率明显下降. 对于 NN-descent
方法而言, 面对更剧烈的 K 近邻关系变化, 所需的迭代轮数与距离计算次数也显著增加, K 近邻图的调整过程因
此变得更为耗时.
相比之下, FastAdjust 在面对较大的微调幅度时, 依然能够在较短时间内完成 K 近邻图的有效更新, 以适应嵌
入向量的变化. 这是因为即使在向量变化幅度更大的情况下, 该方法仍能较为精准地定位可能产生新邻居的数据
区域, 并能较为准确地根据不同数据的预期邻居变化幅度, 针对性地分配适当的更新资源, 从而显著提升更新效率.
5 总结与未来工作
基于本研究所提出的高效 K 近邻图更新方法 FastAdjust, 本文总结了在嵌入模型微调后的 K 近邻图调整过程
中取得的成果, 并展示了其显著的效率优势和准确性. 通过局部增量调整策略以及针对性地分配更新资源, FastAdjust
能够有效地适应嵌入向量的变化, 避免了全图重建所带来的高昂计算开销, 提升了更新速度及查询性能.
然而 FastAdjust 仍存在一定的局限性, 其目前仅支持嵌入模型微调前后对 K 近邻图这一向量索引的更新, 并
且其无法直接适应嵌入模型的大幅度更新或是更换嵌入模型的场景. 这些局限性使得目前 FastAdjust 支持的应用
场景依然有限. 未来的工作将进一步优化该方法的适用范围, 例如为其他向量索引提供支持, 从而支持更一般的场
景; 并探索在微调幅度较大的情况下的处理策略, 例如如何应对当微调幅度巨大, 或是直接更换为其他嵌入模型
时, 数据的邻居关系发生了完全变化, 变得难以发现局部的邻居更新关系的情况. 此外, 结合更加自适应的资源分
配策略, 例如为本文提出的各种优化方法自动化地确定超参数, 也将是未来要探索的方向.
References
[1] Reimers N, Gurevych I. Sentence-BERT: Sentence embeddings using siamese BERT-networks. In: Proc. of the 2019 Conf. on Empirical
Methods in Natural Language Processing and the 9th Int’l Joint Conf. on Natural Language Processing (EMNLP-IJCNLP). Hong Kong:
ACL, 2019. 3982–3992. [doi: 10.18653/V1/D19-1410]
[2] van der Maaten L, Geoffrey H. Visualizing data using t-SNE. Journal of Machine Learning Research, 2008, 9(86): 2579–2605.

