Page 56 - 《软件学报》2026年第3期
P. 56

王嘉翼 等: 向量数据库的      K  近邻图高效更新方法                                                 1019


                    从表  3  的结果可以看出, 阈值     θ 有较为灵活的取值空间, 在一个较大的取值空间中, 均可以在较低的错误率下,
                 较大幅度地减少实际距离计算的数量. 在实际使用时, 由于这一参数的取值与嵌入向量数据本身的分布有关, 可以
                 先在一部分采样数据上对该超参数进行选择, 然后再为余下的数据使用所选的取值.
                  4.8   不同微调幅度的影响
                    图  11  展示了在  Stack  数据集上, 不同微调幅度下, 各方法在对         K  近邻图调整   3 min  后的召回率表现. 微调幅
                 度通过对嵌入模型设置不同的微调轮次 (epoch) 实现.

                                              Stale  NN-descent  NN-descent-init  FastAdjust
                      100                         100                         100
                                          96.4
                                                                      95.0
                       95                          95                          95                 93.4
                     召回率 (%)  90  84.0  85.0  89.0  召回率 (%)  90  83.5  86.7  召回率 (%)  90     84.8
                       85
                                                   85
                                                                               85
                       80                          80  82.0                    80       79.0
                                                                                   78.0
                       75                          75                          75
                                (a) epoch=1                 (b) epoch=2                 (c) epoch=4
                                        图 11 不同方法     K  近邻图召回率随微调幅度的变化

                    实验结果表明, 在微调幅度较小时, 本文提出的方法能够迅速适应嵌入变化对                         K  近邻图结构的影响, 在极短
                 时间内将近邻关系恢复至与重新构建             K  近邻图相似的准确度, 验证了本文方法的高效性与有效性.
                    随着微调轮次的增加, 嵌入向量的变化幅度也随之增大, 导致每个数据点的近邻关系发生更显著的变化. 如
                 图  11 中  Stale 方法的结果所示, 基于微调前的数据构建的         K  近邻图在此情形下的召回率明显下降. 对于            NN-descent
                 方法而言, 面对更剧烈的       K  近邻关系变化, 所需的迭代轮数与距离计算次数也显著增加, K                   近邻图的调整过程因
                 此变得更为耗时.
                    相比之下, FastAdjust 在面对较大的微调幅度时, 依然能够在较短时间内完成                  K  近邻图的有效更新, 以适应嵌
                 入向量的变化. 这是因为即使在向量变化幅度更大的情况下, 该方法仍能较为精准地定位可能产生新邻居的数据
                 区域, 并能较为准确地根据不同数据的预期邻居变化幅度, 针对性地分配适当的更新资源, 从而显著提升更新效率.

                  5   总结与未来工作

                    基于本研究所提出的高效          K  近邻图更新方法    FastAdjust, 本文总结了在嵌入模型微调后的         K  近邻图调整过程
                 中取得的成果, 并展示了其显著的效率优势和准确性. 通过局部增量调整策略以及针对性地分配更新资源, FastAdjust
                 能够有效地适应嵌入向量的变化, 避免了全图重建所带来的高昂计算开销, 提升了更新速度及查询性能.
                    然而 FastAdjust 仍存在一定的局限性, 其目前仅支持嵌入模型微调前后对                  K  近邻图这一向量索引的更新, 并
                 且其无法直接适应嵌入模型的大幅度更新或是更换嵌入模型的场景. 这些局限性使得目前                              FastAdjust 支持的应用
                 场景依然有限. 未来的工作将进一步优化该方法的适用范围, 例如为其他向量索引提供支持, 从而支持更一般的场
                 景; 并探索在微调幅度较大的情况下的处理策略, 例如如何应对当微调幅度巨大, 或是直接更换为其他嵌入模型
                 时, 数据的邻居关系发生了完全变化, 变得难以发现局部的邻居更新关系的情况. 此外, 结合更加自适应的资源分
                 配策略, 例如为本文提出的各种优化方法自动化地确定超参数, 也将是未来要探索的方向.

                 References
                  [1]   Reimers N, Gurevych I. Sentence-BERT: Sentence embeddings using siamese BERT-networks. In: Proc. of the 2019 Conf. on Empirical
                     Methods in Natural Language Processing and the 9th Int’l Joint Conf. on Natural Language Processing (EMNLP-IJCNLP). Hong Kong:
                     ACL, 2019. 3982–3992. [doi: 10.18653/V1/D19-1410]
                  [2]   van der Maaten L, Geoffrey H. Visualizing data using t-SNE. Journal of Machine Learning Research, 2008, 9(86): 2579–2605.
   51   52   53   54   55   56   57   58   59   60   61