Page 54 - 《软件学报》2026年第3期
P. 54

王嘉翼 等: 向量数据库的      K  近邻图高效更新方法                                                 1017


                    实验结果如图      9  所示. 从实验结果可以看出, FastAdjust 的    RMSE  显著低于其他基线方法. 由此, 本文从召回
                 率以外的另一个角度, 证明了         FastAdjust 能够快速调整   K  近邻图的结构, 在很短的调整时间内取得与真实              K  近邻
                 图相似的图结构, 使其适应嵌入模型微调对              K  近邻图产生的结构性变化.

                                           Stale  NN-descent  NN-descent-init  FastAdjust
                                                                50
                                                                      45.9
                                10.4
                         入度的均方根误差 (RMSE)  5   7.5              入度的均方根差误差 (RMSE)  30  16.9
                                                                40
                                       9.8
                          10
                                                                20

                                                      3.0
                                                                                     9.1
                                                                10
                                                                                            2.5
                          0                                      0
                                         (a) Stack                             (b) DigiFace
                                  图 9 不同方法更新       K  近邻图, 3 min  后节点入度均方根误差的比较

                  4.5   不同参数与  K  近邻变化个数的相关性
                    为了验证第     3.3  节中所提出的基于数据密度的动态更新资源分配的合理性, 本节评估了不同变量与数据                           K  近
                 邻微调前后变化个数的相关系数, 结果如表              2  所示.

                                           表 2 不同变量与     K  近邻变化个数的相关系数

                                           变量                        Stack            Wiki
                                         位移距离                        0.411            0.391
                                    /
                                   1 (前100近邻的平均距离)                   −0.365          −0.367
                                    /
                                   1 (前100近邻距离的极差)                   0.223            0.203
                                /
                               1 (前100近邻中后40近邻距离的极差)                 0.564            0.575
                                       /
                                (位移距离) (前100近邻的平均距离)                 −0.071          −0.182
                                       /
                                (位移距离) (前100近邻距离的极差)                 0.332            0.278
                                   /
                            (位移距离) (前100近邻中后40近邻距离的极差)               0.649            0.636

                    从表  2  中相关系数的结果可以看出, 不同变量对            K  近邻变化个数的影响存在一定的规律, 这些关系为我们提
                 供了对   K  近邻结构变化的深入理解. 微调前后数据位移距离 (即数据变化幅度) 与                    K  近邻变化个数之间的相关系
                 数为正 (例如, Stack  和  Wiki 上的相关系数分别为     0.411  和  0.391), 说明当位移距离增大时, K  近邻的变化个数也倾
                 向于增加. 这表明, 数据微调后较大的位移可能导致               K  近邻结构发生较大的调整. 前        100  近邻中后  40  近邻距离的
                 极差同样与    K  近邻的变化个数显示出较强的正相关 (如            Stack  和  Wiki 分别为  0.564  和 0.575), 说明前  100  近邻中
                 后  40  近邻的距离差异对    K  近邻变化个数有较大影响. 位移距离/前           100  近邻中后  40  近邻距离的极差是与      K  近邻
                 变化个数相关系数最高的变量 (Stack         和  Wiki 分别为  0.649  和  0.636). 这表明这一变量与  K  近邻的变化有较强的
                 正相关性. 当这个比值较大时, K        近邻的变化个数一般也显著增加, 因此, 通过基于该变量的取值为每条数据动态
                 分配更新资源, 也就是分配不同的检查次数, 可以提高对计算资源的利用效率, 为                         K  近邻变化较大的数据分配更
                 多资源来调整其邻居关系, 从而加速整个             K  近邻图的调整.
                    通过分析不同变量与        K  近邻变化个数的相关系数, 我们发现, 数据点的位移距离和近邻距离的差异程度对微
                 调前后   K  近邻变化的程度有重要影响. 这些结果支持了第              3.3  节提出的基于数据密度的动态分配更新资源的合理
                 性. 未来的研究可以进一步探讨这些变量在实际应用中的具体影响, 以优化                       K  近邻图更新算法在不同数据分布下
                 的表现.
   49   50   51   52   53   54   55   56   57   58   59