Page 47 - 《软件学报》2026年第3期
P. 47

1010                                                       软件学报  2026  年第  37  卷第  3  期


                 因为嵌入模型的微调发生改变时, 仍然需要重新构建整个向量索引.
                    当某个节点的特征向量发生变化 (如嵌入更新), 其原本的近邻可能不再符合, 此时的解决方法为: 首先进行局
                 部重建, 对该点重新进行       K  近邻搜索并更新其邻接列表, 然后对受影响的邻居进行修复; 接下来进行传播, 对更新
                 点的邻居节点进行级联更新, 并设置传播深度上限以限制代价.
                    当节点删除时, 从其他节点的邻接表中移除该节点. 对于缺失的邻居, 可以通过局部重采样进行补充.
                    现有方法对于节点特征更新导致            K  近邻图更新的探索局限于单个或少部分节点的更新, 而本文侧重于解决
                 嵌入模型经过微调等数据大规模变化时的情况, 在这种情况下, 数据点的改变不再只局限于一部分点, 而是所有点
                 的嵌入都会发生变化. 我们将在第          2  节中详细介绍本文研究问题的应用场景.
                  2   嵌入模型微调的场景介绍


                    在处理非结构化数据 (如文本、图像或音频) 时, 常常难以直接利用其原始形式的数据建立明确的结构关系.
                 为了弥合这一差距, 近年来, 研究者广泛采用预训练模型将这类数据映射为稠密向量, 即嵌入表示 (embedding), 以
                 捕捉其语义特征或内容相似性           [1] . 通过将每个样本 (如文档、句子或实体) 编码为向量, 我们便可以进一步在向量
                 空间中建模它们之间的邻近关系, 构建出反映语义结构的图.
                    在图结构构建任务中, 基于嵌入向量的             K  近邻图是一种常见且高效的表示方式. 该方法以每个节点的嵌入为
                 基础, 通过计算其与其他节点之间的向量距离, 与最近的                 K  个邻居节点构建连边, 从而形成表示语义相似关系的
                 图结构. 这类图广泛应用于文本聚类、文档推荐、图神经网络建模等任务, 尤其适用于原始数据缺乏显式结构的
                 场景.
                    然而, 当嵌入模型经过微调 (fine-tuning) 后, 原始的节点表示将发生显著变化, 从而影响节点之间的相对距离
                 关系. 此时原有的     K  近邻图结构将不再准确, 必须进行更新以反映新的语义结构.
                    嵌入模型的微调通常出现在以下几类应用场景中.
                    (1) 文本语义理解任务中的领域自适应. 预训练的语言模型在通用语料上学习的嵌入可能无法准确捕捉特定
                 领域中的语义细节. 例如, 在法律、医学或金融等专业领域, 通过引入领域标注数据对嵌入模型进行微调, 有助于
                 提升语义相似度的判别能力. 在此过程中, 原有的               K  近邻图已无法准确反映领域语义, 必须基于新嵌入重新更新
                 图结构.
                    (2) 图神经网络的辅助图构建. 在基于图神经网络 (GNN) 的任务中, 如节点分类、链接预测或社区检测, K                          近
                 邻图常作为结构先验引入模型中. 若嵌入通过对比学习或自监督方法持续优化, K                         近邻图也需动态更新, 以保持结
                 构与表示之间的一致性, 从而提升          GNN  模型性能.
                    (3) 交互式或迭代式标注流程. 在某些半监督学习或主动学习场景中, 嵌入模型在用户反馈的引导下逐步微
                 调, 此时数据的向量表示将不断变化. 而由于             K  近邻图在数据可视化、聚类结果展示或样本筛选中扮演关键角色,
                 因此  K  近邻图需要随着嵌入更新而动态调整, 以确保交互效果的准确性和连贯性.
                    (4) 大规模文档检索与推荐系统中的嵌入演化. 在搜索与推荐系统中, 文档或用户的嵌入表示可能根据实时行
                 为数据、偏好反馈进行周期性更新. 在这种检索系统中, K                 近邻图可作为高效的近邻查找索引使用, 而嵌入的微调
                 将直接影响召回质量, 因此必须高效更新             K  近邻图以保证系统性能.
                    综上所述, 嵌入模型微调不仅改变了向量表示, 同时也从根本上影响了基于相似度构建的图结构. 因此, 针对
                 嵌入模型微调的场景设计一种高效的             K  近邻图更新机制, 以避免每次全量重建, 是直接影响诸多下游任务的关键
                 问题.
                  3   嵌入模型微调下的高效         K  近邻图更新算法


                  3.1   框架概述
                    在嵌入模型驱动的搜索和推荐系统中, K             近邻图是一种常用的索引结构, 用于高效检索与查询点相似的数据.
   42   43   44   45   46   47   48   49   50   51   52