Page 47 - 《软件学报》2026年第3期
P. 47
1010 软件学报 2026 年第 37 卷第 3 期
因为嵌入模型的微调发生改变时, 仍然需要重新构建整个向量索引.
当某个节点的特征向量发生变化 (如嵌入更新), 其原本的近邻可能不再符合, 此时的解决方法为: 首先进行局
部重建, 对该点重新进行 K 近邻搜索并更新其邻接列表, 然后对受影响的邻居进行修复; 接下来进行传播, 对更新
点的邻居节点进行级联更新, 并设置传播深度上限以限制代价.
当节点删除时, 从其他节点的邻接表中移除该节点. 对于缺失的邻居, 可以通过局部重采样进行补充.
现有方法对于节点特征更新导致 K 近邻图更新的探索局限于单个或少部分节点的更新, 而本文侧重于解决
嵌入模型经过微调等数据大规模变化时的情况, 在这种情况下, 数据点的改变不再只局限于一部分点, 而是所有点
的嵌入都会发生变化. 我们将在第 2 节中详细介绍本文研究问题的应用场景.
2 嵌入模型微调的场景介绍
在处理非结构化数据 (如文本、图像或音频) 时, 常常难以直接利用其原始形式的数据建立明确的结构关系.
为了弥合这一差距, 近年来, 研究者广泛采用预训练模型将这类数据映射为稠密向量, 即嵌入表示 (embedding), 以
捕捉其语义特征或内容相似性 [1] . 通过将每个样本 (如文档、句子或实体) 编码为向量, 我们便可以进一步在向量
空间中建模它们之间的邻近关系, 构建出反映语义结构的图.
在图结构构建任务中, 基于嵌入向量的 K 近邻图是一种常见且高效的表示方式. 该方法以每个节点的嵌入为
基础, 通过计算其与其他节点之间的向量距离, 与最近的 K 个邻居节点构建连边, 从而形成表示语义相似关系的
图结构. 这类图广泛应用于文本聚类、文档推荐、图神经网络建模等任务, 尤其适用于原始数据缺乏显式结构的
场景.
然而, 当嵌入模型经过微调 (fine-tuning) 后, 原始的节点表示将发生显著变化, 从而影响节点之间的相对距离
关系. 此时原有的 K 近邻图结构将不再准确, 必须进行更新以反映新的语义结构.
嵌入模型的微调通常出现在以下几类应用场景中.
(1) 文本语义理解任务中的领域自适应. 预训练的语言模型在通用语料上学习的嵌入可能无法准确捕捉特定
领域中的语义细节. 例如, 在法律、医学或金融等专业领域, 通过引入领域标注数据对嵌入模型进行微调, 有助于
提升语义相似度的判别能力. 在此过程中, 原有的 K 近邻图已无法准确反映领域语义, 必须基于新嵌入重新更新
图结构.
(2) 图神经网络的辅助图构建. 在基于图神经网络 (GNN) 的任务中, 如节点分类、链接预测或社区检测, K 近
邻图常作为结构先验引入模型中. 若嵌入通过对比学习或自监督方法持续优化, K 近邻图也需动态更新, 以保持结
构与表示之间的一致性, 从而提升 GNN 模型性能.
(3) 交互式或迭代式标注流程. 在某些半监督学习或主动学习场景中, 嵌入模型在用户反馈的引导下逐步微
调, 此时数据的向量表示将不断变化. 而由于 K 近邻图在数据可视化、聚类结果展示或样本筛选中扮演关键角色,
因此 K 近邻图需要随着嵌入更新而动态调整, 以确保交互效果的准确性和连贯性.
(4) 大规模文档检索与推荐系统中的嵌入演化. 在搜索与推荐系统中, 文档或用户的嵌入表示可能根据实时行
为数据、偏好反馈进行周期性更新. 在这种检索系统中, K 近邻图可作为高效的近邻查找索引使用, 而嵌入的微调
将直接影响召回质量, 因此必须高效更新 K 近邻图以保证系统性能.
综上所述, 嵌入模型微调不仅改变了向量表示, 同时也从根本上影响了基于相似度构建的图结构. 因此, 针对
嵌入模型微调的场景设计一种高效的 K 近邻图更新机制, 以避免每次全量重建, 是直接影响诸多下游任务的关键
问题.
3 嵌入模型微调下的高效 K 近邻图更新算法
3.1 框架概述
在嵌入模型驱动的搜索和推荐系统中, K 近邻图是一种常用的索引结构, 用于高效检索与查询点相似的数据.

