Page 143 - 《软件学报》2026年第3期
P. 143
1106 软件学报 2026 年第 37 卷第 3 期
制能够有效关注上下文信息, 无须通过隐藏层进行信息传递, 同时, 并行计算技术的引入大幅提升了嵌入模型的计
算效率.
多模数据 阶段 1: 嵌入表征 阶段 2: 索引存储 阶段 3: 近似检索 大语言模型
WRVQ 即压缩方法 文本 什么是 WRVQ?
量化中心 目标问题 目标向量
非结构文件 嵌入向量
向量数据库
残差向量
基于量化的表征表示 基于量化表征的数据相似度搜索
向量量化 量化码
残差向量
中心向量 (Layer1)
正则化 正则权重 中心向量 (Layer2)
准确匹配层 模糊检索层 遍历匹配搜索
正则残差向量
图 1 基于量化表征的向量索引和检索流程图
BERT (bidirectional encoder representations from Transformers) 作为广泛使用的文本嵌入模型, 采用基于
Transformer 结构的双向编码器表示, 并利用大规模自监督预训练策略, 在自然语言处理任务上均取得了良好性能 [7] .
InferSent 将自然语言推理方法引入文本嵌入 [8] , 而 SBERT (sentence-BERT) 则采用孪生网络和三元网络结构, 以
生成具有语义意义的句子嵌入, 并通过余弦相似性进行比较 [9] . 此外, 近年来的一些研究引入对比学习方法, 以更
有效地指导模型进行正负文本对的微调 [10] .
利用大型语言模型的强大语义理解能力, 诸多嵌入表征技术将文本、图像等输入映射到高维向量空间中, 以
支持高效的相似性检索与聚类. Gao 等人 [11] 提出的 SimCSE 则进一步引入对比学习框架, 利用 Dropout 构建正例,
显著增强了句子嵌入在语义相似度任务上的表征能力. OpenAI 在 GPT-3 中开放的 Embeddings API 进一步简化了
高质量文本嵌入的获取流程, 广泛应用于搜索、推荐与对话系统 [12] . 多模态领域的 CLIP 通过对比学习联合训练
图像与文本编码器, 使得跨模态检索成为可能 [13] . 通过直接提示和数据驱动调优两种策略不断优化 LLM 嵌入模
型, 以应对长文本、多语言及领域定制化需求 [14,15] .
1.2 向量数据管理和查询
为了更高效地管理向量数据, 向量数据库近年来得到了广泛开发和应用. 例如, 阿里巴巴研发了 PASE [16] 和
AnalyticDB-V [17] , Facebook 开发了 Faiss [18] 以支持高效的向量计算、查询和检索. 此外, 数据库初创公司如 Zilliz [19]
和 Chroma [20] 也构建了各自的向量数据库, 以满足不同应用场景的需求.
目前, 向量数据库大致可分为两类: 专用向量数据库和通用向量数据库. 专用向量数据库从零开始设计, 专门
用于管理向量数据, 并遵循“非一刀切 (tailored approach)”的设计原则 [21] , 典型代表包括 Faiss、Milvus 和 Chroma.
这类数据库通常专注于向量数据的存储、索引与检索, 能够通过定制优化达到卓越的性能. 相较之下, 通用向量数
据库则是在现有关系数据库 (如 PostgreSQL) 的基础上扩展, 以支持向量数据管理, 并遵循“一刀切 (one-size-fits-
all)”的设计理念 [22] , 如 PASE 和 AnalyticDB-V. 这类数据库的优势在于能够集成到成熟的关系数据库生态系统中,
从而提升系统的可用性, 复用已有的数据库功能, 消除数据孤岛, 并通过统一的系统架构降低运维成本. 然而, 由于
需要兼容关系数据模型, 通用向量数据库在向量数据的查询和存储性能方面可能存在一定程度的损失 [23] .
在向量数据库的研究工作中, 向量检索算法是核心组成部分. 其中, 大多数近似最近邻 (ANN) 检索算法属于
基于向量表征的检索方法 (embedding-based retrieval, EBR). 早期研究主要采用子空间划分技术进行向量近似比
较, 以提升检索效率, 如 KD-Tree [24] 和 K-means Tree [25] . 近期研究则更多地关注: 基于量化的方法 (如 IVFADC [26] 、
IVFPQ [27] ), 通过优化查询向量与索引向量的距离计算来提升检索性能; 基于图的方法 (如 HNSW [28] ), 通过构建图
索引结构, 将搜索算法的时间复杂度降低至对数级.
随着知识检索需求的不断增长, 研究人员针对不同类型和不同领域的数据集进行了大量探索, 致力于提升向

