Page 6 - 《软件学报》2026年第3期
P. 6
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
2026,37(3):969−970 [doi: 10.13328/j.cnki.jos.007520] [CSTR: 32375.14.jos.007520] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
*
向量数据库及 DB4LLM 技术专题前言
高 宏 1 , 李国良 2 , 张 蓉 3
1
(浙江师范大学 计算机科学与技术学院, 浙江 杭州 321004)
2
(清华大学 计算机科学与技术系, 北京 100084)
3
(华东师范大学 数据科学与工程学院, 上海 200062)
通信作者: 李国良, E-mail: liguoliang@tsinghua.edu.cn
中文引用格式: 高宏, 李国良, 张蓉. 向量数据库及DB4LLM技术专题前言. 软件学报, 2026, 37(3): 969–970. http://www.jos.org.cn/
1000-9825/7520.htm
向量数据库是一种专门用于管理高维数据的数据库系统. 与传统数据库系统主要处理结构化数据不同, 向量
数据库专注于存储和检索以向量形式表示的数据, 这些数据可以是文本、图像、音频等复杂数据类型. 在大数据
和人工智能技术的驱动下, 向量数据库已经广泛应用于信息检索、推荐系统、语音识别、图像分析等领域, 成为
数字化转型和智能化发展的重要推动力. 然而, 面对海量高维向量数据的实时更新、存储、检索与分析需求, 特别
是来自大语言模型 (large language model, LLM) 等人工智能技术的应用需求, 传统数据库技术还面临着许多挑战,
亟须发展新的数据库理论、方法与技术, 提高向量数据库对实际应用场景的支持能力. 本专题聚焦于“向量数据库
及 DB4LLM 技术”主题, 重点关注向量数据库及 DB4LLM 技术研究中具有创新性和突破性的高水平研究成果, 探
讨相关基础理论、关键技术, 以及在系统研发过程中关于系统设计原理、范式、架构、经验等方面的实质性进
展, 探讨其在相关产业和领域的应用前景以及关键挑战.
本专题公开征文, 共收到投稿 16 篇. 论文均通过了形式审查, 内容涉及向量数据库的数据存储、索引维护、
查询处理与优化、向量检索. 特约编辑先后邀请了 20 多位专家参与审稿工作, 每篇投稿至少邀请 2 位专家进行评
审. 稿件经初审、复审、NDBC 2025 会议宣读和终审 4 个阶段, 历时 4 个月, 最终有 8 篇论文入选本专题. 根据主
题, 这些论文可以分为 4 组.
(1) 向量检索
《向量数据库中近似最近邻搜索关键技术综述》针对面向高维向量近似最近邻搜索 (approximate nearest
neighbor search, ANNS) 的新方法和研究成果系统性梳理缺失引起的技术理解难和应用推进慢的问题, 全面地总
结和分类现有方法, 概述了它们所针对的问题和解决思路; 并基于当前的研究成果和研究趋势, 完成了对未来研究
方向的展望, 从而为向量搜索和向量数据库的研究和设计提供可靠的参考和借鉴.
《向量数据库的 K 近邻图高效更新方法》针对嵌入模型微调通常会导致全部数据的向量表示发生系统性变
化, 从而使原有 K 近邻图的邻接关系失效的问题, 提出一种面向嵌入模型微调场景的高效 K 近邻图更新方法, 解
决了面向嵌入模型微调后的 K 近邻图质量问题. 该方法基于嵌入模型微调为每条数据嵌入带来的影响较小的观
察, 通过局部更新策略对原始 K 近邻图进行增量调整, 最终实现了在确保最终 K 近邻图质量的同时, 显著提升更
新效率.
《GoVector: I/O-高效的高维向量近邻查询缓存策略》针对存储大量邻接关系的图结构高维向量索引 (索引
图) 存在由于索引访问频繁发生 I/O 操作导致的性能瓶颈问题, 提出了一个静态-动态混合缓存策略, 实现了缓存
命中率的显著提升, 并有效降低了整体 I/O 开销. 论文利用静态缓存区预加载入口点及其高频近邻, 利用动态缓存
区自适应地缓存空间局部性高的顶点. 这种双重优化机制提升了吞吐降低了延时.
(2) 向量数据管理
《GPU 加速的高维向量聚类算法》针对现有的基于密度的聚类算法在处理高维向量数据时将产生极高的时
* 收稿时间: 2025-09-08; jos 在线出版时间: 2025-09-09

