Page 356 - 《软件学报》2026年第2期
P. 356
姬涛 等: AI 赋能的关系型数据库系统研究: 标准化、技术与挑战 835
发式/贝叶斯/强化学习决策)、决策执行 (配置应用/索引创建) 及反馈管理 (性能监控与模型迁移) 的闭环流程. 在
智能数据库管理层的研究和方法中, 针对数据库调优与诊断和负载分析与管理的人工智能和机器学习算法已经取
得了显著的进展, 但仍面临一些深层次的挑战. 对于数据库调优与诊断, 虽然现有的算法能够在一定程度上自动调
整参数、推荐索引等, 但现有的方法往往需要大量的训练数据, 较长的训练时间和较高的算力支持. 面对不断变化
的工作负载和复杂的数据库架构, 现有模型的泛化能力和调优精度仍需进一步提升. 此外, 在人工智能的加持下数
据库诊断的自动化程度虽然大幅提升, 但在准确识别数据库问题和详细解释根本原因方面, 这些方法还需要进一
步的优化. 对于数据库负载分析与管理, 负载预测算法虽能捕捉到负载变化, 但在动态环境中预测的长期准确性仍
然难以保证. 负载生成算法也需要依赖约束条件能够更精准地生成约束负载和更精细地模拟真实负载.
数据库调优与诊断的算法需要进一步结合人工智能算法和数据库特点, 通过自适应算法和强化学习等技术进
一步提升调优的自动化水平和准确性. 同时, 数据库开发人员需要考虑如何利用数据、负载和数据库状态信息, 开
发出更加灵活和精准的实时反馈的负载管理模型. 此外, 智能数据库需要针对数据库诊断引入解释性模型, 提高数
据库诊断的准确率同时向 DBA 提供清晰且可信度高的异常问题解释. 在智能数据库的管理与维护的推荐和优化
过程中, 提升算法的透明度和可解释性以增强 DBA 对智能方法的信任和接受程度是算法能够实际应用的关键.
未来突破方向聚焦于: 1) 开发轻量化框架, 通过迁移学习降低模型对标注数据的依赖; 2) 构建时空联合建模
的负载预测体系, 整合时间序列分析与图神经网络技术; 3) 建立诊断结果的置信度量化指标, 采用贝叶斯深度学习
生成概率化解释. 特别需要强调的是, 任何智能运维算法的实际部署都必须通过人机协同验证 (human-in-the-
loop) 机制, 确保技术方案既符合 DBA 的经验认知, 又能突破人工处理的性能瓶颈.
4 智能内核层
数据库内核的智能组件是指利用人工智能的方法优化或者替换集成在数据库系统核心层的高级功能模块, 通
过使用机器学习、深度学习或强化学习等方法来增强数据库的自主性和可靠性以及提高数据库性能. 面向内核的
智能组件包括数据存取、查询优化和查询执行这 3 个方面.
4.1 数据存取
智能数据库的数据存取仍然依赖传统的数据库读取和存储数据的模式 (读取和存储在内存或者磁盘的方法).
但是数据库社区发现机器学习模型在有序数据读取方面的巨大优势, 利用学习的方法设计了新的索引结构范式来
加速数据的读取. 同样的在传统的数据库存储基础上, 数据库社区利用学习的方法设计出了新的数据分区方法加
速数据的存取.
4.1.1 学习索引
(1) 一维学习索引
索引是对数据库表中某一列或者多列进行排序的数据结构, 使用索引可以快速访问该列的特定信息. 数据库
社区近年来发现使用机器学习模型可以代替传统的索引. 如果将传统的 B-树 [158] 索引看作黑盒模型, 其输入为查
询的键值, 输出为键值对应的存储位置, 就会发现机器学习模型具有类似的功能, 同样将待预测数据输入机器学习
模型, 机器学习模型将输出预测数据所对应的标签. 受此启发, 数据库社区希望找到一种学习的模型和数据结构能
够代替传统的 B-树, 学习键值和位置之间的映射关系.
给定<键, 位置>对的排序列表, 学习索引旨在使用机器学习模型来预测查询键的位置. 图 7 总结了一维学习索
引的标准化框架, 如图所示, 一维学习索引需要支持查询、插入、删除和块加载这 4 种基本功能. 如表 5 所示, 接
下来本文将结合具体的方法介绍和总结一维学习索引的这 4 种功能.
查询包括点查询和范围查询. 对于点查询来说, 一般包含 3 个阶段, 分别是层次模型内部递归, 叶节点位置预
测和位置修正. 学习索引多为层次结构, 内部模型不断递归预测查询键所属下一层子节点, 为了保证查询正确性叶
节点模型需要记录模型的最大误差边界 E. 叶节点模型位置预测就是利用叶节点学习模型预测输入键的位置, 由
于模型的准确性有限, 预测的位置往往是不正确的, 所以需要根据模型的最大误差边界 E 对预测的位置进行调整.

