Page 350 - 《软件学报》2026年第2期
P. 350

姬涛 等: AI 赋能的关系型数据库系统研究: 标准化、技术与挑战                                                829


                 配置之间的影响, 不断抽取样本构建新的贝叶斯网络, 循环迭代优化. BestConfig                  [79] 将分流采样法和有界递归搜索
                 方法结合. BestConfig  首先利用分流采样法, 把参数配置空间离散化, 将参数配置变成配置区间, 然后随机选取样
                 本作为参数配置来测试配置性能, 最后找出其中最优的参数区间, 并对该最优空间进行更细致的搜索直到达到理
                 想性能. 这些方法自动化程度有了更加明显的提升, 所得到的参数也更加精确和具有更强的适用性, 但是这些方法
                 推荐速度较慢, 对历史经验利用不充分.
                    基于贝叶斯优化的方法主要由            3  个组件构成, 分别是基于贝叶斯的调优模型、数据筛选以及模型迁移. 在训
                 练基于贝叶斯的调优模型时, 将数据库参数配置作为输入, 数据库的指标                       (吞吐量, 延迟等) 作为标签. 一般化的流
                 程包括: 1) 收集负载、参数和系统状态信息, 2) 参数选择, 3) 将数据输入模型, 4) 参数生成, 5) 结果观测, 然后重复
                 上述  3)、4)、5) 直到达成终止条件.
                    一些方法    [80–82,86,87] 使用了不同的配置特征空间选择函数, 这些方法站在不同的角度设定了不同的特征选择.
                 文献  [80,81] 使用高斯回归作为其调优模型, 高斯回归的预测值是观察值的插值, 一定程度避免不合理的数据库参
                 数配置产生. 其次高斯过程预测值是概率的, 可以计算经验置信区间, 给出产生的数据库参数配置置信度. 贝叶斯
                 模型作为参数调优模型的方法          [82–85] 能够处理大量数据库参数变量之间的复杂关系, 有效地描述配置之间的依赖关
                 系. 贝叶斯模型也可以根据当前数据库状态对未来的数据库变化进行推断, 所以具有一定的抗干扰能力. 除此之
                 外, 贝叶斯模型容易进行模型迁移, 能够适应数据库变化的场景. 集成的调优模型                        [86,87] , 将多种方法的优点进行结
                 合使得推荐算法的准确性和调优效果有所提升, 从一定程度上提升了调优模型的泛化能力, 模型集成也可以更好
                 地适应不同的数据模式.
                    基于深度学习的方法无需运行负载而使用深度学习预测给定参数下的数据库性能, 避免调参过程中需要不断
                 运行负载的情况.
                    IBTune [88] 利用缓存未命中率和缓冲池大小之间的关系优化云数据库的内存分配. IBTune 利用数据库相关运
                 行状态找到每个数据库实例可容忍的未命中率, 根据该指标和实例内存来调整目标缓冲池大小. IBTune 还设计了
                 一个神经网络学习数据库状态和参数配置与响应时间的关系. LITE                   [89] 针对  IBTune 不能应对负载差异较大的情况,
                 针对  Spark  设计了基于对抗学习的自适应系统. LITE         训练了基于神经网络的估计器模型来估计               Spark  在预估参数
                 上的性能. LITE  还使用了迁移学习的方法来应对训练数据不足, 以及生成不同参数和性能的训练数据耗时的情况.
                    基于强化学习的方法将强化学习的范式应用在数据库参数调优. 数据库系统作为强化学习环境                                (environment),
                 调优器作为代理      (agent) 包括调优算法和调优模型, 数据库指标表示当前状态               (state), 代理将状态  (state) 作为输入,
                 给出推荐的数据库参数作为当前需要采取的动作                  (action), 奖励  (reward) 就是调优配置给数据库系统带来的性能
                 提升, 一般用负载代价减少量或者吞吐量的提升来衡量. 强化学习的代理                       (agent) 就是参数调优器, 由调优算法和
                 调优模型两部分组成.
                    基于强化学习的数据库参数调优方法通过强化学习算法自动化地优化配置, 以提高数据库性能和效率. 基于强
                 化学习的参数调优方法        [90,91] 多使用人为设定的参数集合作为选择的特征空间. 这主要是因为大多数数据库参数对
                 数据库性能影响有限, 人为设定可以很好地吸取               DBA  的调优经验, 选取对数据库性能影响较大的参数. CDBTune             [90]
                 利用  DDPG (deep deterministic policy gradient) [94] 算法, 通过模型微调和将查询信息作为状态输入到调优系统中, 实
                 现了对数据库参数的智能调整. QTune          [91] 采用了  Double-state DDPG [95] 考虑了更多的状态信息以进行更精细的调
                 整. 此外, DB-BERT [92] 则是利用自然语言处理技术, 从用户手册等文本中提取有用信息, 辅助调优过程. HUNTER                    [93]
                 使用了基于    PCA (principal component analysis) [96] 和随机森林的降维方法对特征空间进行选择. HUNTER      方法则
                 结合了遗传算法和强化学习, 采用两阶段训练策略, 先通过遗传算法进行粗略搜索, 然后用                           DDPG  进行精细调优,
                 结合了对特征空间的探索和利用, 从而平衡全局搜索和局部优化的需求.
                    基于大模型的方法利用         LLM  的强大能力进行数据库调优, 它们以文本的方式将系统信息和负载信息输入大
                 语言模型以获得推荐参数. GPTuner         [97] 和  DB-BERT  [92] 需要人为收集数据库参数设计的文本以限制调优空间,
                 GPTuner 利用  LLM  进行预处理, 也就是提供数据库的参数等的详细信息, 然后让大模型从中选择最相关的参数以
                 对参数空间进行剪枝, 然后利用传统的贝叶斯优化方法进行参数推荐过程. DB-BERT                        应用  BERT  模型进行的参数
   345   346   347   348   349   350   351   352   353   354   355