Page 354 - 《软件学报》2026年第2期
P. 354

姬涛 等: AI 赋能的关系型数据库系统研究: 标准化、技术与挑战                                                833


                 入时间序列分解技术, 将原始数据拆分为趋势、周期与残差分量, 为后续异常检测提供高信噪比输入.
                  3.1.3.2    异常检测
                    异常检测与特征提取阶段致力于从海量数据中识别异常信号. 传统阈值检测方法因依赖静态截断值难以适应
                 动态负载, 为此, 文献     [126] 提出的极值理论通过流式单变量分析动态调整阈值, 避免人工干预. Netflix                  的  RPCA
                 采用鲁棒主成分分析, 将高维周期性数据分解为低秩矩阵与稀疏噪声, 精准捕捉促销场景下的异常波动. iSQUAD                              [127]
                 则突破二元分类局限, 对异常状态进行细粒度划分, 例如将                  CPU  过载细分为“短期尖峰”与“持续饱和”两类, 为根
                 因分析提供丰富上下文. FluxInfer     [128] 通过构建加权无向图建模指标依赖关系, 结合            PageRank  算法识别核心异常
                 节点, 有效区分因果链中的根因指标与衍生现象.
                  3.1.3.3    根因定位
                    根因定位与分析需要从异常信号中追溯本质问题. DBSherlock                [129] 引入因果推理模型, 将   DBA  经验编码为因
                 果假设库   (如“锁等待激增→事务并发度超限”), 通过概率图模型筛选高置信度根因. ExplainIt                   [130] 则以无监督方式
                 对数千条因果假设排序, 利用贝叶斯网络推断分布式系统中的传播路径, 例如定位跨节点查询延迟的源头. 针对间
                 歇性慢查询难题, iSQUAD     [127] 设计双阶段分析框架: 离线阶段通过聚类将相似执行计划的查询归类, 在线阶段基于
                 贝叶斯模型关联异常类型         (如  I/O  阻塞或索引缺失) 与慢查询集群, 显著降低人工标记成本. AutoMonitor          [131] 则发现
                 异常指标的空间聚集特性, 采用加权最近邻算法计算指标相似度, 结合全局权重调整策略提升根因定位精度, 例如
                 在内存泄漏场景中快速识别碎片化严重的缓冲池.
                  3.1.3.4    修复与优化
                    修复优化与自动化执行阶段将诊断结论转化为可操作方案. SQLCheck                    [132] 通过解析抽象语法树    (AST) 检测反
                 模式, 例如识别嵌套循环连接导致的笛卡尔积爆炸, 并推荐基于哈希连接的查询重写策略. DBdeo                            [133] 从架构、查
                 询与数据这    3  个层面枚举反模式, 例如检测宽表设计导致的冗余字段, 提出垂直分表方案. DeFiHap                    [134] 在  HiveSQL
                 优化中融合元数据分析与神经网络预测, 通过连接键值分布与表记录数预测执行时间, 推荐最优化简器                                (如谓词下
                 推或分区裁剪). 对于硬件资源瓶颈, AutoMonitor       [131] 基于  Kolmogorov-Smirnov  检验监控指标分布偏移, 自动调整
                 InnoDB  缓冲池大小或并发线程数, 使资源配置动态适配负载变化.
                  3.1.3.5    反馈与迭代
                    反馈迭代与模型更新形成闭环学习机制. PerfXPlan            [135] 在  MapReduce 作业调试中持续收集性能数据, 通过在
                 线机器学习更新查询代价模型, 使系统能够适应数据倾斜模式的变化. 文献                       [136] 提出的“指纹”技术将历史健康状
                 态编码为特征向量库, 当检测到当前指纹与库中记录的距离超限时, 触发模型再训练以纳入新的异常模式.
                  3.2   数据库负载分析与管理
                    数据库负载指系统在特定时间窗口内处理的操作集合, 包含结构化查询、事务操作及并发控制等行为, 其特
                 性受  OLTP  与  OLAP  场景差异的显著影响. 传统数据库管理员           (DBA) 依赖经验主义的负载管理方法已难以应对
                 云原生环境下动态负载的复杂性, 而智能负载管理通过构建预测模型与模式挖掘算法, 实现了从被动响应到主动
                 决策的范式转变.
                  3.2.1    负载预测
                    智能负载预测是通过机器学习算法分析数据库历史负载特征与资源消耗模式, 动态推演未来时间段内系统负
                 载强度及资源需求的技术.
                    数据库负载预测遵循数据采集、模型训练与决策优化的三阶段机制. 系统首先通过时间序列监控模块采集查
                 询吞吐量、CPU     利用率等核心指标, 并整合查询复杂度、资源竞争度等衍生特征构建训练数据集. 继而采用动态
                 集成学习方法, 将时序分解模型、深度神经网络与传统回归算法相结合, 通过在线权重调整机制优先选择预测误
                 差低的模型组合. 最终基于鲁棒优化理论生成资源配置策略, 综合考虑历史误差分布与业务优先级, 实现资源的弹
                 性伸缩.
                    云数据库环境下, 负载预测通过资源需求建模实现动态资源调配. 文献                       [136] 在  Azure SQL  构建的原型系统
   349   350   351   352   353   354   355   356   357   358   359