Page 355 - 《软件学报》2026年第2期
P. 355
834 软件学报 2026 年第 37 卷第 2 期
采用信号提取技术, 通过多场景实验捕获资源需求特征以实现自动化扩展. 文献 [137] 提出基于时间序列分析的
容量规划方法, 通过模式识别与集成建模预测周期性负载. Seagull [138] 则利用多模型融合预测低负载时段以优化备
份调度. 在大数据领域, TASQ [139] 采用参数化性能特征曲线与数据增强技术解决稀疏数据下的资源分配问题. 文
献 [140] 通过蒙特卡洛树模拟多租户资源需求相关性, SUFS [141] 结合 LSTM 与自适应统计实现突发数据下的鲁棒
存储预测. Auto-WLM [142] 通过查询执行特征建模实现 Redshift 平台的智能并发控制, 其优先级调度算法可提升
23% 吞吐量.
3.2.2 负载生成
智能负载生成指利用强化学习、生成对抗网络等人工智能技术, 合成符合特定语法规则、语义约束或性能目
标的数据库操作序列.
智能负载生成包含约束定义、算法生成与效果验证这 3 个关键阶段. 首先使用声明式语言将业务规则转化为
可执行的约束条件, 包括查询结果基数范围、事务完整性要求等核心限制. 随后采用强化学习框架, 在保证 SQL
语法正确性的前提下, 通过奖励机制引导生成器探索符合性能目标的查询组合. 生成结果需通过多级验证体系: 语
法层面检查查询结构合规性, 语义层面验证连接谓词逻辑一致性, 性能层面比对执行计划代价估算.
智能负载生成分为约束型与非约束型两类: (1) 约束型生成: LearnedSQLGen [143] 采用强化学习框架, 通过基数
约束引导的奖励函数与有限状态机确保查询有效性; ezGen [144] 通过概率近似模型实现子查询的语义保持生成. (2) 非
约束型生成: Lauca [145,146] 通过事务逻辑与数据访问分布的双重特征建模实现性能指标复现; DBMS Annihilator [147]
采用软硬件协同设计支持百万级事务压力测试.
3.2.3 负载检测
智能负载检测是通过实时解析查询特征与资源消耗轨迹, 识别工作负载分布偏移、性能异常及资源竞争问题
的自动化诊断技术.
负载检测系统基于特征分析、异常识别与动态调优的闭环机制运行. 系统首先从查询文本、执行计划和资源
指标这 3 个维度提取特征: 语法特征包括操作符类型与子句结构, 语义特征涵盖谓词选择率与连接复杂度, 资源特
征涉及 CPU/内存使用波动模式. 继而采用混合检测策略, 对渐进式负载偏移计算历史分布差异度, 对突发异常识
别统计离群点, 并通过滑动窗口机制实现秒级响应. 检测结果触发分级响应策略: 常规偏移自动优化索引配置与查
询路由, 严重异常则触发告警并保存诊断快照.
工作负载偏移表现为查询分布或数据特征的时序变化. 文献 [148] 的轻量级模型通过实时差异检测触发重配
置. 文献 [149] 采用基于距离的聚类分析检测负载演变. 文献 [150] 提出双样本检测框架监测查询特征分布漂移.
DBAugur [151] 利用 GAN 网络建模负载趋势与异常关联. AWM [152] 则通过马尔可夫链与前缀树实现复杂模式发现,
其成本优化模型可大大降低检测延迟.
3.3 小 结
在智能数据库自动化管理和运维领域, 当前研究呈现出 3 个显著的发展趋势: 首先, 基于人工智能的调优算法
正深度整合自适应学习机制与强化学习框架, 通过动态适应数据库特性和工作负载模式, 显著提升参数优化与索
引推荐的自动化精度. 其次, 新型负载管理模型通过融合多维特征 (包括实时性能指标、历史负载模式及系统状态
数据) 构建闭环反馈系统, 实现了亚秒级响应的动态资源分配. 值得注意的是, 可解释 AI 技术在异常诊断中的应
用, 通过构建层次化解释模型, 不仅提升了故障定位准确率, 同时生成符合 DBA 认知逻辑的决策依据.
现有研究对数据库参数调优领域进行了系统性的总结与梳理 [153−155] , 这些研究从技术演进、方法论体系及实
现流程等维度对数据库参数调优进行了全面的归纳与分类. 在数据库索引推荐研究方面 [156,157] , 文献 [156] 采用多
维度分析方法, 既对现有索引推荐技术进行了层次化比较, 又系统梳理了该领域的技术发展脉络. 与之相补充, 文
献 [157] 则构建了索引推荐的标准化框架, 并基于此对各功能模块进行了横向对比分析.
智能管理层技术 (参数调优、索引推荐、诊断、负载分析) 的演进, 是标准化处理范式在数据库运维自动化
领域的典型实践. 这些技术完整覆盖了系统感知 (系统状态监控)、特征提取 (参数/负载特征筛选)、模型应用 (启

