Page 365 - 《软件学报》2026年第2期
P. 365
844 软件学报 2026 年第 37 卷第 2 期
物理算子生成 运行时监控 自适应查询处理 并发控制与调度
一致性交付
图 10 查询执行优化标准化框架
4.3.1 自适应查询处理
在动态优化环节, 自适应查询处理 (adaptive query processing, AQP) 技术通过运行时反馈机制重构查询计划.
Cuttlefish [239] 采用多臂老虎机强化学习模型, 在分布式环境 (如 Spark) 中动态探索物理算子组合策略, 其优势在于
无需预定义算子调整规则即可实现图像卷积、正则表达式匹配等异构操作的联合优化, 但存在反馈延迟导致优化
滞后的问题. RouLette [240] 针对多查询场景设计了全局优化器, 通过构建共享运算符的代价模型生成最小化总成本
的执行计划, 其强化学习机制有效降低了适配开销, 但在高并发场景下可能遭遇状态空间爆炸的挑战. SkinnerMT [241]
则融合了并行计划探索与数据并行处理, 采用元组级线程分配策略实现细粒度负载均衡, 其混合执行架构降低了
系统延迟, 但对硬件资源碎片化场景的适应性仍需提升.
4.3.2 并发控制与调度
在资源协调阶段, 智能调度系统通过机器学习模型优化并发控制与任务调度. Decima [242] 率先将深度强化学习
引入 DAG 任务调度, 通过对历史负载特征的图编码学习生成最优调度策略, 但缺乏对动态到达任务的实时响应
能力. 为此, LSched [243] 融合图注意力机制与数据树卷积, 构建了白盒化调度预测模型, 可实时感知物理计划特征与
资源状态变化, 其查询间/查询内双重调度机制使内存数据库的吞吐量大幅提升. SmartQueue [244] 针对存储层优化提
出深度 Q-learning 调度框架, 通过神经网络建模缓冲区状态与查询数据访问模式的关联关系, 其自适应排序策略
使缓存命中率大幅提高. 针对异构计算场景, BG3 [245] 提出了基于 BW 树的内存索引的图存储引擎结合一种工作负
载感知的空间回收机制, 提高了存储利用率并减少了写放大. PCC 协议 [246] 创新性结合持久化内存特性与 RDMA
技术, 通过设计持久化摘要, 从而使流算法能够回答有关流在任何先前时间的查询.
4.4 小 结
数据库内核正通过人工智能方法不断进化, 变得更加智能和高效. 智能数据内核会更加集成化, 将数据处理、
分析、存储和检索等功能集成在一个统一的框架内, 同时保持模块化, 便于根据不同需求进行定制和扩展. 随着技
术的发展, 智能数据内核将能够处理更大规模的数据, 并实现实时或近实时的数据分析, 以支持快速决策. 内核将
具备更强的自适应能力, 能够根据数据的变化和用户的需求自动调整分析策略, 同时通过自学习不断优化性能.
现有研究对智能数据库内核的多个关键方向进行了系统性探讨. 文献 [247] 通过抽象一维学习索引的标准流
程, 建立了方法论框架, 并对现有技术方案进行了横向对比分析. 文献 [248] 采用攻击注入的实验方法, 深入考察
了一维学习索引在极端场景下的鲁棒性表现. 在理论层面, 文献 [249] 通过数学建模揭示了学习索引的效率上限.
针对多维学习索引领域, 文献 [250] 系统梳理了该技术的发展脉络与演进路线, 而文献 [251] 则通过构建统一评估
基准, 对现有多维学习索引方案的性能特征进行了实证研究.
也有一些研究对智能数据库查询优化领域展开了多角度的系统性探索. 文献 [252] 通过实验评估了不同执行
计划表示方法在基数估计、查询优化等关键任务中的性能表现. 文献 [253] 基于大量实证研究发现, 当前数据库
系统采用的基数估计方法存在显著误差, 而准确的基数估计对确定最优连接顺序具有决定性影响. 在学习的基数
估计方法方面, 文献 [254] 构建了系统的设计空间探索框架, 并对现有最优学习方法进行了全面对比分析. 文献 [255]
则从连接顺序选择、访问路径确定和物理操作符选取这 3 个核心维度, 对学习型成本模型进行了综合评估. 为进
一步规范评估流程, 文献 [256] 提出了新型端到端基准框架, 为学习型查询优化器的性能评估提供了标准化解决
方案.
智能内核层组件 (数据存取、查询优化、查询执行) 的设计严格遵循标准化处理范式. 其流程涵盖数据分布
感知、查询特征提取、机器学习模型应用 (如索引预测、基数估算、计划优化)、物理操作执行以及部分增量更
新反馈机制.

