Page 160 - 《软件学报》2026年第5期
P. 160
廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法 2039
分析中, 主要的评估指标是 RS 数据集上的匹配率 (MR), 除非另有说明, 其他超参数均保持其默认最优值 (如第
5.1.4 节所述或通过先前调整确定).
4.4.1 核心架构与强化学习参数
我们首先研究了与模型架构和强化学习智能体相关的关键参数. 针对表 3 所展示的结果 (括号内数值代表参
数值对应的匹配率 (MR)), 我们对各参数的敏感度进行分析.
表 3 核心架构与强化学习参数对匹配率 (MR) 的敏感性分析
测试值及对应的 MR
参数
值 1 值 2 最优/默认值 值 4 值 5
规划范围 2 (0.774) 4 (0.783) 8 (0.813) 10 (0.805) 12 (0.791)
PPO 裁剪 ( ϵ clip ) 0.1 (0.780) 0.15 (0.792) 0.2 (0.813) 0.25 (0.801) 0.3 (0.786)
折扣因子 ( γ) 0.90 (0.771) 0.93 (0.794) 0.95 (0.813) 0.97 (0.785) 0.99 (0.778)
● 规划范围: 随着规划范围从 2 增加到 8, 智能体的性能得到改善, 表明更长远的预见性对决策制定有益. 规划
范围为 8 时可获得最佳 MR 值 0.813. 将其进一步扩展到 10 时则表现出轻微下降, 这可能是由于学习复杂度增加
或价值估计的方差增大所致. 因此, 为 TB-Match 选择了规划范围 8.
● PPO 裁剪 ( ϵ clip ): 此参数约束策略更新步长. PPO 实现中常用的 ϵ clip 值 0.2 获得了最高的 MR (0.813). 较小的
值 (例如 0.1) 会减慢学习速度, 而较大的值 (例如 0.3) 可能导致过于激进的更新和不稳定性.
● 折扣因子 ( γ): 此参数决定未来奖励的现值. γ 为 0.95 时提供了最佳 MR (0.813), 在重视即时结果和未来结
果之间取得了平衡. 较低的值使智能体更短视, 而非常高的值在未来奖励高度不确定或遥远时会使学习变得困难.
4.4.2 学习过程中的超参数
我们还对学习过程的超参数进行了分析. 如表 4 所示, 对于偏好表示模块, 学习率 1×10 是最优的. 对于匹配
−4
−5
决策模块, 5×10 产生了最佳结果. 这些值在收敛速度和稳定性之间提供了良好的权衡. 显著较高的学习率会导致
不稳定, 而较低的学习率则导致收敛过慢.
表 4 学习过程参数对匹配率 (MR) 的敏感性分析
测试值及对应的 MR
参数
值 1 值 2 最优/默认值 值 4 值 5
偏好模块学习率 5E–5 (0.804) 8E–5 (0.809) 1E–4 (0.813) 2E–4 (0.804) 5E–4 (0.799)
匹配模块学习率 1E–5 (0.803) 3E–5 (0.808) 5E–5 (0.813) 8E–5 (0.805) 1E–4 (0.801)
4.5 鲁棒性实验 (RQ4)
除了最优条件外, 一个实用的匹配系统还必须能稳健应对各种现实世界中的运营挑战. 本节评估 TB-Match
在几种此类场景下的性能: 波动的市场动态 (需求高峰、司机短缺)、不均衡的资源分配 (地理失衡)、数据质量问
题 (稀疏性、输入噪声) 以及可扩展性需求. 除非另有说明, 所有实验均在 RS 数据集上进行, 并将性能与关键基线
方法进行比较.
4.5.1 市场波动下的韧性
现实世界的物流平台经常经历不可预测的供需变化. 我们模拟了两种常见场景. 1) 需求高峰: 运单量比平均水
平增加 50%, 测试系统处理需求突然激增的能力. 2) 运力短缺: 可用运力数量减少 30%, 评估在运力供给受限情况
下的性能.
后文表 5 总结了各种方法的性能保持情况. 性能保持率定义为挑战条件下指标值除以正常条件下指标值, 以
百分比表示. 例如, 87.5% MR 表示模型保留了其原始匹配率的 87.5%. 最优保持率以粗体标出.
在需求高峰下, TB-Match 保持了其原始匹配率 (MR) 的 87.5%, 优于次优基线 MAPT (83.2%). 同时 TB-Match
也最有效地保持了司机满意度 (DS) (92.1% 的保持率). 这表明即使在需求很高的情况下, 它也能有效地分配运力.

