Page 160 - 《软件学报》2026年第5期
P. 160

廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法                                   2039


                 分析中, 主要的评估指标是 RS 数据集上的匹配率 (MR), 除非另有说明, 其他超参数均保持其默认最优值                             (如第
                 5.1.4 节所述或通过先前调整确定).
                  4.4.1    核心架构与强化学习参数
                    我们首先研究了与模型架构和强化学习智能体相关的关键参数. 针对表                        3  所展示的结果    (括号内数值代表参
                 数值对应的匹配率       (MR)), 我们对各参数的敏感度进行分析.


                                     表 3 核心架构与强化学习参数对匹配率 (MR) 的敏感性分析

                                                              测试值及对应的 MR
                        参数
                                       值 1           值 2         最优/默认值           值 4           值 5
                      规划范围            2 (0.774)     4 (0.783)     8 (0.813)     10 (0.805)    12 (0.791)
                    PPO 裁剪 ( ϵ clip )  0.1 (0.780)  0.15 (0.792)  0.2 (0.813)  0.25 (0.801)   0.3 (0.786)
                     折扣因子 ( γ)       0.90 (0.771)  0.93 (0.794)  0.95 (0.813)  0.97 (0.785)  0.99 (0.778)

                    ● 规划范围: 随着规划范围从 2 增加到 8, 智能体的性能得到改善, 表明更长远的预见性对决策制定有益. 规划
                 范围为 8 时可获得最佳 MR       值 0.813. 将其进一步扩展到 10 时则表现出轻微下降, 这可能是由于学习复杂度增加
                 或价值估计的方差增大所致. 因此, 为 TB-Match 选择了规划范围 8.
                    ● PPO 裁剪 ( ϵ clip ): 此参数约束策略更新步长. PPO 实现中常用的      ϵ clip  值 0.2 获得了最高的 MR (0.813). 较小的
                 值  (例如 0.1) 会减慢学习速度, 而较大的值       (例如 0.3) 可能导致过于激进的更新和不稳定性.
                    ● 折扣因子 (  γ): 此参数决定未来奖励的现值.         γ 为 0.95 时提供了最佳 MR (0.813), 在重视即时结果和未来结
                 果之间取得了平衡. 较低的值使智能体更短视, 而非常高的值在未来奖励高度不确定或遥远时会使学习变得困难.
                  4.4.2    学习过程中的超参数
                    我们还对学习过程的超参数进行了分析. 如表               4 所示, 对于偏好表示模块, 学习率        1×10  是最优的. 对于匹配
                                                                                       −4
                             −5
                 决策模块,   5×10  产生了最佳结果. 这些值在收敛速度和稳定性之间提供了良好的权衡. 显著较高的学习率会导致
                 不稳定, 而较低的学习率则导致收敛过慢.

                                         表 4 学习过程参数对匹配率 (MR) 的敏感性分析

                                                              测试值及对应的 MR
                        参数
                                       值 1           值 2         最优/默认值           值 4           值 5
                    偏好模块学习率         5E–5 (0.804)   8E–5 (0.809)  1E–4 (0.813)  2E–4 (0.804)  5E–4 (0.799)
                    匹配模块学习率         1E–5 (0.803)   3E–5 (0.808)  5E–5 (0.813)  8E–5 (0.805)  1E–4 (0.801)

                  4.5   鲁棒性实验 (RQ4)
                    除了最优条件外, 一个实用的匹配系统还必须能稳健应对各种现实世界中的运营挑战. 本节评估 TB-Match
                 在几种此类场景下的性能: 波动的市场动态              (需求高峰、司机短缺)、不均衡的资源分配              (地理失衡)、数据质量问
                 题  (稀疏性、输入噪声) 以及可扩展性需求. 除非另有说明, 所有实验均在 RS 数据集上进行, 并将性能与关键基线
                 方法进行比较.
                  4.5.1    市场波动下的韧性
                    现实世界的物流平台经常经历不可预测的供需变化. 我们模拟了两种常见场景. 1) 需求高峰: 运单量比平均水
                 平增加 50%, 测试系统处理需求突然激增的能力. 2) 运力短缺: 可用运力数量减少 30%, 评估在运力供给受限情况
                 下的性能.
                    后文表 5   总结了各种方法的性能保持情况. 性能保持率定义为挑战条件下指标值除以正常条件下指标值, 以
                 百分比表示. 例如, 87.5% MR 表示模型保留了其原始匹配率的              87.5%. 最优保持率以粗体标出.
                    在需求高峰下, TB-Match 保持了其原始匹配率 (MR) 的 87.5%, 优于次优基线 MAPT (83.2%). 同时             TB-Match
                 也最有效地保持了司机满意度 (DS) (92.1% 的保持率). 这表明即使在需求很高的情况下, 它也能有效地分配运力.
   155   156   157   158   159   160   161   162   163   164   165