Page 161 - 《软件学报》2026年第5期
P. 161

2040                                                       软件学报  2026  年第  37  卷第  5  期


                    在司机短缺的情况下, TB-Match 也表现出了优秀的鲁棒性, 保持了 83.2% 的 MR, 而 MAPT 为 79.5%. 同时司
                 机满意度的保持率为        89.3%, 这表明 TB-Match 即使在司机较少的情况下也能更好地利用可用司机运力并维持服
                 务水平. 基于 PPO 的长期价值估计可能有助于在资源受限的环境中做出更具战略性的分配.
                  4.5.2    运单分布失衡下的性能
                    物流需求通常在空间上是倾斜的. 我们通过将 70% 的运单集中在 30% 的区域, 而司机最初分布更均匀的方
                 式模拟了运单分布失衡. 表         6 显示了 MR 的性能保持率以及空间均衡性 (SB, 一种基于基尼系数的指标, 越低越
                 好, 此处采用得分     1−Gini 的保持率) 和长期稳定性 (LTS, 即      MR 随时间变化的方差) 的绝对值. 最佳保持率以粗
                 体标出.

                           表 5 市场波动鲁棒性       (%)                       表 6 运单分布失衡鲁棒性        (%)

                          需求高峰 (+50%运单)    司机短缺 (–30%司机)         方法    MR 保持率   SB (1–Gini) 保持率  LTS 保持率
                   方法
                         MR保持率    DS保持率   MR保持率 DS保持率            GM       71.2        58.3        63.5
                   GM      68.3     73.2     65.7    71.8        HA       74.8        62.1        67.2
                   HA      72.1     78.5     69.4    75.3        GA       77.5        65.7        70.8
                   GA      75.6     81.7     72.8    78.9       TPTA      80.2        68.4        73.5
                   TPTA    78.3     84.2     75.1    81.4       FUPTA     82.7        71.2        76.1
                  FUPTA    80.7     86.5     77.3    83.8       MAPT      84.9        73.8        78.4
                  MAPT     83.2     88.9     79.5    85.7      TB-Match   88.3        78.5        82.7
                 TB-Match  87.5     92.1     83.2    89.3

                    在运单分布失衡条件下, TB-Match 保持了 88.3% 的 MR, 显著优于 MAPT (84.9%). 更重要的是, 它保留了 78.5%
                 的空间均衡性得分和 82.7% 的长期稳定性, 表明其在管理不均匀分布和引导司机前往需求热点而不过度空驶方面
                 的有效性, 这可能得益于时空注意力协调机制和 PPO 智能体学到的长期价值.
                  4.5.3    数据稀疏性的影响 (冷启动司机)
                    新司机通常历史数据有限, 构成冷启动挑战. 我们通过将随机选定的司机子集                          (占总司机数量的 10%、20%
                 和 30%) 的历史交互数据减少 75% 来模拟这种情况. 表           7 显示了 MR 相对于全数据性能的绝对下降百分点.

                                               表 7 新司机数量占比鲁棒性          (%)

                                方法             10% 新司机           20% 新司机           30% 新司机
                                TPTA              −1.8             −3.5              −5.5
                               FUPTA              −1.6             −3.2              −5.1
                                MAPT              −1.4             −2.9              −4.6
                               TB-Match           −0.9             −1.8              −2.9

                    TB-Match 对数据稀疏的情况仍具有一定的韧性. 当 30% 的司机为新司机时, TB-Match 的 MR 仅下降了 2.9
                 个百分点, 而 MAPT 的 MR 下降了 4.6 个百分点. 这种鲁棒性源于: (1) 扩散模型能够学习时间约束偏好的普适模
                 式, 这些模式不仅依赖于个体司机数据; (2) PPO           框架能够从可用的聚合数据中学习更广泛的市场动态和司机原
                 型, 然后将其应用于冷启动司机. 序列注意力机制虽然受益于丰富的历史数据, 但仍可以利用新司机的通用特征.
                  4.5.4    系统规模的可扩展性
                    为了评估系统规模可扩展性, 我们在规模不断增加的合成数据集上测试了 TB-Match, 其数据模拟自 RS 数据
                 集  (运单数从 5 万到 50 万, 司机数量按比例缩放). 我们测量了每批次的平均计算消耗时间和 MR.
                    表  8  表示不同数据集规模下的平均每批次决策时间与匹配率 (MR), 其最佳结果以粗体标出. 由结果可见, TB-
                 Match 具有良好的可扩展性. 其每批次决策时间随数据集规模呈次线性增长, 这归因于其神经网络组件中的高效
                 批处理以及 PPO 智能体在每个状态下固定复杂度的策略评估. 虽然 MAPT 略快, 但 TB-Match 在所有规模上都保
                 持着显著更高的 MR. 例如, 在 50 万运单时, TB-Match 的 MR 为 91.2%, 计算消耗时间为           5 096 ms/批次, 而 MAPT
                 在 4 125 ms/批次下实现 87.5% 的 MR. 基于匈牙利算法的运单分配方法 (HA) 是一种组合方法, 表现出较差的时间
   156   157   158   159   160   161   162   163   164   165   166