Page 158 - 《软件学报》2026年第5期
P. 158

廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法                                   2037


                 联  Transformer 架构来捕捉时序与协同依赖关系, 从而训练出能更契合用户偏好的智能体奖励函数.
                  4.1.3    评估指标
                    为反映各方法在实际物流运单分配场景下的综合表现, 本文使用如下评估指标.
                    ● 匹配率 (MR): 在评估周期     T  内成功匹配的运单占总运单数的比例, 即:

                                                 |{(o,d) ∈ M T : I(accepted(o,d)) = 1}|
                                            MR =                            ,
                                                             |O|
                 其中,  M T  表示周期  T  内的分配方案集合,    I(accepted(o,d)) 为指示函数, 当司机  d  接受运单  o  时为  1, 否则为  0. 该
                 指标直接反映平台运力资源的利用效率.
                    ● 司机满意度 (DS): 量化已分配运单与司机偏好的契合度, 其定义为所有成功匹配运单的平均接受概率:

                                                 1              ∑
                               DS =                                 P accept (o,d)·I(accepted(o,d)),
                                    |{(o,d) ∈ M T : I(accepted(o,d)) = 1}|
                                                               (o,d)∈M T
                 其中,  P accept (o,d) 为司机  d  对运单  o  的接受概率  (由公式  (7) 计算得出). 该指标反映算法在追求整体效率的同时对
                 司机个人偏好的兼顾程度.
                  4.1.4    实现细节
                    我们将每个数据集按照时间顺序划分为训练集                 (占前  75%  的数据) 与测试集    (占后  25%  的数据). 在模型架构
                 方面, 偏好表示模块中的条件扩散模型包含              4  个残差块, 隐藏维度为     256. 分层匹配决策框架中的高层与低层策略
                 网络均采用包含      6  层、8  个注意力头、隐藏维度为        512  的  Transformer 编码器结构. 对于训练超参数, 我们为所有
                 网络均采用    Adam  优化器, 其中偏好表示模块的学习率设为             1×10 , 匹配决策模块的学习率设为          5×10 , 批大小
                                                                    −4
                                                                                                −5
                 (batch size) 统一为  256. 强化学习部分采用近端策略优化       (PPO) 算法进行训练, 其折扣因子       γ 为  0.95, 广义优势估
                 计  (GAE) 的  λ 参数为  0.95, PPO  的裁剪范围  ϵ clip  为  0.2, 并设置熵正则化系数为  0.01  以鼓励探索. 在高层策略网络
                                                          ,
                 的奖励函数中, 各项目权重设置为:          λ rate = 1.0 λ sat = 0.8 λ rej = 1.5. 所有对比基线模型的参数均按照其原始论文或官
                                                   ,
                 方实现进行设置, 以确保公平比较. 具体而言, 遗传算法                (GA) 设置种群规模为     100, 交叉概率为    0.8, 变异概率为
                 0.1, 迭代次数为  500  代; TPTA  模型中的时间衰减因子     α 设为  0.1, 邻域大小  k 设为  20, 学习率为  1×10 ; FUPTA  采
                                                                                              −3
                 用  3  层图卷积网络, 隐藏维度为      128, dropout 率为  0.2, 学习率为  5×10 ; MAPT  方法使用  PPO  算法训练多智能体
                                                                      −4
                             5×10 , 折扣因子为   0.99, 经验回放缓冲区大小为      10 000. 所有深度学习基线均采用相同的数据预处
                                −4
                 系统, 学习率为
                 理流程. 对于缺乏内置偏好感知机制的传统分配算法, 则采用本文提出的司机偏好建模方法来获取偏好信息.
                  4.2   总体性能对比 (RQ1)
                    表  1 展示了我们提出的      TB-Match  模型与  6  种基线方法在   RS  数据集和  DT-CARGO  数据集上的总体性能比
                 较. 实验从匹配率     (MR) 和司机满意度    (DS) 两个维度上评估了各方法的性能表现. 结果如表               1  所示. 最佳结果以粗
                 体突出显示.

                                             表 1 在两个数据集上的总体性能比较

                                                  RS数据集                   DT-CARGO数据集
                               方法
                                              MR          DS            MR             DS
                                GM           0.582        0.651         0.663         0.612
                                HA           0.615        0.704         0.692         0.685
                               GA [28]       0.643        0.732         0.721         0.713
                              TPTA [3]       0.661        0.768         0.739         0.742
                              FUPTA [29]     0.675        0.785         0.752         0.764
                              MAPT [11]      0.691        0.812         0.760         0.793
                              TB-Match       0.813        0.857         0.845         0.836

                    从匹配率指标来看, TB-Match      在  RS  数据集上实现了    0.813  的匹配率, 与最佳基线模型      MAPT  的  0.691  相比,
                 提升了   17.66%, 这表明我们的模型能够更有效地利用可用运力资源, 减少运单积压. 在                    DT-CARGO  数据集上, TB-
   153   154   155   156   157   158   159   160   161   162   163