Page 158 - 《软件学报》2026年第5期
P. 158
廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法 2037
联 Transformer 架构来捕捉时序与协同依赖关系, 从而训练出能更契合用户偏好的智能体奖励函数.
4.1.3 评估指标
为反映各方法在实际物流运单分配场景下的综合表现, 本文使用如下评估指标.
● 匹配率 (MR): 在评估周期 T 内成功匹配的运单占总运单数的比例, 即:
|{(o,d) ∈ M T : I(accepted(o,d)) = 1}|
MR = ,
|O|
其中, M T 表示周期 T 内的分配方案集合, I(accepted(o,d)) 为指示函数, 当司机 d 接受运单 o 时为 1, 否则为 0. 该
指标直接反映平台运力资源的利用效率.
● 司机满意度 (DS): 量化已分配运单与司机偏好的契合度, 其定义为所有成功匹配运单的平均接受概率:
1 ∑
DS = P accept (o,d)·I(accepted(o,d)),
|{(o,d) ∈ M T : I(accepted(o,d)) = 1}|
(o,d)∈M T
其中, P accept (o,d) 为司机 d 对运单 o 的接受概率 (由公式 (7) 计算得出). 该指标反映算法在追求整体效率的同时对
司机个人偏好的兼顾程度.
4.1.4 实现细节
我们将每个数据集按照时间顺序划分为训练集 (占前 75% 的数据) 与测试集 (占后 25% 的数据). 在模型架构
方面, 偏好表示模块中的条件扩散模型包含 4 个残差块, 隐藏维度为 256. 分层匹配决策框架中的高层与低层策略
网络均采用包含 6 层、8 个注意力头、隐藏维度为 512 的 Transformer 编码器结构. 对于训练超参数, 我们为所有
网络均采用 Adam 优化器, 其中偏好表示模块的学习率设为 1×10 , 匹配决策模块的学习率设为 5×10 , 批大小
−4
−5
(batch size) 统一为 256. 强化学习部分采用近端策略优化 (PPO) 算法进行训练, 其折扣因子 γ 为 0.95, 广义优势估
计 (GAE) 的 λ 参数为 0.95, PPO 的裁剪范围 ϵ clip 为 0.2, 并设置熵正则化系数为 0.01 以鼓励探索. 在高层策略网络
,
的奖励函数中, 各项目权重设置为: λ rate = 1.0 λ sat = 0.8 λ rej = 1.5. 所有对比基线模型的参数均按照其原始论文或官
,
方实现进行设置, 以确保公平比较. 具体而言, 遗传算法 (GA) 设置种群规模为 100, 交叉概率为 0.8, 变异概率为
0.1, 迭代次数为 500 代; TPTA 模型中的时间衰减因子 α 设为 0.1, 邻域大小 k 设为 20, 学习率为 1×10 ; FUPTA 采
−3
用 3 层图卷积网络, 隐藏维度为 128, dropout 率为 0.2, 学习率为 5×10 ; MAPT 方法使用 PPO 算法训练多智能体
−4
5×10 , 折扣因子为 0.99, 经验回放缓冲区大小为 10 000. 所有深度学习基线均采用相同的数据预处
−4
系统, 学习率为
理流程. 对于缺乏内置偏好感知机制的传统分配算法, 则采用本文提出的司机偏好建模方法来获取偏好信息.
4.2 总体性能对比 (RQ1)
表 1 展示了我们提出的 TB-Match 模型与 6 种基线方法在 RS 数据集和 DT-CARGO 数据集上的总体性能比
较. 实验从匹配率 (MR) 和司机满意度 (DS) 两个维度上评估了各方法的性能表现. 结果如表 1 所示. 最佳结果以粗
体突出显示.
表 1 在两个数据集上的总体性能比较
RS数据集 DT-CARGO数据集
方法
MR DS MR DS
GM 0.582 0.651 0.663 0.612
HA 0.615 0.704 0.692 0.685
GA [28] 0.643 0.732 0.721 0.713
TPTA [3] 0.661 0.768 0.739 0.742
FUPTA [29] 0.675 0.785 0.752 0.764
MAPT [11] 0.691 0.812 0.760 0.793
TB-Match 0.813 0.857 0.845 0.836
从匹配率指标来看, TB-Match 在 RS 数据集上实现了 0.813 的匹配率, 与最佳基线模型 MAPT 的 0.691 相比,
提升了 17.66%, 这表明我们的模型能够更有效地利用可用运力资源, 减少运单积压. 在 DT-CARGO 数据集上, TB-

