Page 148 - 《软件学报》2026年第5期
P. 148
廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法 2027
目标中的相对权重. 具体地, 在高拒单率情况下增加司机满意度的权重以提升接单意愿; 而在低拒单率情形下则侧
重于提高匹配率权重, 以优化整体分配效率. 此外, 为解决序列决策中的长期优化问题, 引入改进的近端策略优化
(PPO) 算法, 构建了跨时间窗口的价值评估网络. 该网络通过设计具有时间折扣因子的累积奖励函数, 实现了对当
前决策在未来多个时间窗口内影响的系统性评估. 算法采用裁剪策略梯度更新的技术手段, 通过约束策略更新的
最大幅度, 有效避免了优化过程中的策略振荡现象, 保证了训练过程的稳定性, 最终实现包括匹配率与司机满意度
在内的长期累积收益最大化.
待运运单 候选司机 待运运单 候选司机
运单 A 司机 X
运单 D 司机 W
方案 1 成功匹配数: 2 成功匹配数: 3
可运运单 最大化整体匹配率 拒单次数: 1 拒单次数: 2
待运运单 候选司机 运单 B 司机 Y
(偏好排序) 司机拒单
{A, C} 运单 C 司机拒单
运单 A 司机 Z 运单 C 司机 Z
司机 X
待运运单 候选司机 待运运单 候选司机
{D, A}
运单 A
运单 B 司机 X 运单 D 司机 W
司机 Y 方案 2 成功匹配数: 2 成功匹配数: 3
最大化司机满意度 拒单次数: 0 拒单次数: 0
{B, C, D}
运单 B
司机 Y 司机 Y
运单 C
司机 Z
运单 C 运单 C
司机 Z
通过向 T 1 时刻的
待运运单 候选司机 待运运单 候选司机 司机 X 分配次优
订单, 可提升整体
{A}
运单 D 司机 W 匹配成功率
(T 1 时刻可用) (T 1 时刻可用) 方案 3 运单 A 司机 X 成功匹配数: 2 运单 D 司机 W 成功匹配数: 4
权衡匹配率与 拒单次数: 0 拒单次数: 0
司机满意度
运单 B
司机 Y
司机 Y
运单 C
司机 Z 运单 A
T 0 T 1 T 2
图 2 匹配率与司机满意度冲突示意图
总的来说, 本研究提出了一种时间约束感知与平衡导向匹配框架 TB-Match (time-constrained balance matching),
该框架通过 4 个相互协同的技术创新实现了运单分配问题的系统性优化. 首先, 基于条件扩散模型的弹性时间约
束建模模块将刚性时间约束转化为动态弹性表征, 通过概率扩散技术构建了时间约束满足度的连续概率分布模型;
其次, 基于序列注意力机制的司机偏好表征模块通过整合历史运输记录、实时状态信息和弹性时间约束表征, 利
用多头注意力机制有效捕捉特征间的非线性关联, 实现对司机接单行为的精准预测; 第三, 基于强化学习反馈的目
标权衡优化模块建立了以拒单行为为反馈信号的动态调节机制, 通过在线学习算法自适应调整匹配率与满意度的
权重分配; 最后, 基于近端策略优化的匹配策略生成模块构建跨时间窗口价值评估网络, 利用信任区域机制调整运
单分配策略, 实现匹配率与满意度的长期累积收益最大化. 本研究的创新性贡献主要体现在以下 4 个方面.
1) 为提高网络货运平台的运单匹配率与司机满意度, 提出了一个时间约束偏好感知的运单分配框架, 称为 TB-
Match, 由时间约束弹性量化、司机偏好表征、目标权衡与匹配策略生成等模块组成.
2) 针对将时间约束视为硬性边界的分配决策局限性, 设计了一种基于条件扩散模型的时间约束表征模型. 通
过概率扩散机制将刚性时间约束评估 (即仅判断能否完成) 转化为考虑个体差异的连续概率评估 (即对于完成概
率的量化估计), 扩展了可匹配范围.
3) 为解决匹配率与司机满意度之间的目标冲突问题, 提出了一种融合动态目标权衡机制与近端策略优化的分
配策略生成模型. 该模型利用拒单行为作为反馈信号, 通过强化学习动态调节匹配率与满意度的权重, 并通过近端
策略优化算法优化分配决策的长期影响, 实现全局最优的运单分配策略.
4) 基于两个真实物流数据集的实验结果表明, TB-Match 框架在运单分配性能上显著优于现有最优方法. 在日
均货运量达 30 000 吨、运力规模为 1 200 辆货车的实际运营场景下, TB-Match 实现了 17.66% 的成功匹配率提

