Page 147 - 《软件学报》2026年第5期
P. 147
2026 软件学报 2026 年第 37 卷第 5 期
货地点的工作时间限制、最晚送达时间以及司机返程时间要求等多维约束条件. 这些约束限制了司机的可选运单
范围, 而现有算法通常基于平均运输时间进行匹配决策, 未能充分考虑司机在实际运输过程中对行驶时间和停留
时间的动态调整能力. 以图 1 所示情况为例, 当某运单的平均运输时间为 4 h 时, 传统算法可能判定司机无法满足
时间约束而放弃分配, 但经验丰富的司机往往能够通过优化路线、提高装卸效率等方式缩短实际运输时间. 尽管
时间约束在形式上表现为硬性边界, 但其实际执行具有弹性特征, 因此简单的二元判断 (能否完成) 应转变为概率
化评估 (完成的可能性). 这种转变更符合现实场景中司机的行为特征, 有助于扩大可匹配运单池并提高接单率. 基
于此, 本文需要解决的第 1 个挑战是如何从历史数据中构建时间约束的松弛模型, 以准确刻画司机在不同约束条
件下的接单概率分布.
运单 W 需在 18:00 前送达
基于概率的时间约束松弛
是否应该分配给司机 A?
司机 A 完成运单
基于历史平均时间的硬性判断 W 时间预估
司机 A 完 运单 W 可
成运单 W 完成时间预估 能面临运
通常需要
4 h 力不足
他很可能 需要扩充
超时 运力候选 优化运输线路
4 h 集
不予分配 压缩停留时间
图 1 时间约束松弛示意图
挑战 2: 运单分配算法在匹配率与司机满意度之间存在目标冲突. 在运单分配过程中, 当多位司机对同一时空
范围内的运单表现出相似偏好时, 现有算法通常优先考虑匹配率最大化, 例如通过对前序时段内未被成功分配的
运单进行重新分配或基于需求预测模型为后续时段即将到达的车辆预先保留合适的运单. 然而, 这种做法往往以
牺牲司机满意度为代价, 进而可能触发司机拒单行为的发生 (如图 2 方案 1 所示). 相反地, 若仅以司机满意度为优
化目标, 则可能降低整体匹配率 (如图 2 方案 2 所示). 虽然已有研究尝试通过引入加权机制来寻求二者间的平衡,
但预设的静态权重系数难以适应物流场景中供需关系与司机偏好的动态演化特征, 同时, 未能充分考虑运单分配
问题特有的序列决策属性——即当前决策时段的分配方案会通过改变系统状态 (如车辆位置、车辆载货状态等)
而影响后续决策时段的匹配效果. 这种时序关联性使得传统的帕累托最优分析方法 (主要适用于静态决策环境)
在评估全局优化效果时表现出明显的局限性. 如图 2 方案 3 所示, 当在 T 1 决策时段进行运单分配时, 若算法能够
考虑当前决策对 T 2 时段匹配效果的潜在影响, 并策略性地为司机 X 分配次优而非即时最优的运单, 尽管这种决策
在局部时间窗口内可能偏离瞬时最优解, 但从全局视角来看, 却能有效提升累计成功匹配数量, 同时降低总体拒单
率. 因此, 本文需要解决的第 2 个挑战是如何在动态供需环境下通过考虑分配决策的时序关联性实现匹配率与司
机满意度的有效权衡.
针对运输时间约束对司机接单概率的负面影响问题, 本文设计了一种基于扩散模型的时间约束表征模型. 该
方法突破了传统确定性时间约束的建模局限, 通过引入渐进式噪声注入与去除的逆向学习过程, 实现了对复杂时
间约束分布的准确建模. 我们将其拓展到运输时间约束的表征过程, 通过将各个时间约束边界进行概率化处理, 将
原本离散且确定性的时间约束区间转化为一个连续的概率分布空间, 从而为每个相关时间点赋予具体的接受概率
值. 这一策略允许模型更准确地捕捉司机在时间约束临界点附近的接单倾向, 有效扩大了潜在的有效匹配范围. 针
对挑战 2 所涉及的多目标优化问题, 本文提出了一种融合动态目标权衡与近端策略优化的分配策略生成模型, 旨
在解决匹配率与司机满意度之间的冲突. 其中, 动态目标权衡模块利用强化学习反馈机制设计了以拒单率作为负
向惩罚项的奖励函数, 用以评估当前分配策略的表现, 并根据实时拒单情况动态调整匹配率与司机满意度在优化

