Page 150 - 《软件学报》2026年第5期
P. 150
廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法 2029
在一些问题使其无法直接应用于运单分配场景. 一是这些方法主要针对离线优化场景, 对于运单分配这种实时决
策环境仍面临状态空间爆炸问题, 无法满足在线分配的要求; 二是这些方法采用静态优化范式, 忽略了当前分配决
策对司机状态 (如位置分布和满意度水平) 演变过程的影响, 从而可能引发长期分配性能的下降 [9,10,16] . 针对静态优
化问题, 部分研究引入了强化学习技术来建模时序决策过程, 兼顾决策的长期收益, 但仍存在奖励函数难以设计的
问题. 具体而言, 单一智能体的复合奖励函数会因量纲差异导致梯度失衡, 而多智能体方案又因策略冲突引发收敛
难题 [11] . 近年来, 多目标强化学习 (MORL) 作为处理多目标优化问题的新兴范式, 在网约车任务分配等领域已被
应用. 现有 MORL 方法主要分为两类: 基于帕累托前沿的方法 (如 multi-policy actor-critic (MPAC)) 通过维护多个
策略网络同时学习帕累托最优解集, 能够在不预设权重的情况下探索目标间的权衡关系 [24] ; 基于标量化函数的方
法则通过动态调整目标权重将多目标问题转化为单目标优化, 在保持计算效率的同时适应环境变化 [25] . 然而, 这
些方法在运单分配场景中并不能直接应用. 具体而言, 帕累托方法虽能生成多样化解集, 但其计算复杂度随目标数
量指数增长, 难以在运单分配的复杂场景中应用; 标量化方法虽然计算高效, 但其权重调整策略多基于启发式规
则, 其调整策略在运单分配场景中难以确定.
针对上述方法在动态适应性 (加权和法)、计算效率与长期最优 (帕累托优化) 以及可学习性 (强化学习) 的问题,
在本文中我们使用分层强化学习来解决这些问题, 通过将多目标权衡决策与具体分配执行分离到不同层次, 高层智
能体专注于根据系统状态动态调整目标权重, 低层智能体则在给定权重下执行具体的分配决策, 这种分层结构既避
免了复合奖励函数设计的困难, 又避免了多智能体方法的目标冲突, 同时通过分层分解方法有效降低了计算开销.
2 问题定义
本节对运单分配问题进行形式化定义, 其核心在于建立融合时间约束弹性量化、司机偏好建模和多目标动态
权衡的智能分配决策框架.
定义 1. 运单. 给定物流运输平台, 运单 o 被形式化定义为六元组: o = ⟨loc pick ,loc del ,t start ,t end ,t ,cargo_type⟩, 其
late
load load del
[ ]
2
中, loc pick , loc del ∈ R 分别表示装货地与卸货地的地理坐标, t start ,t end 构成装货时间窗口, 表示司机可以在这个时间
load load
|O|
段内接货, t late 为合同约定的最晚送达时间, cargo_type 表示待运输货物类别. O = o k k=1 , 其中 |O| 表示在某个时间
del
段内需要分配的运单集合.
定义 2. 司机. 平台上参与运单分配的司机被定义为司机, 被形式化定义为三元组: d=⟨loc curr ,P d ,C d ⟩, 其中, loc curr ∈ R 2
表示司机所属货车当前 GPS 坐标, P d ⊆ R ×R 为司机偏好的运输线路集合 (装货地-卸货地对), C d 表示该司机可承
2
2
|D|
运的货物类型集合, 平台可用资源构成有限集合 D = d j , 其中 |D| 为当前在线可调度车辆数.
定义 3. 时间约束. 时间约束是指运输过程需要遵守的时间规定, 其形式被定义为四元组: T o,d = ⟨t start ,t end ,
load load
[ ]
late
t ,t d ⟩, 其中, 装货时间窗口 t start ,t end 为闭区间, 表示司机需要在此期间至装货地进行接货; 最晚送达时间 t late 构成
del return load load del
硬约束, 表示货物必须在此时间点前送达目的地; 返程时间 t d return 为可选约束, 即司机需要在特定时间前返回原地点.
基于上述定义, 挑战 1 可形式化为时间约束弹性的建模问题. 我们将司机的接单决策分解为两个步骤: 先评估
任务可行性 (货物兼容性与时间约束满足度), 再判断司机的偏好.
定义 4. 运单接受概率. 我们定义运单接受概率 P accept (o,d) 为司机 d 接受运单 o 的条件概率. 该概率通过分析
司机 d 的历史承运记录 H d = {(o 1 ,a 1 ),(o 2 ,a 2 ),...,(o n ,a n )}, 其中 是历史上分配给司机 d 的运单, a i ∈ {0,1} 表示司
o i
机是否接受该运单. 形式化地, 我们将司机 d 接受运单 o 的总概率 P accept (o,d) 定义为两个独立概率的乘积:
P accept (o,d) = P feasible (o,d)×P pref (o,d) (1)
其中, P feasible (o,d) 表示可行性概率, 它首先表明司机 d 的货车是否能够运输运单 o 中的货物, 同时在给定的时间约
束 ( T o ,t d ) 下, 能够按时完成运单 o 的可能性, 该概率由第 3.1 节的模型计算得到. P pref (o,d) 表示司机的偏好概
return
率, 它表示在任务时间可行的前提下, 司机 d 的主观偏好 (如目的地、运输时间等) 上愿意接受运单 o 的可能性.
该概率主要通过第 3.2 节的模型分析司机的历史选择记录 H d 计算得出.
定义 S(d) 定义为其接受运单的平均接受概率:
5. 司机满意度. 司机在周期 T 内的满意度

