Page 154 - 《软件学报》2026年第5期
P. 154
廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法 2033
基于统计规律的平均预期逐步细化为包含个体特征和环境因素的具体时间偏好表征的推理过程, 使得模型能够为
每个具体的运输任务生成既合理又具有适当不确定性的弹性偏好预测.
3.1.2 偏好融合与接单概率预测
最后, 为了得到一个可用于决策的最终分数, 我们将扩散模型生成的弹性时间偏好 ˜ p 0 、订单的详细特征 e o
以及司机的实时状态 c curr 进行融合. 我们设计了一个基于注意力机制的融合网络 F attn 来实现这一目标, 它将这三
d
者作为序列输入, 通过多头自注意力机制捕捉它们之间的复杂交互, 最终输出一个单一的接单概率 S (d,o):
( ( ( ( ))))
S (d,o) = σ MLP λ attn Embed(˜ p 0 ),Embed(e o ),Embed c curr (7)
d
其中, σ(·) 是 Sigmoid 函数. 该模块的训练由标准的二元交叉熵损失 L S 监督, 其标签 y ∈ {0,1} 来自司机的历史
接单记录. 所得到的 S(d,o) 不仅量化了司机的接单意愿, 也作为其对该分配满意度的度量, 作为后续决策模块的
输入.
3.2 分配策略生成模块
在获取了司机的弹性时间约束偏好表征后, 接下来需要解决的核心问题是如何基于该表征实现运单的优化分
配. 在本节中我们将使用一个基于分层强化学习的决策框架来解决该问题. 具体而言, 该框架包含一个高层策略网
络和一个低层匹配执行网络, 两者均采用近端策略优化 (PPO) 算法进行训练. 高层网络负责在宏观层面动态调整
优化目标的权重 (即匹配效率与司机满意度之间的相对重要性), 而低层网络则在高层策略的指导下执行具体的运
单分配决策. 通过这两个网络的协同作用, 框架旨在学习一个能够最大化长期累积综合回报的分配策略, 该回报综
合考量了匹配效率与司机满意度两个优化目标.
3.2.1 高层策略网络: 多目标权重动态调整
高层策略网络旨在应对匹配率与司机满意度之间的权衡问题, 通过学习机制动态调整系统在不同时间窗口内
对这两个核心优化目标的侧重程度.
H
● 状态 (state s ): 高层网络在每个决策周期 t 开始时观测一个高层状态 s , 该状态全面表征了当前的整体匹
H
t
t
( )
H
配环境. 其构成如下: s = O total,t ,D avail,t , ¯ S avg,t−1 ,R reject,t−1 ,z VI,t . 其中, O total,t 表示当前时间窗口内待分配的运单总量;
t
D avail,t 表示当前可用的司机数量; ¯ S avg,t−1 : 表示上一周期内已匹配运单的平均司机满意度; R reject,t−1 表示上一周期内
的司机平均拒单率. z VI,t 表示由变分推断网络生成的对当前司机-订单潜在匹配质量的低维表征. 为有效从这些可
能蕴含复杂时空依赖的状态特征中提取信息, 高层策略网络采用一个基于时空注意力机制的状态编码器, 对输入
状态 s 进行深度特征提取, 生成更为稠密的状态表征 s .
H
H
t t
其中, 变分推断网络 z VI,t 由编码器网络 q ϕ (z|O total,t ,D avail,t ) 与解码器网络 p θ (O total,t ,D avail,t |z) 所组成, 其损失函
(
[
数结合了重构损失与 KL 散度正则化项: L VI = E q ϕ (z|x) logp θ x|z)]−β· KL(q ϕ (z|x)||p(z)), 其中 β = 0.1 为 KL 权重,
p(z) = N(0,I) 为标准正态先验. 该网络通过学习运单-司机匹配空间的潜在结构, 为高层策略网络提供当前匹配环
境的稠密表征 s .
H
t
H
H
H
● 动作 (action a ): 基于状态表征 s , 智能体输出一个动作 a = ω t , 其中 ω t ∈ [0,1] 是一个动态调整的平衡因
t t t
子. 该因子 ω t 用于决定在当前决策周期内, 低层匹配执行网络在优化其奖励时, 应给予“最大化匹配数量”和“最大
化司机满意度”这两个目标的相对权重. 例如, ω t 趋近于 1 时, 侧重于提升匹配数量; ω t 趋近于 0 时, 则更侧重于司
机满意度.
H
H
● 奖励 (reward R ): 高层策略网络的奖励 R 在低层网络根据其指导参数 ω t 完成一个批次的运单分配任务
t t
之后进行更新, 直接反映了所选平衡因子 ω t 在该周期内的实际效果. 其形式化定义如下:
H
R = λ rate · MR t +λ sat ·DS t −λ rej ·RR t (8)
t
其中, MR t 是当前批次实际达成的匹配率, DS t 是该批次所有成功匹配运单的平均司机满意度 (基于 S(d,o) 计算),
RR t 是该批次的司机拒单率. λ rate 、λ sat 、λ rej 是预设的超参数, 用以调整各组成部分对整体奖励的贡献. 此奖励设计
使司机拒单行为作为一种负向反馈, 直接影响高层策略的优化方向.

