Page 151 - 《软件学报》2026年第5期
P. 151
2030 软件学报 2026 年第 37 卷第 5 期
1 ∑
S(d) = P accept (o,d) (2)
T
A
d o∈A T
d
T
其中, A ⊆ O 表示 T 周期内司机实际接受的运单集合. 该度量反映司机获得偏好匹配运单的期望程度.
d
问题陈述 (problem statement): 给定运单集合 O 和货车集合 D, 以及它们的属性和司机的历史行为数据, 目标
是找到一个随时间动态调整的匹配策略 π, 该策略生成一系列匹配决策 M t (在时间窗口 t 内的分配方案), 以最大
化长期累积的成功匹配数量, 同时考虑并提升司机对所接受运单的满意度. 形式化地, 目标是优化
∑ ∑ ∑
t
max E γ λ I(accepted(o,d))+(1−λ) P accept (o,d) (3)
π
t (o,d)∈M t (o,d)∈M t
o γ ∈ (0,1] 为时间折扣因子. 参
其中, I(accepted(o,d)) 是指示函数, 表示司机 d 是否最终接受了分配给他的运单 .
数 λ ∈ [0,1] 用于平衡两个优化目标.
∑
● 最大化成功匹配: 即 λ I(accepted(o,d)), 最大化实际接受的运单.
(o,d)∈M t
∑
● 最大化司机满意度: 即 (1−λ) P accept (o,d), 该目标旨在提升分配方案的采纳率, 通过模型预测, 优先推荐
(o,d)∈M t
司机更可能接受的选项.
整个运单分配问题中既需要最大化成功匹配数量, 又要提升司机整体满意度. 为实现此目标, 我们需要分别构
建时间可行性概率 P feasible 和司机偏好概率 P pref 的模型, 并在此基础上设计出最优的匹配策略 π.
3 TB-Match 技术框架
为解决当前运单分配方法忽视时间约束弹性与司机偏好的问题, 本文提出了一种基于时间约束松弛优化理论
的物流运单分配优化方法 TB-Match, 如图 3 所示. 该框架包含 4 个核心模块: (1) 基于扩散模型的时间约束表征模
块, 该模块首先通过 Transformer 提取司机历史交互中的上下文特征, 然后利用条件去噪扩散概率模型 (CDDPM)
将刚性的时间约束边界转化为概率分布, 实现约束弹性的精确建模; (2) 基于序列注意力机制的司机偏好融合模
块, 该模块将生成的弹性时间偏好与运单特征和司机状态整合, 预测司机的接单概率; (3) 基于强化学习反馈的目
标权衡优化模块, 该模块通过高层策略网络, 根据司机拒单行为动态调整匹配效率与司机满意度两个优化目标的
相对权重; (4) 基于近端策略优化的匹配策略生成模块, 该模块在高层策略网络输出的权重指导下生成具体的司机-
运单匹配决策, 同时通过信任区域机制确保策略的稳定更新. 上述模块整合为时间约束特征捕捉模块 (第 3.1 节)
与分配策略生成模块 (第 3.2 节).
输入层 分配策略生成模块
时间约束特征捕捉模块 H
s t
~ π H
运单 <t d P d 匹配状态
Transformer Transformer 输出优化目标权重 高层智能体 Agent (PPO)
编码器 编码器
司机 ω gt 高层策略网络
动态目标权重调整
时间约束表征
L 迭代优化
π
低层匹配执行网络
s 0
低层智能体 Agent 基于权重引导的
条件扩散偏好 (PPO) 运单分配
表征模块 S(d, o)
a 0
Transformer
输出
s 1 条件扩散偏好 运单分配
a 1 决策方案 匹配率
表征模块
… 满意度
t (a t ) 拒单率
L
s T−1 条件扩散偏好 司机弹性约束
a T−1 偏好表征
表征模块
司机历史运单序列 匹配结果反馈
执行运单分配
图 3 TB-Match 技术框架示意图

