Page 155 - 《软件学报》2026年第5期
P. 155
2034 软件学报 2026 年第 37 卷第 5 期
s 均由神经网络参数化, 并通过
)
(
H
H
H
● 策略与价值函数: 高层网络的策略 π ω t |s 和价值函数 V H ( ) PPO 算法进
t t
行优化.
3.2.2 低层执行网络: 权重引导的运单分配策略
低层匹配执行网络负责在接收到高层策略网络输出的平衡因子 ω t 后, 生成具体的司机与运单的分配策略.
L
● 状态 (state s ): 低层网络在每个匹配决策时刻 t (通常对应一个更细的时间粒度或一个分配批次) 观测的状
t
( )
L
态 s 包含当前待决策的微观环境信息: L ,ω t . 其中, D curr 表示当前时间窗口内所
t
t s = D curr ,O curr ,{S(d,o)} ∀d∈D curr ,o∈O curr
有可用司机的集合, 包含其各自的实时位置、能力、历史行为等特征; O curr 表示当前待分配的运单集合, 包含其
各自的起讫点、货物类型、时间窗口等特征; {S(d,o)} 为前文司机偏好模块输出的每个可用司机 d 对每个待分配
运单 o 的偏好评分 (即接单概率 P accept (o,d)); ω t 表示由高层策略网络传递的当前平衡因子. 这些信息都通过一个
L
Transformer 编码器转化为低层状态表征 s .
t
L
L
L
● 动作 (action a ): 基于状态表征 , 智能体输出一个动作 a = M t , 其中 M t = {(o,d),...} 是一组具体的司机-
s
t t t
运单匹配对. 该匹配决策需满足基本约束, 如一个运单仅能分配给一个司机, 一个司机在同一时段内通常只承接一
(
)
L
个运单. PPO 算法通过计算策略 π M t |s 来生成这些匹配决策.
L
t
L
● 奖励 (reward R ): 低层网络的奖励 R 用于评估当前批次匹配决策 a = M t 的质量, 并直接受到高层传递的
L
L
t
t
t
平衡因子 ω t 的影响. 对于每一个最终被司机接受的成功匹配 (o,d) ∈ M t , 其对低层奖励的贡献 r (o,d|ω t ) 定义为:
L
t
L
r (o,d|ω t ) = ω t ·I(accepted(o,d))+(1−ω t )·S(d,o)·I(accepted(o,d)) (9)
t
其中, I(accepted(o,d)) 是指示函数, 当司机 d 最终接受运单 o 时为 1, 否则为 0. S(d,o) 是司机 d 对运单 o 的偏好
∑
L
评分. 则低层网络在当前批次的总奖励为所有成功匹配贡献之和: R = r (o,d|ω t ) 低层网络的目标是学习一
L
t
t
(o,d)∈M t
L
个策略 π 来最大化该累积奖励.
( )
)
(
L
L
L
L
● 策略与价值函数: 低层网络的策略 π M t |s 和价值函数 V s 同样由神经网络参数化, 并通过 PPO 算法
t t
进行优化.
3.2.3 分层网络协同训练机制
为确保高层策略网络与低层匹配执行网络能够有效协作, 我们为两个网络的训练设计了一种协同训练的方
法. 在每个训练 epoch 中, 首先固定低层网络参数, 使用高层网络收集的经验数据更新高层策略; 然后固定高层网
络参数, 基于高层输出的权重指导更新低层策略. 这种交替训练策略避免了两个网络同时更新可能导致的训练不
稳定问题. 此外, 引入经验回放机制, 高层和低层网络分别维护独立的经验池 (容量分别为 10 000 和 50 000), 通过
随机采样历史经验进行离线策略更新, 提高样本利用效率并增强训练稳定性.
具体而言, 训练过程采用迭代方式进行. 在每个训练迭代 (episode) 中, 有如下步骤.
H
● Step 1. 高层策略网络根据当前高层状态 s (经其状态编码器处理) 选择一个平衡因子 a = ω t .
H
t
t
L
● Step 2. 该平衡因子 ω t 被传递给低层匹配执行网络, 并作为其状态 的一部分.
s
t
)
(
● Step 3. 低层网络依据其当前策略 π a |s 生成具体的匹配决策 a = M t .
L
L
L
L
t
t
t
● Step 4. 仿真环境或真实系统执行匹配决策后, 反馈该批次匹配的即时结果, 包括每个匹配对 (o,d) 是否被司
机接受以及司机对该运单的偏好评分 S(d,o).
∑
● Step 5. 根据公式 (9) 计算低层网络的奖励 R = r (o,d|ω t ), 并用于更新低层网络的策略 π 和价值函数
L
L
L
t t
L
V 的参数.
● Step 6. 在低层网络完成一批次任务 (或一个完整的高层决策周期) 后, 系统计算该周期的整体性能指标, 如
实际匹配率、平均司机满意度及拒单率.
H
H
H
● Step 7. 根据公式 (8) 计算高层策略网络的奖励 R , 并用于更新高层网络的策略 π 和价值函数 V 的参数.
t
( ) ( )
H
H
H
L
L
L
整个过程产生的经验数据 s ,a ,R , s H 和 s ,a ,R , s L 将分别存入各自的经验回放池中, 用于 PPO 算法
t t t t+1 t t t t+1
的后续离线策略更新.

