Page 155 - 《软件学报》2026年第5期
P. 155

2034                                                       软件学报  2026  年第  37  卷第  5  期


                                                                     s  均由神经网络参数化, 并通过
                                                       )
                                                   (
                                                                      H
                                                  H
                                                      H
                    ● 策略与价值函数: 高层网络的策略           π ω t |s  和价值函数  V  H  ( )                    PPO  算法进
                                                      t               t
                 行优化.
                  3.2.2    低层执行网络: 权重引导的运单分配策略
                    低层匹配执行网络负责在接收到高层策略网络输出的平衡因子                      ω t  后, 生成具体的司机与运单的分配策略.
                               L
                    ● 状态 (state  s ): 低层网络在每个匹配决策时刻       t (通常对应一个更细的时间粒度或一个分配批次) 观测的状
                               t
                                                   (                        )
                    L
                 态  s  包含当前待决策的微观环境信息:          L                         ,ω t . 其中,  D curr  表示当前时间窗口内所
                                                t
                    t                           s = D curr ,O curr ,{S(d,o)} ∀d∈D curr ,o∈O curr
                 有可用司机的集合, 包含其各自的实时位置、能力、历史行为等特征;                       O curr  表示当前待分配的运单集合, 包含其
                 各自的起讫点、货物类型、时间窗口等特征;               {S(d,o)} 为前文司机偏好模块输出的每个可用司机             d 对每个待分配
                 运单  o 的偏好评分    (即接单概率    P accept (o,d));  ω t  表示由高层策略网络传递的当前平衡因子. 这些信息都通过一个
                                                 L
                 Transformer 编码器转化为低层状态表征       s .
                                                 t
                                                                  L
                                L
                                               L
                    ● 动作 (action  a ): 基于状态表征  , 智能体输出一个动作       a = M t , 其中  M t = {(o,d),...} 是一组具体的司机-
                                              s
                                t              t                  t
                 运单匹配对. 该匹配决策需满足基本约束, 如一个运单仅能分配给一个司机, 一个司机在同一时段内通常只承接一
                                            (
                                                 )
                                                L
                 个运单. PPO  算法通过计算策略       π M t |s  来生成这些匹配决策.
                                           L
                                                t
                                 L
                    ● 奖励 (reward  R ): 低层网络的奖励   R  用于评估当前批次匹配决策         a = M t  的质量, 并直接受到高层传递的
                                                  L
                                                                          L
                                                  t
                                 t
                                                                          t
                 平衡因子   ω t  的影响. 对于每一个最终被司机接受的成功匹配             (o,d) ∈ M t , 其对低层奖励的贡献   r (o,d|ω t ) 定义为:
                                                                                           L
                                                                                           t

                                    L
                                   r (o,d|ω t ) = ω t ·I(accepted(o,d))+(1−ω t )·S(d,o)·I(accepted(o,d))  (9)
                                    t
                 其中,  I(accepted(o,d)) 是指示函数, 当司机  d 最终接受运单    o 时为  1, 否则为  0.  S(d,o) 是司机  d 对运单  o 的偏好
                                                                         ∑
                                                                             L
                 评分. 则低层网络在当前批次的总奖励为所有成功匹配贡献之和:                     R =     r (o,d|ω t )  低层网络的目标是学习一
                                                                     L
                                                                     t
                                                                             t
                                                                        (o,d)∈M t
                        L
                 个策略   π  来最大化该累积奖励.
                                                                     ( )
                                                        )
                                                   (
                                                                      L
                                                  L
                                                       L
                                                                    L
                    ● 策略与价值函数: 低层网络的策略           π M t |s  和价值函数   V s  同样由神经网络参数化, 并通过          PPO  算法
                                                       t              t
                 进行优化.
                  3.2.3    分层网络协同训练机制
                    为确保高层策略网络与低层匹配执行网络能够有效协作, 我们为两个网络的训练设计了一种协同训练的方
                 法. 在每个训练    epoch  中, 首先固定低层网络参数, 使用高层网络收集的经验数据更新高层策略; 然后固定高层网
                 络参数, 基于高层输出的权重指导更新低层策略. 这种交替训练策略避免了两个网络同时更新可能导致的训练不
                 稳定问题. 此外, 引入经验回放机制, 高层和低层网络分别维护独立的经验池                      (容量分别为    10 000  和  50 000), 通过
                 随机采样历史经验进行离线策略更新, 提高样本利用效率并增强训练稳定性.
                    具体而言, 训练过程采用迭代方式进行. 在每个训练迭代                 (episode) 中, 有如下步骤.
                                                      H
                    ● Step 1. 高层策略网络根据当前高层状态         s  (经其状态编码器处理) 选择一个平衡因子            a = ω t .
                                                                                         H
                                                                                         t
                                                      t
                                                                          L
                    ● Step 2. 该平衡因子  ω t  被传递给低层匹配执行网络, 并作为其状态   的一部分.
                                                                         s
                                                                          t
                                                      )
                                                  (
                    ● Step 3. 低层网络依据其当前策略       π a |s  生成具体的匹配决策       a = M t .
                                                                        L
                                                 L
                                                     L
                                                   L
                                                   t
                                                     t
                                                                        t
                    ● Step 4. 仿真环境或真实系统执行匹配决策后, 反馈该批次匹配的即时结果, 包括每个匹配对                        (o,d) 是否被司
                 机接受以及司机对该运单的偏好评分             S(d,o).
                                                           ∑
                    ● Step 5. 根据公式  (9) 计算低层网络的奖励       R =   r (o,d|ω t ), 并用于更新低层网络的策略     π  和价值函数
                                                               L
                                                                                              L
                                                         L
                                                         t     t
                  L
                 V  的参数.
                    ● Step 6. 在低层网络完成一批次任务        (或一个完整的高层决策周期) 后, 系统计算该周期的整体性能指标, 如
                 实际匹配率、平均司机满意度及拒单率.
                                                                                                H
                                                           H
                                                                                    H
                    ● Step 7. 根据公式 (8) 计算高层策略网络的奖励        R , 并用于更新高层网络的策略         π  和价值函数    V  的参数.
                                                           t
                                         (          )  (         )
                                                H
                                             H
                                          H
                                                             L
                                                           L
                                                         L
                    整个过程产生的经验数据           s ,a ,R , s H   和   s ,a ,R , s L   将分别存入各自的经验回放池中, 用于  PPO  算法
                                          t  t  t  t+1   t  t  t  t+1
                 的后续离线策略更新.
   150   151   152   153   154   155   156   157   158   159   160