Page 150 - 《软件学报》2026年第5期
P. 150

廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法                                   2029


                 在一些问题使其无法直接应用于运单分配场景. 一是这些方法主要针对离线优化场景, 对于运单分配这种实时决
                 策环境仍面临状态空间爆炸问题, 无法满足在线分配的要求; 二是这些方法采用静态优化范式, 忽略了当前分配决
                 策对司机状态     (如位置分布和满意度水平) 演变过程的影响, 从而可能引发长期分配性能的下降                        [9,10,16] . 针对静态优
                 化问题, 部分研究引入了强化学习技术来建模时序决策过程, 兼顾决策的长期收益, 但仍存在奖励函数难以设计的
                 问题. 具体而言, 单一智能体的复合奖励函数会因量纲差异导致梯度失衡, 而多智能体方案又因策略冲突引发收敛
                 难题  [11] . 近年来, 多目标强化学习   (MORL) 作为处理多目标优化问题的新兴范式, 在网约车任务分配等领域已被
                 应用. 现有  MORL  方法主要分为两类: 基于帕累托前沿的方法              (如  multi-policy actor-critic (MPAC)) 通过维护多个
                 策略网络同时学习帕累托最优解集, 能够在不预设权重的情况下探索目标间的权衡关系                             [24] ; 基于标量化函数的方
                 法则通过动态调整目标权重将多目标问题转化为单目标优化, 在保持计算效率的同时适应环境变化                                  [25] . 然而, 这
                 些方法在运单分配场景中并不能直接应用. 具体而言, 帕累托方法虽能生成多样化解集, 但其计算复杂度随目标数
                 量指数增长, 难以在运单分配的复杂场景中应用; 标量化方法虽然计算高效, 但其权重调整策略多基于启发式规
                 则, 其调整策略在运单分配场景中难以确定.
                    针对上述方法在动态适应性          (加权和法)、计算效率与长期最优          (帕累托优化) 以及可学习性        (强化学习) 的问题,
                 在本文中我们使用分层强化学习来解决这些问题, 通过将多目标权衡决策与具体分配执行分离到不同层次, 高层智
                 能体专注于根据系统状态动态调整目标权重, 低层智能体则在给定权重下执行具体的分配决策, 这种分层结构既避
                 免了复合奖励函数设计的困难, 又避免了多智能体方法的目标冲突, 同时通过分层分解方法有效降低了计算开销.
                  2   问题定义

                    本节对运单分配问题进行形式化定义, 其核心在于建立融合时间约束弹性量化、司机偏好建模和多目标动态
                 权衡的智能分配决策框架.
                    定义  1. 运单. 给定物流运输平台, 运单       o 被形式化定义为六元组:        o = ⟨loc pick ,loc del ,t start ,t  end  ,t ,cargo_type⟩, 其
                                                                                          late
                                                                                    load  load  del
                                                              [     ]
                               2
                 中,  loc pick , loc del ∈ R  分别表示装货地与卸货地的地理坐标,   t start ,t  end   构成装货时间窗口, 表示司机可以在这个时间
                                                               load  load
                                                                                  |O|
                 段内接货,   t  late  为合同约定的最晚送达时间,    cargo_type 表示待运输货物类别.     O = o k k=1  , 其中  |O| 表示在某个时间
                          del
                 段内需要分配的运单集合.
                    定义  2. 司机. 平台上参与运单分配的司机被定义为司机, 被形式化定义为三元组:                 d=⟨loc curr ,P d ,C d ⟩, 其中,  loc curr ∈ R 2
                 表示司机所属货车当前        GPS  坐标,  P d ⊆ R ×R  为司机偏好的运输线路集合     (装货地-卸货地对),     C d  表示该司机可承
                                                   2
                                                2
                                                           |D|
                 运的货物类型集合, 平台可用资源构成有限集合               D = d j  , 其中  |D| 为当前在线可调度车辆数.
                    定义   3. 时间约束. 时间约束是指运输过程需要遵守的时间规定, 其形式被定义为四元组:                           T o,d = ⟨t  start ,t end  ,
                                                                                                   load  load
                                        [     ]
                 late
                 t ,t d  ⟩, 其中, 装货时间窗口   t start ,t end   为闭区间, 表示司机需要在此期间至装货地进行接货; 最晚送达时间        t late  构成
                 del  return             load  load                                                del
                 硬约束, 表示货物必须在此时间点前送达目的地; 返程时间                 t d return  为可选约束, 即司机需要在特定时间前返回原地点.
                    基于上述定义, 挑战      1  可形式化为时间约束弹性的建模问题. 我们将司机的接单决策分解为两个步骤: 先评估
                 任务可行性    (货物兼容性与时间约束满足度), 再判断司机的偏好.
                    定义  4. 运单接受概率. 我们定义运单接受概率            P accept (o,d) 为司机  d 接受运单  o 的条件概率. 该概率通过分析
                 司机   d  的历史承运记录   H d = {(o 1 ,a 1 ),(o 2 ,a 2 ),...,(o n ,a n )}, 其中   是历史上分配给司机  d 的运单,  a i ∈ {0,1} 表示司
                                                                 o i
                 机是否接受该运单. 形式化地, 我们将司机            d 接受运单   o 的总概率   P accept (o,d) 定义为两个独立概率的乘积:

                                               P accept (o,d) = P feasible (o,d)×P pref (o,d)         (1)
                 其中,   P feasible (o,d) 表示可行性概率, 它首先表明司机  d  的货车是否能够运输运单       o 中的货物, 同时在给定的时间约
                 束  ( T o ,t d  ) 下, 能够按时完成运单  o 的可能性, 该概率由第    3.1  节的模型计算得到.    P pref (o,d) 表示司机的偏好概
                       return
                 率, 它表示在任务时间可行的前提下, 司机            d 的主观偏好     (如目的地、运输时间等) 上愿意接受运单             o 的可能性.
                 该概率主要通过第       3.2  节的模型分析司机的历史选择记录          H d  计算得出.
                    定义                                  S(d) 定义为其接受运单的平均接受概率:
                        5. 司机满意度. 司机在周期      T  内的满意度
   145   146   147   148   149   150   151   152   153   154   155