Page 151 - 《软件学报》2026年第5期
P. 151

2030                                                       软件学报  2026  年第  37  卷第  5  期


                                                         1  ∑
                                                   S(d) =     P accept (o,d)                        (2)
                                                          T
                                                        A
                                                          d  o∈A T
                                                             d
                      T
                 其中,   A ⊆ O  表示  T  周期内司机实际接受的运单集合. 该度量反映司机获得偏好匹配运单的期望程度.
                      d
                    问题陈述 (problem statement): 给定运单集合   O 和货车集合     D, 以及它们的属性和司机的历史行为数据, 目标
                 是找到一个随时间动态调整的匹配策略              π, 该策略生成一系列匹配决策          M t  (在时间窗口  t 内的分配方案), 以最大
                 化长期累积的成功匹配数量, 同时考虑并提升司机对所接受运单的满意度. 形式化地, 目标是优化

                                                                                 
                                         ∑     ∑                      ∑          
                                                                                 
                                            t                                  
                                                                                   
                                     max E   γ λ  I(accepted(o,d))+(1−λ)  P accept (o,d)         (3)
                                                                                   
                                              
                                      π                                          
                                           t    (o,d)∈M t              (o,d)∈M t
                                                                                o γ ∈ (0,1] 为时间折扣因子. 参
                 其中,  I(accepted(o,d)) 是指示函数, 表示司机  d 是否最终接受了分配给他的运单  .
                 数  λ ∈ [0,1] 用于平衡两个优化目标.
                                        ∑
                    ● 最大化成功匹配: 即      λ    I(accepted(o,d)), 最大化实际接受的运单.
                                       (o,d)∈M t
                                             ∑
                    ● 最大化司机满意度: 即       (1−λ)    P accept (o,d), 该目标旨在提升分配方案的采纳率, 通过模型预测, 优先推荐
                                            (o,d)∈M t
                 司机更可能接受的选项.
                    整个运单分配问题中既需要最大化成功匹配数量, 又要提升司机整体满意度. 为实现此目标, 我们需要分别构
                 建时间可行性概率       P feasible  和司机偏好概率  P pref  的模型, 并在此基础上设计出最优的匹配策略       π.
                  3   TB-Match  技术框架
                    为解决当前运单分配方法忽视时间约束弹性与司机偏好的问题, 本文提出了一种基于时间约束松弛优化理论
                 的物流运单分配优化方法 TB-Match, 如图         3 所示. 该框架包含    4  个核心模块: (1) 基于扩散模型的时间约束表征模
                 块, 该模块首先通过 Transformer 提取司机历史交互中的上下文特征, 然后利用条件去噪扩散概率模型                          (CDDPM)
                 将刚性的时间约束边界转化为概率分布, 实现约束弹性的精确建模; (2) 基于序列注意力机制的司机偏好融合模
                 块, 该模块将生成的弹性时间偏好与运单特征和司机状态整合, 预测司机的接单概率; (3) 基于强化学习反馈的目
                 标权衡优化模块, 该模块通过高层策略网络, 根据司机拒单行为动态调整匹配效率与司机满意度两个优化目标的
                 相对权重; (4) 基于近端策略优化的匹配策略生成模块, 该模块在高层策略网络输出的权重指导下生成具体的司机-
                 运单匹配决策, 同时通过信任区域机制确保策略的稳定更新. 上述模块整合为时间约束特征捕捉模块                                 (第  3.1  节)
                 与分配策略生成模块       (第  3.2  节).

                      输入层                                                          分配策略生成模块
                                             时间约束特征捕捉模块                           H
                                                                                  s t
                                                             ~                                   π H
                       运单                      <t d         P d              匹配状态
                                     Transformer   Transformer                    输出优化目标权重  高层智能体 Agent (PPO)
                                      编码器           编码器
                       司机                                                      ω gt    高层策略网络
                                                                                      动态目标权重调整
                                                         时间约束表征
                                                                                  L              迭代优化
                                                                                  π
                                                                                      低层匹配执行网络
                   s 0
                                                                            低层智能体 Agent  基于权重引导的
                                           条件扩散偏好                              (PPO)    运单分配
                                            表征模块                   S(d, o)
                        a 0
                                                       Transformer
                                                                               输出
                   s 1                     条件扩散偏好                             运单分配
                        a 1                                                   决策方案               匹配率
                                            表征模块
                        …                                                                        满意度
                                                                                t (a t )         拒单率
                                                                                 L
                   s T−1                   条件扩散偏好                司机弹性约束
                       a T−1                                      偏好表征
                                            表征模块
                   司机历史运单序列                                                                 匹配结果反馈
                                                                                 执行运单分配
                                                图 3 TB-Match  技术框架示意图
   146   147   148   149   150   151   152   153   154   155   156