Page 152 - 《软件学报》2026年第5期
P. 152

廖家俊 等: TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法                                   2031


                  3.1   时间约束特征捕捉模块
                    本节旨在构建一个能够精确建模司机时间约束弹性偏好的表示模块. 传统方法在评估司机对时间约束的接受
                 意愿时, 往往忽略了司机在不同时间约束条件下表现出的差异化弹性特征. 为解决这一局限性, 本节提出一种融
                 合  Transformer 结构与条件扩散模型的新型框架, 如图         3 所示. 该框架首先利用      Transformer 从司机历史交互序列
                 中提取深层次的上下文特征, 并结合当前订单信息, 生成司机偏好的条件均值表征; 随后, 以该条件均值为引导, 采
                 用条件扩散模型生成能够反映司机在时间约束边界区间内决策倾向的弹性偏好概率分布; 最后, 将该概率化偏好
                 与当前订单特征融合, 输出可用于后续匹配决策的动态偏好评分.
                    为实现对司机动态时间偏好的高精度建模, 本节提出一种基于                     Transformer 的历史上下文感知与条件均值偏
                                                                                               (
                 好估计方法. 具体而言, 我们将每位司机的历史交互序列              H d = (e 1 ,e 2 ,...,e K ) 作为输入, 其中每一条交互  e k = c k ,O  avail  )
                                                                                                   k  ,a k
                 包含了   k 时刻的上下文状态、可选运单集以及司机实际选择的运单. 为充分利用历史行为序列的时序依赖性和上
                 下文丰富性来捕捉时间约束的相关特征, 我们借助                Transformer 结构多头自注意力的序列建模能力来提取多层次
                 的行为特征, 更准确地表征时间约束对于司机运单选择的影响.
                    该模块采用条件      Transformer 编码器-解码器架构. 编码器      T cond  输入包括历史行为序列的嵌入表示        Embed(H d )
                 以及当前订单特征的嵌入         Embed(o curr ). 通过多层自注意力和前馈网络的深度融合, 模型能够有效整合历史与当前
                 信息, 生成一个上下文向量        c(o curr |H d ). 随后, 解码器部分  T dec  以该上下文向量和当前订单特征  Embed(o curr ) 为输入,
                                                                          ˆ p(o curr |H d ). 该表征反映了司机在当前情
                 通过自注意力和与编码器输出的交叉注意力机制, 输出条件均值偏好表征
                 境下对时间约束的主观弹性预期. 具体而言, 条件均值偏好表征                   ˆ p(o curr |H d ) 中捕捉了司机在运输场景决策时的多种
                 特征: (1) 时间敏感性特征, 表征司机在高峰期与平峰期不同的历史接单模式; (2) 距离偏好特征, 表征反映其对短
                 途、中途、长途运单的不同偏好强度; (3) 货物类型适应性, 表征司机对不同货物类型的历史承运经验, 捕捉其在
                 特定货物处理方面的专业能力; (4) 延误容忍度, 通过表征司机历史运单中的实际完成时间与预期时间的偏差模
                 式, 量化其在面对潜在延误时的接受概率; (5) 返程约束敏感性, 基于司机的历史返程行为模式, 表征其对需要在特
                 定时间返回原地的运单的偏好程度. 另外, 该部分采用                Transformer 架构的另一个好处是能够为后续的条件扩散模
                 型简化学习难度, 使其更专注于建模数据分布的高阶不确定性和个体化弹性特征. 在本框架中,                             ˆ p 作为弹性偏好生
                 成的中心参考点, 使得扩散模型能够围绕其进行概率扩展, 从而更准确地反映司机在时间约束边界附近的真实决策倾向.
                  3.1.1    条件扩散驱动的弹性偏好概率分布生成

                    在获得条件均值偏好表征          ˆ p(o curr |H d ) 后, 我们设计了一个基于条件扩散模型的时间约束表征模型来生成能够
                 捕捉司机时间偏好弹性的概率化表征              p 0 , 如图  4 所示. 具体而言, 为了捕捉运单分配场景下司机时间偏好弹性的
                 概率化表征, 需要解决以下技术难点: 首先, 司机在时间约束临界点附近的决策行为呈现高度非线性的概率分布特
                 征, 需要模型能够精确刻画从“完全可接受”到“完全不可接受”之间的平滑过渡区域, 而自回归模型的序列生成机
                 制无法有效建模这种连续概率空间中的复杂分布结构; 其次, 不同司机在相同时间压力下的偏好概率分布存在显
                 著个体差异, 要求模型能够在保持分布多样性的同时避免模式坍塌, 而对抗生成网络在处理此类多模态分布时容
                 易出现训练不稳定和模式坍塌问题, 导致生成的偏好表征缺乏必要的个体化差异.
                    为了解决以上问题, 从运单分配场景出发, 我们发现司机对于时间约束的弹性本质上是一个从确定性约束向
                 概率性评估的渐进转化过程, 这与扩散模型通过逐步去噪实现从噪声到数据的生成机制在概念上高度契合. 基于
                 此, 我们设计了一个条件扩散偏好表征模块, 其通过模拟可逆的噪声添加与去除过程, 能够学习到以                                ˆ p 为中心、
                 覆盖司机在时间约束边界附近所有可能决策状态的复杂概率分布, 该渐进式生成过程模拟了司机在面对时间约束
                 时的决策思维过程: 从基础时间预期出发, 根据实际运输条件进行弹性调整, 最终形成对运单的接受概率判断.
                    为训练该模型, 我们首先需要定义其学习目标, 即源自历史数据的真实偏好状态                         p true . 该状态是对司机已完成
                                                                                   0
                 运单的实际决策结果       (如接受或拒绝) 及其相关的时间弹性特征             (如相较于预估时间的提前或延迟量) 进行向量化
                 编码的结果. 基于此, 条件扩散模型的目标便是学习一个从标准正态分布噪声出发, 在条件均值                             ˆ p 的引导下, 通过
                 逐步去噪生成与真实数据         p true  分布一致的偏好样本.
                                      0
   147   148   149   150   151   152   153   154   155   156   157