Page 159 - 《软件学报》2026年第5期
P. 159
2038 软件学报 2026 年第 37 卷第 5 期
Match 同样取得了 0.845 的匹配率, 相比于 MAPT 提升了 11.18%. 司机满意度指标进一步证实了 TB-Match 的优
势. 在 RS 数据集上, 模型达到了 0.857 的满意度得分, 比 MAPT 相对提升了 5.5%. 在 DT-CARGO 数据集上, 满意
度得分为 0.836, 相比于 MAPT 提升了 5.4%, 说明模型在保证整体效率的同时能够更好地满足司机需求. 相比于传
统的静态匹配方法和基于强化学习的动态方法, TB-Match 实现了匹配率和司机满意度的协同优化, 验证了我们提
出方法的有效性和实用价值.
4.3 消融实验 (RQ2)
为了细致评估我们提出的 TB-Match 框架中核心组件的各自贡献, 我们在 RS 数据集上进行了一项全面的消
融研究. 我们将完整 TB-Match 模型的性能与几个变体进行了比较, 每个变体都系统地省略或简化了一个关键的
架构元素. 该实验的结果详见表 2.
表 2 TB-Match 及其变体在 RS 数据集上消融实验的性能比较
框架模块 模型变体 MR DS
- 完整模型 (TB-Match) 0.813 0.857
去除条件扩散模型 0.762 0.831
偏好表示变体 (第3.1节) 去除序列注意力机制 0.775 0.840
去除时间约束捕捉模块 0.748 0.754
去除动态目标权衡模块 0.794 0.846
匹配决策框架变体 (第3.2节)
去除匹配策略生成网络 0.769 0.826
条件扩散模型作为时间约束弹性建模的核心组件, 其重要性在消融实验中得到了充分验证. 去除条件扩散模
型导致了显著的性能下降, MR 从 0.813 降至 0.762, 相对降幅为 6.4%, DS 从 0.857 降至 0.831, 相对降幅为 3.1%.
这一结果充分证实了将时间约束转化为概率化弹性表征的必要性. 传统的二元判断方法 (能否完成) 忽略了司机
在时间约束边界附近的适应能力, 而条件扩散模型通过学习时间约束的概率分布, 能够更准确地捕捉司机对不同
时间约束下的运单选择概率, 从而扩大了有效匹配的范围.
序列注意力机制的移除同样造成了性能退化, MR 相对下降 4.7%, DS 相对下降 2%. 这一结果强调了历史行为
序列信息在司机偏好建模中的关键作用. 简单的 MLP 方法虽然能够处理当前运单特征, 但无法有效捕捉司机偏好
的时序演化特征和上下文依赖关系. 序列注意力机制通过对历史运单序列的动态加权, 能够识别出与当前决策最
相关的历史行为模式, 从而提升偏好预测的准确性.
时间约束捕捉模块的重要性在消融实验中表现最为突出, 其移除导致 MR 相对下降 8% (从 0.813 降至 0.748),
DS 下降 12.1% (从 0.857 降至 0.754). 这一结果表明, 显式的时间约束建模是整个框架性能的基础. 没有时间约束
捕捉模块, 模型无法理解司机在不同时间压力下的行为差异, 导致分配决策与司机实际接受意愿之间出现较大
偏差.
动态目标权衡模块的消融实验揭示了其在平衡匹配率与司机满意度方面的重要作用. 当该模块被固定权重策
略替代时, MR 相对下降 2.4% (从 0.813 降至 0.794), DS 相对下降 1.3% (从 0.857 降至 0.846). 这一结果验证了动
态权重调整机制的有效性. 固定权重策略无法适应不同时间段内供需关系的变化, 而动态权衡机制能够根据实时
的拒单反馈调整优化目标的相对重要性, 在高拒单率情况下增加司机满意度的权重, 在低拒单率情况下侧重提高
匹配率, 从而实现两个目标的自适应平衡.
匹配网络的替换实验进一步证实了基于 PPO 的强化学习方法在序列决策优化中的优势. 将 PPO 替换为动态
规划算法导致 MR 相对下降 5.5% (从 0.813 降至 0.769), DS 相对下降 3.7% (从 0.857 降至 0.826). 这意味着动态规
划算法虽然能够在给定状态下找到局部最优解, 但缺乏对长期累积收益的考虑; 而 PPO 通过价值函数网络和策略
网络的协同优化, 能够学习到跨时间窗口的最优分配策略, 在当前决策中考虑对未来匹配效果的潜在影响.
4.4 超参数实验 (RQ3)
TB-Match 的性能受多种超参数影响. 我们进行了一系列实验来分析它们的敏感性并确定合适的取值. 在这些

