Page 145 - 《软件学报》2026年第5期
P. 145
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
2026,37(5):2024−2042 [doi: 10.13328/j.cnki.jos.007563] [CSTR: 32375.14.jos.007563] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束
*
运单分配方法
廖家俊, 董宜滔, 毛嘉莉
(华东师范大学 数据科学与工程学院, 上海 200062)
通信作者: 毛嘉莉, E-mail: jlmao@dase.ecnu.edu.cn
摘 要: 在动态环境下的双边匹配问题中, 对于时间约束与多目标优化的处理机制是影响匹配效率的重要因素之
一, 网络货运平台的运单分配即为此类问题的典型实例. 现有方法在处理时间约束的刚性建模和多目标冲突的权
衡机制方面存在显著局限性, 难以准确刻画决策主体在约束边界附近的行为特征. 提出一种基于条件扩散模型与
分层强化学习的时间约束感知匹配框架 TB-Match, 通过弹性约束量化、偏好表征学习、动态权衡优化和策略生
成这 4 个协同模块实现系统性能提升. 该方法的核心贡献包括: (1) 基于条件扩散概率模型的约束弹性化表征机制,
通过渐进噪声扩散与逆向去噪过程将确定性时间边界转化为连续概率分布, 精确建模决策主体在约束临界区域的
接受概率; (2) 融合动态目标权衡与近端策略优化的分层决策架构, 高层网络根据反馈信号自适应调节目标权重,
低层网络通过信任域约束实现长期累积收益最大化. 在两个大规模真实数据集上的实验结果表明, TB-Match 在匹
配率指标上比现有最优方法相对提升了 17.66%, 同时在满意度等指标中均展现出显著的性能优势, 证明了该方法
在复杂约束环境下的有效性和适用性.
关键词: 运单分配; 司机偏好建模; 弹性时间约束; 扩散模型; 近端策略优化
中图法分类号: TP301
中文引用格式: 廖家俊, 董宜滔, 毛嘉莉. TB-Match: 融合条件扩散模型与近端策略优化的弹性时间约束运单分配方法. 软件学报,
2026, 37(5): 2024–2042. http://www.jos.org.cn/1000-9825/7563.htm
英文引用格式: Liao JJ, Dong YT, Mao JL. TB-Match: Elastic Time-constrained Transport Order Assignment Method Integrating
Conditional Diffusion Model and Proximal Policy Optimization. Ruan Jian Xue Bao/Journal of Software, 2026, 37(5): 2024–2042 (in
Chinese). http://www.jos.org.cn/1000-9825/7563.htm
TB-Match: Elastic Time-constrained Transport Order Assignment Method Integrating
Conditional Diffusion Model and Proximal Policy Optimization
LIAO Jia-Jun, DONG Yi-Tao, MAO Jia-Li
(School of Data Science & Engineering, East China Normal University, Shanghai 200062, China)
Abstract: In the bilateral matching problem under dynamic environments, the mechanism for handling time constraints and multi-objective
optimization is one of the important factors affecting matching efficiency. The transport order assignment in online freight platforms serves
as a typical instance of such problems. Existing methods exhibit significant limitations in rigid modeling of time constraints and in the
trade-off mechanisms for multi-objective conflicts, making it difficult to accurately characterize the behavioral patterns of decision agents
near constraint boundaries. To address these issues, this study proposes a time-constraint-aware transport order assignment framework
called TB-Match. The framework consists of four collaborative modules: elastic constraint quantification, preference representation learning,
dynamic objective trade-off optimization, and policy generation. The core contributions are as follows: (1) a constraint elasticity
representation mechanism based on conditional diffusion probabilistic models, which converts deterministic time boundaries into continuous
* 基金项目: 国家自然科学基金 (62461146205); 海南省重点研发项目 (ZDYF2025GXJS179)
收稿时间: 2025-07-18; 修改时间: 2025-08-20; 采用时间: 2025-10-10; jos 在线出版时间: 2026-01-28
CNKI 网络首发时间: 2026-01-29

