Page 153 - 《软件学报》2026年第5期
P. 153
2032 软件学报 2026 年第 37 卷第 5 期
前向加噪过程 (forward process): 与标准的扩散模型类似, 我们定义一个固定的前向过程, 在 S 个离散时间步
(用 s 索引, 以区别于物理时间 中, 逐步向真实的偏好状态 p true 中添加高斯噪声, 同时将过程锚定到条件均值 ˆ p.
t)
0
这一过程可以理解为从具体的历史运输表现逐渐向基于统计规律的平均预期收敛的过程, 其中噪声代表了司机个
体差异和环境不确定性等因素的综合影响. 在任意扩散步骤 s, 从 p s−1 到 的转移定义为:
p s
( √ ( √ ) )
q(p s |p s−1 , ˆ p) = N p s ; 1−β s p s−1 + 1− 1−β s ˆ p,β s I (4)
其中, {β s } S 是预设的噪声调度表. 这使得 p s 可以直接从 p true 和 ˆ p 采样得到:
s=1 0
√ ( √ ) √
p s = ¯ α s p true + 1− ¯ α s ˆ p+ 1− ¯α s ϵ (5)
0
s ∏
其中, ¯ α s = (1−β i ) 且 ϵ ∼ N (0,I). 公式 (5) 描述了加噪过程是在真实偏好 p true 和条件均值 ˆ p 之间进行插值, 并
0
i=1
叠加受控噪声. 在运输场景中, 这一过程反映了实际运输表现的生成机制: 任何具体的运输结果都可以看作是基础
预期 (由历史数据和订单特征决定)、司机个体能力差异以及环境随机因素三者综合作用的产物. 当 s → S (S 表示
,
扩散总步数) 时, ¯ α s → 0 p S 的分布将主要由 ˆ p 和标准差决定, 这对应了在缺乏具体历史信息时只能依靠统计规律
进行预测的现实情况. 我们定义扩散过程的终点为 p(p S |ˆ p) = N (p S ; ˆ p,I).
扩散 (训练) 阶段
q( p 1 |p 0 , p) …
true
p s ~ (p s ; p, I)ˆ
司机运单选
p 1 p s
真实偏好数据 择概率分布
true
p 0
ϵ θ ( p s , s, p, S T )
d 1 d 2 d t
历史交互
序列 … 条件均值生成 ˆ p 采
样
d cond
噪
声
ϵ θ ( p s , s, p, S T )
S T
实时匹配状态
去噪 (推理) 阶段
~
p( p 0 |p 1, p) …
p s ~ (p s ; p, I)ˆ
~
p 0
p 1 p s
弹性偏好表征
噪声
图 4 条件扩散偏好表征模块示意图
反向去噪过程 (reverse process): 反向过程的目标是训练一个网络 ϵ θ (p s , s, ˆ p,o curr ), 使其能够根据当前的含噪偏
ϵ
好表征 p s 、扩散步数 s、条件均值偏好 ˆ p 以及当前订单特征 o curr , 来预测在前向过程中每一步所添加的噪声 .
在运输场景中, 这个网络学习的是如何从基础的平均预期和订单特征出发, 逐步恢复那些代表司机个体能力差异
和环境随机性的细节信息, 从而生成既符合统计规律又包含合理个体化弹性的时间偏好表征. 训练目标是最小化
预测噪声与真实噪声之间的均方误差:
[ ]
( ( true ) ) 2
L CDDPM (θ) = E s,p true ,ϵ∼N (0,I) w(s) ∥ ϵ −ϵ θ p s p ,ϵ, s, ˆ p , s, ˆ p,o curr ∥ (6)
0 0
其中, p s (·) 是根据公式 (5) 计算得到的含噪样本, w(s) 是与扩散步数相关的权重.
推理时, 我们从先验 p S ∼ N (ˆ p,I) 开始, 利用训练好的 迭代地执行去噪步骤, 最终生成一个弹性偏好表征样
ϵ θ
本 ˜ p 0 . 从概率分布的角度分析, 在时间约束宽松的情况下, 分布趋向于以司机历史偏好为中心的单峰分布; 而在时
间约束紧张时, 分布呈现双峰或多峰特征, 反映了司机在“接受挑战性运单”与“选择安全运单”之间的决策分歧. 条
件扩散模型生成的这种概率结构, 相比于传统的单点估计方法提供了更丰富的决策信息, 在运输场景中对应了从

