Page 329 - 《软件学报》2026年第4期
P. 329
1770 软件学报 2026 年第 37 卷第 4 期
多种可能解视为合理解. 在这一框架下, 模型可以生成整个解分布而非单一解. 我们进一步参考 P IV 3 的思路, 将模
型生成的规划分布与数据集的标准分布进行对比, 从而全面评估模型对多种解的支持能力. 我们采用了两个经典
的分布比较指标: KL 散度 (Kullback-Leibler divergence, KL-Div) 和负对数似然 (negative log-likelihood, NLL). 此
外, 为了进一步验证模型的多解能力, 我们引入了召回率 (ModeRec) 和精确度 (ModePrec) 两个指标. ModeRec 衡
量模型对标准答案的覆盖能力, 即在生成的解分布中是否包含数据集中的标准解. 而 ModePrec 则评价模型生成解
的合理性和可行性, 即生成解在测试数据中的准确性.
为了构建标准分布, 本文检索了测试集中所有满足给定开始和目标状态的动作序列, 作为参考的标准规划分
布. 如表 10 所示, 概率方法更好地匹配了标准分布, 取得了更好的 KL-Div 和 NLL 指标. 这是符合预期的结果, 表
明本文检索出的合理的解是在准确的解空间中, 也表明了我们缩小动作空间办法的有效性. 概率方法在 ModeRec
指标上表现出明显优势, 这表明模型生成的解分布能够更好地覆盖标准解. 然而, 由于概率方法允许更大的解空
间, 这也导致了 ModePrec 指标的下降. 解空间的扩展虽然增加了生成合理序列的机会, 但也不可避免地引入了一
些错误解, 降低了解的整体准确性. 值得注意的是, 我们仅在 CrossTask 数据集上进行了不确定性实验. 这是因为,
与 COIN 和 NIV 数据集相比, CrossTask 的不确定性更高, 即在相同的开始和结束状态下存在更多的合理解序列.
表 10 CrossTask 不确定性结果 (%)
指标 方法 T = 3 T = 4 T = 5 T = 6
Ours-deterministic 3.65 3.84 4.05 4.09
KL-Div↓
Ours-probabilistic 2.96 2.62 2.41 2.26
Ours-deterministic 4.22 4.80 5.28 5.51
NLL↓
Ours-probabilistic 3.54 3.58 3.65 3.69
Ours-deterministic 46.26 41.81 34.80 25.37
ModePrec↑
Ours-probabilistic 42.75 33.64 24.19 17.14
Ours-deterministic 30.20 18.53 10.39 6.49
ModeRec↑
Ours-probabilistic 45.21 38.51 29.37 21.86
3.8 mIoU 指标的讨论
在测试过程中, 不同的测试批次大小会对 mIoU 指标产生显著影响. 根据第 3.2 节中的说明, 我们在批次大小
为 1 时对 mIoU 进行了计算, 以确保结果的公平性和可比性. 分别从理论和实验的角度, 说明批次大小对 mIoU 指
标的影响. 首先, mIoU 指标的计算公式如下:
1 N ∑ |˜π∩π|
mIoU = (12)
N |˜π∪π|
i
其中, ˜ π 是预测序列的动作集合, π 是真实序列的动作集合, N 为所有的样本数. 当在整个批次上计算 mIoU 指标时,
˜ π 是整个批次中所有预测序列的动作的集合, π 是整个批次中所有真实序列的动作的集合, N 为批次数, 这样会导
致 mIoU 指标被高估. 因为同一个批次中的错误预测可能会相互抵消, 极端情况下可能会出现两个样本预测结果
互换的情况, 即一个样本预测了另一个样本的正确序列, 这会使得 mIoU 指标看起来很高, 但实际上每个样本的预
测结果可能并不好. 并且我们也通过实验证明, 随着批次大小的增加, mIoU 值也逐渐提高, 当批次大小增加至 20
时, mIoU 可达到约 90% (CrossTask 中可达到 93.04%). 所以对于操作规划任务, 我们认为在推理阶段对每个样本
独立计算 mIoU 更能真实评估模型的实际效果, 从而避免因批次处理而导致的评估偏差.
4 可视化
我们给出了规划操作序列的可视化示例, 其中绿色框表示正确的动作, 红色框表示错误的动作. 如图 5 所示,
对于相同的开始和结束观测, 仅检索方法会以相同的概率得到两个中间动作结果, 因为这些示例均在训练集中出
现过. 具体来说, 训练集中包含了“将煎饼从锅中拿出并翻面”的示例. 然而, 当我们使用混合规划方法并引入视觉

