Page 329 - 《软件学报》2026年第4期
P. 329

1770                                                       软件学报  2026  年第  37  卷第  4  期


                 多种可能解视为合理解. 在这一框架下, 模型可以生成整个解分布而非单一解. 我们进一步参考                            P IV 3  的思路, 将模
                 型生成的规划分布与数据集的标准分布进行对比, 从而全面评估模型对多种解的支持能力. 我们采用了两个经典
                 的分布比较指标: KL     散度  (Kullback-Leibler divergence, KL-Div) 和负对数似然  (negative log-likelihood, NLL). 此
                 外, 为了进一步验证模型的多解能力, 我们引入了召回率                 (ModeRec) 和精确度  (ModePrec) 两个指标. ModeRec 衡
                 量模型对标准答案的覆盖能力, 即在生成的解分布中是否包含数据集中的标准解. 而                          ModePrec 则评价模型生成解
                 的合理性和可行性, 即生成解在测试数据中的准确性.
                    为了构建标准分布, 本文检索了测试集中所有满足给定开始和目标状态的动作序列, 作为参考的标准规划分
                 布. 如表  10  所示, 概率方法更好地匹配了标准分布, 取得了更好的              KL-Div  和  NLL  指标. 这是符合预期的结果, 表
                 明本文检索出的合理的解是在准确的解空间中, 也表明了我们缩小动作空间办法的有效性. 概率方法在                                 ModeRec
                 指标上表现出明显优势, 这表明模型生成的解分布能够更好地覆盖标准解. 然而, 由于概率方法允许更大的解空
                 间, 这也导致了    ModePrec 指标的下降. 解空间的扩展虽然增加了生成合理序列的机会, 但也不可避免地引入了一
                 些错误解, 降低了解的整体准确性. 值得注意的是, 我们仅在                 CrossTask  数据集上进行了不确定性实验. 这是因为,
                 与  COIN  和  NIV  数据集相比, CrossTask  的不确定性更高, 即在相同的开始和结束状态下存在更多的合理解序列.


                                               表 10 CrossTask  不确定性结果   (%)

                              指标             方法           T = 3     T = 4      T = 5     T = 6
                                         Ours-deterministic  3.65    3.84      4.05      4.09
                             KL-Div↓
                                         Ours-probabilistic  2.96    2.62      2.41      2.26
                                         Ours-deterministic  4.22    4.80      5.28      5.51
                              NLL↓
                                         Ours-probabilistic  3.54    3.58      3.65      3.69
                                         Ours-deterministic  46.26  41.81     34.80      25.37
                            ModePrec↑
                                         Ours-probabilistic  42.75  33.64     24.19      17.14
                                         Ours-deterministic  30.20  18.53     10.39      6.49
                            ModeRec↑
                                         Ours-probabilistic  45.21  38.51     29.37      21.86

                  3.8   mIoU  指标的讨论
                    在测试过程中, 不同的测试批次大小会对              mIoU  指标产生显著影响. 根据第       3.2  节中的说明, 我们在批次大小
                 为  1  时对  mIoU  进行了计算, 以确保结果的公平性和可比性. 分别从理论和实验的角度, 说明批次大小对                       mIoU  指
                 标的影响. 首先, mIoU   指标的计算公式如下:

                                                           1  N ∑  |˜π∩π|
                                                     mIoU =                                          (12)
                                                           N    |˜π∪π|
                                                              i
                 其中,   ˜ π 是预测序列的动作集合,    π 是真实序列的动作集合,       N  为所有的样本数. 当在整个批次上计算           mIoU  指标时,
                 ˜ π 是整个批次中所有预测序列的动作的集合,            π 是整个批次中所有真实序列的动作的集合,              N  为批次数, 这样会导
                 致  mIoU  指标被高估. 因为同一个批次中的错误预测可能会相互抵消, 极端情况下可能会出现两个样本预测结果
                 互换的情况, 即一个样本预测了另一个样本的正确序列, 这会使得                    mIoU  指标看起来很高, 但实际上每个样本的预
                 测结果可能并不好. 并且我们也通过实验证明, 随着批次大小的增加, mIoU                    值也逐渐提高, 当批次大小增加至           20
                 时, mIoU  可达到约  90% (CrossTask  中可达到  93.04%). 所以对于操作规划任务, 我们认为在推理阶段对每个样本
                 独立计算   mIoU  更能真实评估模型的实际效果, 从而避免因批次处理而导致的评估偏差.

                  4   可视化

                    我们给出了规划操作序列的可视化示例, 其中绿色框表示正确的动作, 红色框表示错误的动作. 如图                                5  所示,
                 对于相同的开始和结束观测, 仅检索方法会以相同的概率得到两个中间动作结果, 因为这些示例均在训练集中出
                 现过. 具体来说, 训练集中包含了“将煎饼从锅中拿出并翻面”的示例. 然而, 当我们使用混合规划方法并引入视觉
   324   325   326   327   328   329   330   331   332   333   334