Page 327 - 《软件学报》2026年第4期
P. 327
1768 软件学报 2026 年第 37 卷第 4 期
估了 NIV 的表现, 结果如表 6 所示. 可以看出, 我们的模型即使在较小的数据集上, 也展现出了较强的长期规划能
力. 此外, 由于 NIV 数据集仅包含 5 个任务, 我们的方法在事件分类上的准确率几乎接近 100%.
表 5 NIV 上预测范围为 T = 3, T = 4 的操作规划结果 (%)
T = 3 T = 4
方法
SR Acc mIoU SR Acc mIoU
Random 2.21 4.07 6.09 1.12 2.73 5.84
DDN [18] 18.41 32.54 56.56 15.97 27.09 53.84
3
P IV [21] 24.68 49.01 74.29 20.14 38.36 67.29
E3P [22] 26.05 51.24 75.81 21.37 41.96 74.90
KEPP [26] 24.44 43.46 86.67 22.71 41.59 91.49
Ours 26.61 48.79 55.40 20.00 48.93 55.81
表 6 NIV 更多操作规划结果 (%)
T EventAcc SAcc EAcc MAcc SR Acc mIoU
3 99.60 50.00 48.79 47.58 26.61 48.79 55.40
4 100.00 49.52 51.91 47.14 20.00 48.93 55.81
5 100.00 45.67 50.29 42.20 11.56 44.51 57.31
6 99.27 46.72 45.26 40.15 5.84 42.09 56.88
3.6 消融实验
在本节中, 我们评估了各个模块的性能. 为了验证事件分类模块的有效性, 我们移除了 ECM 模块, 直接在整
个动作空间中对开始和结束动作进行分类, 并且检索预测中间动作. 根据表 7 所示, 移除 ECM 模块后, 在 COIN
和 CrossTask 数据集上的事件分类准确率分别下降了约 5% 和 6%. NIV 由于动作空间非常小, 所以事件分类准确
率没有发生变化. 剩下的所有指标在这 3 个数据集上都有大幅度的下降, 开始和结束动作的准确率下降了超过
5%. 由于开始和结束的准确率直接影响我们中间动作的检索结果, 最终的 SR 指标和 Acc 指标也显著下降. 尤其
是 NIV 的 SR 指标下降了约 12%. 这些结果表明, 首先通过 ECM 缩小规划的动作空间是非常必要的.
表 7 事件分类模块消融实验 (%)
数据集 方法 EventAcc SAcc EAcc MAcc SR Acc mIoU
CPP without ECM 76.63 50.51 51.12 40.83 21.00 47.49 53.46
COIN
CPP 81.33 58.03 57.01 45.10 30.86 53.38 60.40
CPP without ECM 84.77 63.46 57.47 43.37 26.02 54.77 56.19
CrossTask
CPP 90.66 68.93 61.32 46.82 31.68 59.02 61.09
CPP without ECM 99.60 45.97 39.52 39.11 14.92 41.53 47.39
NIV
CPP 99.60 50.00 48.79 47.58 26.61 48.79 55.40
根据第 2.3 节中描述的规划方法, 我们将混合规划方法替换为仅检索方法 (RO) 和仅预测方法 (PO), 分别对其
效果进行评估. 如表 8 所示, 仅检索方法 (RO) 已能够实现较为优异的规划性能, 特别是在 T = 4 时, 在 CrossTask
数据集上取得了最高的 SR 指标 19.44%, 在 NIV 数据集上取得了最高的 mIoU 指标 55.94%, 这充分验证了检索方
法的有效性. 相较之下, 仅预测方法 (PO) 的 SR 指标出现了显著下降, 但却在 Acc 指标上表现突出. 在 COIN 和
NIV 数据集上, 仅预测方法均取得了最佳的 Acc 指标.
为了分析其中的原因, 我们从概率论的视角进行解释. 对于仅预测方法, 开始动作、中间动作和结束动作的概
率被假设为条件独立, 因此最终的 SR 指标实际上是这 3 个部分联合概率的结果, 即:
P(SR) = P(˜a start )P(˜a mid )P(˜a end ) (10)

