Page 328 - 《软件学报》2026年第4期
P. 328
吴益露 等: 基于分类检索的操作规划方法 1769
表 8 混合规划模块消融实验 (%)
T = 3 T = 4
数据集 方法
SR Acc mIoU SR Acc mIoU
CPP (RO) 30.63 53.03 60.10 23.96 49.64 61.47
COIN CPP (PO) 28.50 54.96 58.99 20.70 52.36 60.61
CPP (Ours) 30.86 53.38 60.40 24.14 50.26 61.87
CPP (RO) 31.59 58.37 60.52 19.44 52.68 59.93
CrossTask CPP (PO) 27.32 58.47 59.27 14.55 53.82 59.39
CPP (Ours) 31.68 59.02 61.09 19.36 53.82 60.55
CPP (RO) 26.21 47.58 54.59 19.05 46.55 55.94
NIV CPP (PO) 18.15 49.33 53.38 15.71 49.88 54.81
CPP (Ours) 26.61 48.79 55.40 20.00 48.93 55.81
这种独立性假设导致中间动作的准确率较低, 从而影响 SR 指标. 而在仅检索方法中, 中间动作的检索结果基
于开始和结束动作的准确率, 体现为条件概率关系, 即:
P(˜a mid |˜a start , ˜a end ) (11)
根据实验结果, 当开始和结束动作完全正确时, 中间动作的检索准确率分别为 COIN 数据集约 70%、Cross-
Task 数据集约 60%、NIV 数据集约 80%, 显著高于仅预测方法中中间动作的独立预测准确率. 因此, 仅检索方法
在 SR 指标上的表现更为优异. 综上, 我们结合仅检索方法和仅预测方法的优势, 设计了混合规划模块, 以平衡 SR
指标和 Acc 指标的表现, 进一步提升了方法的整体性能.
我们接下来介绍如何确定混合规划模块中的超参数 θ. 由于操作规划任务仅划分了训练集和测试集, 为了确
定超参数, 我们从训练集中随机抽取 20% 的数据作为验证集进行调优. 由于其他方法用全部训练集来训练, 我们
划分验证集仅用于确定超参数. 对于 COIN、CrossTask 和 NIV, 最终的 θ 值设置为 0.8、0.7 和 0.9.
表 8 展示了仅检索方法 (RO) 和仅预测方法 (PO) 的实验结果, 分别对应于 θ = 1 和 θ = 0. 此外为了进一步验
证超参数的合理性, 表 9 展示了在 COIN 测试集上, 不同 θ 值的消融实验结果, θ = 0.8 的这一行数据为我们最终的
结果. 实验结果表明, 随着检索模块的权重变大, SR 指标逐渐升高, 但去除掉预测模块 ( θ = 1), SR 指标会下降. 当
检索模块的权重降低, 预测模块的权重增大时, Acc 指标升高, 当仅使用预测模块时 ( θ = 0), Acc 指标达到最大值,
这与我们前文分析的结论一致.
表 9 COIN 上不同 θ 消融实验 (%)
T = 3 T = 4
方法
SR Acc mIoU SR Acc mIoU
CPP ( θ = 0) 28.50 54.96 58.99 20.70 52.36 60.61
CPP ( θ = 0.6) 30.70 53.74 60.40 23.86 50.67 61.80
CPP ( θ = 0.7) 30.79 53.55 60.50 23.92 50.40 61.77
CPP ( θ = 0.8) 30.86 53.38 60.40 24.14 50.26 61.87
CPP ( θ = 0.9) 30.86 53.32 60.30 24.18 50.09 61.70
CPP ( θ = 1) 30.63 53.03 60.10 23.96 49.64 61.47
3.7 不确定性讨论
不确定性是过程规划任务中的一个重要特征. 这种不确定性体现为, 对于相同的开始和结束动作, 可能存在多
种合理的中间序列. 例如, 在制作一份复杂料理的过程中, 从清洗食材到最终摆盘, 可能有不同的步骤排列方式, 且
这些序列在语义上都是合理的. 然而, 在最初提出该问题时, 任务仅要求模型生成一个最佳解并进行评估, 且相关
数据集仅提供了一个标准答案, 未覆盖所有可能的合理序列. 基于此设定, 我们的方法在当前阶段主要生成一个最
佳解作为规划结果. 值得强调的是, 我们的方法具有天然的扩展性, 可以适应多解场景. 具体而言, 我们将检索到的

