Page 326 - 《软件学报》2026年第4期
P. 326
吴益露 等: 基于分类检索的操作规划方法 1767
COIN 数据集包含超过 1 万个视频, 是涵盖操作种类最多、事件范围最广的教学视频数据集. 本文方法在消
耗最少训练资源的情况下, 取得了最优的结果, 这充分证明了方法的有效性. 我们认为能够在 COIN 上取得优异表
现的原因主要有以下两点. 首先, COIN 包含 180 个事件类别, 动作空间庞大. 相比于以往在整个动作空间中直接
规划的方法, 我们首先通过确定事件类别缩小动作空间, 大幅降低了问题的复杂性. 根据表 2 中展示的更多结果,
COIN 的事件分类准确率达到 80%, 较之前的工作有显著提升. 其次, COIN 是一个相对规范的教学视频数据集, 这
也使得我们的检索方法能够显著提升规划的成功率.
表 2 COIN 上更多操作规划结果 (%)
T EventAcc SAcc EAcc MAcc SR Acc mIoU
3 81.33 58.03 57.01 45.10 30.86 53.38 60.40
4 80.50 58.30 56.79 42.98 24.14 50.26 61.87
5 79.43 58.24 56.85 44.60 21.35 49.78 62.01
我们同样在较小的数据集 CrossTask 上测试了操作规划结果. 如表 3 所示, 本文方法同样取得了具有竞争力
的表现. 虽然未能达到最优结果, 但当 T = 3 和 T = 4 时, SR 指标均为次优, 这对于我们仅需极少训练资源的方法来
说, 是一个不错的结果. 值得注意的是, PDPP 的结果标注了*, 这是为了确保公平比较, 我们采用了与标准设定相
同的结果, 而非 PDPP 论文中的原始结果. 我们认为 CrossTask 上的提升不如 COIN, 主要原因在于, 与 COIN 相比,
CrossTask 的操作序列中存在大量动作重复和动作缺失, 导致不确定性更高. 更多关于不确定性分析的讨论可参见
第 3.7 节. 尽管如此, 我们的混合规划模块仍然有效, 确保了方法的结果足以超越大多数之前的方法. 表 4 展示了
在 CrossTask 上的更多操作规划结果. 随着 T 值的增加, 事件分类的准确率保持稳定, 但由于检索难度加大, 整体
正确率出现了明显下降.
表 3 CrossTask 上预测范围为 T = 3, T = 4 的操作规划结果 (%)
T = 3 T = 4
方法
SR Acc mIoU SR Acc mIoU
Random <0.01 0.94 1.66 <0.01 0.83 1.66
Retrieval 8.05 23.30 32.06 3.95 22.22 35.97
DDN [18] 12.18 31.29 47.48 5.97 27.10 48.46
3
P IV [21] 23.34 49.96 73.89 13.40 44.16 70.01
E3P [22] 26.40 53.02 74.05 16.49 48.00 70.16
PDPP* [23] 26.38 55.62 59.34 18.69 52.44 62.38
Skip-plan [24] 28.85 61.18 74.98 15.56 55.64 70.30
RAP [25] 29.23 62.35 75.63 16.96 55.77 71.49
KEPP [26] 33.38 60.79 63.89 21.02 56.08 64.15
Ours 31.68 59.02 61.09 19.36 53.82 60.55
表 4 CrossTask 更多操作规划结果 (%)
T EventAcc SAcc EAcc MAcc SR Acc mIoU
3 90.66 68.93 61.32 46.82 31.68 59.02 61.09
4 91.52 69.64 62.06 41.80 19.36 53.82 60.55
5 92.03 71.02 62.70 37.85 10.79 49.46 59.84
6 92.76 71.89 63.58 37.53 6.87 47.60 59.12
我们在较小的数据集 NIV 上对方法进行了评估. 如表 5 所示, 本文方法在 T = 3 时取得了最高的 SR 指标
(26.61%), 并在 T = 4 时实现了最佳的 Acc 指标 (48.93%), 较基准提升约 7%. 由于 NIV 数据集规模较小, 实验中存
在一定的过拟合现象, 导致结果波动较大, 没有任何方法能够在所有指标上全面领先. 我们还在更长时间区间上评

