Page 320 - 《软件学报》2026年第4期
P. 320
吴益露 等: 基于分类检索的操作规划方法 1761
1.2
1.0
Event_Acc 0.6
0.8
0.4
0.2
0
105222 105253 109972 113766 16815 23521 40567 44047 44789 53193 59684 71781 76400 77721 87706 91515 94276 95603 Average
Event_id
图 2 PlaTe 的事件准确率
事件分类器
事件类别: e
A e
a 1 a 2 a 3 a 4
加面粉 搅拌 倒进锅中 翻转煎饼
图 3 基于分类检索的操作规划任务示意图
鉴于教学视频具有事件级别和动作级别标签的特性, 我们首先通过一个简单的分类器确定当前的事件类别.
事件类别确定后, 将整个动作空间缩小到该事件对应的子空间, 在更小、更明确的子空间中进行细粒度规划. 随
后, 我们设计了一种混合规划模块, 将检索方法和预测方法相结合, 进一步提升规划性能. 该方法设计简单明了, 充
分利用了事件信息, 具有很强的可解释性, 并为后续优化提供了良好的基础. 在研究过程中, 我们还发现现有的操
作规划评估指标存在不完全合理的问题, 目前的大多数方法的比较并不完全公平. 为此, 我们参考已有研究, 更新
了更合理的操作规划评估指标. 在 COIN [17] 、CrossTask [15] 和 NIV [14] 这 3 个主流教学视频数据集上的实验结果表
明, 本文方法在各数据集上均表现出较强的竞争力, 尤其在 COIN 数据集上的操作规划指标取得了显著提升.
本文第 1 节介绍操作规划的相关工作与研究现状. 第 2 节具体介绍操作规划器, 包括事件分类模块和混合规
划模块. 第 3 节通过实验验证本文方法的有效性, 给出在 3 个数据集上的实验结果, 并提供了详细的消融实验. 最
后总结全文.
1 操作规划相关工作
教学在我们日常生活中至关重要, 教学的形式可以是文本、语音和视频. 其中视频形式的教学更加直观且易
于理解, 因此近年来出现了越来越多的教学视频数据集 [14−17,32−35] . 这些数据集的规模各不相同, 较小的数据
集 [14,33,34] 只涉及少数事件, 如烹饪. 一些大规模数据集 [16,17] 则包含了来自不同领域的上百个事件类别. 这些教学视
频通常包含事件级别的标注. 因此, 我们可以利用事件类别来解决教学视频的相关任务. 随着数据集数量的增加,
基于教学视频的研究也越来越多, 例如动作分割 [36] 、弱监督动作分割 [37−39] 、步骤定位 [40,41] 、视频字幕生成 [32] 以
及视觉定位 [42] 等. 此外, 许多工作 [43−46] 旨在更好地理解教学视频的视觉信息. 本文研究的是长期视频推理任务, 即
教学视频中的操作规划任务.
最初的操作规划任务是在一个非常简单的环境中规划序列. 随后, Chang 等人 [18] 提出了将操作规划迁移到更
复杂的现实生活中, 因此操作规划自然扩展到了教学视频. 以往的规划方法主要分为: (1) 基于强化学习的方
法 [18,31,47] , 它将规划任务视为马尔可夫决策问题 [48] , 并使用双分支结构分别拟合动作空间和特征空间中的真实分
3
布. (2) 基于 Transformer 的方法 [21,22,24,25,49] , 基于 Transformer 架构 [50] 规划操作序列, 其中, P IV [21] 利用了动作的文
[49] [25]
本信息进行弱监督; SCHEMA 使用大语言模型提供额外的中间状态描述来辅助训练; RAP 使用自回归 Trans-

