Page 320 - 《软件学报》2026年第4期
P. 320

吴益露 等: 基于分类检索的操作规划方法                                                            1761



                               1.2
                               1.0
                             Event_Acc  0.6
                               0.8
                               0.4
                               0.2
                                0
                                 105222 105253 109972 113766  16815  23521  40567  44047  44789  53193  59684  71781  76400  77721  87706  91515  94276  95603 Average
                                                             Event_id
                                                  图 2 PlaTe 的事件准确率

                                                         事件分类器
                                                                    事件类别: e
                                            A e

                                                  a 1      a 2     a 3      a 4
                                              加面粉      搅拌     倒进锅中     翻转煎饼




                                            图 3 基于分类检索的操作规划任务示意图

                    鉴于教学视频具有事件级别和动作级别标签的特性, 我们首先通过一个简单的分类器确定当前的事件类别.
                 事件类别确定后, 将整个动作空间缩小到该事件对应的子空间, 在更小、更明确的子空间中进行细粒度规划. 随
                 后, 我们设计了一种混合规划模块, 将检索方法和预测方法相结合, 进一步提升规划性能. 该方法设计简单明了, 充
                 分利用了事件信息, 具有很强的可解释性, 并为后续优化提供了良好的基础. 在研究过程中, 我们还发现现有的操
                 作规划评估指标存在不完全合理的问题, 目前的大多数方法的比较并不完全公平. 为此, 我们参考已有研究, 更新
                 了更合理的操作规划评估指标. 在           COIN  [17] 、CrossTask [15] 和  NIV [14] 这  3  个主流教学视频数据集上的实验结果表
                 明, 本文方法在各数据集上均表现出较强的竞争力, 尤其在                 COIN  数据集上的操作规划指标取得了显著提升.
                    本文第   1  节介绍操作规划的相关工作与研究现状. 第             2  节具体介绍操作规划器, 包括事件分类模块和混合规
                 划模块. 第  3  节通过实验验证本文方法的有效性, 给出在             3  个数据集上的实验结果, 并提供了详细的消融实验. 最
                 后总结全文.
                  1   操作规划相关工作


                    教学在我们日常生活中至关重要, 教学的形式可以是文本、语音和视频. 其中视频形式的教学更加直观且易
                 于理解, 因此近年来出现了越来越多的教学视频数据集                    [14−17,32−35] . 这些数据集的规模各不相同, 较小的数据
                 集  [14,33,34] 只涉及少数事件, 如烹饪. 一些大规模数据集     [16,17] 则包含了来自不同领域的上百个事件类别. 这些教学视
                 频通常包含事件级别的标注. 因此, 我们可以利用事件类别来解决教学视频的相关任务. 随着数据集数量的增加,
                 基于教学视频的研究也越来越多, 例如动作分割               [36] 、弱监督动作分割    [37−39] 、步骤定位  [40,41] 、视频字幕生成  [32] 以
                 及视觉定位    [42] 等. 此外, 许多工作  [43−46] 旨在更好地理解教学视频的视觉信息. 本文研究的是长期视频推理任务, 即
                 教学视频中的操作规划任务.
                    最初的操作规划任务是在一个非常简单的环境中规划序列. 随后, Chang                     等人  [18] 提出了将操作规划迁移到更
                 复杂的现实生活中, 因此操作规划自然扩展到了教学视频. 以往的规划方法主要分为: (1) 基于强化学习的方
                 法  [18,31,47] , 它将规划任务视为马尔可夫决策问题     [48] , 并使用双分支结构分别拟合动作空间和特征空间中的真实分
                                                                                       3
                 布. (2) 基于  Transformer 的方法  [21,22,24,25,49] , 基于  Transformer 架构  [50] 规划操作序列, 其中, P IV [21] 利用了动作的文
                                        [49]                                            [25]
                 本信息进行弱监督; SCHEMA         使用大语言模型提供额外的中间状态描述来辅助训练; RAP                    使用自回归     Trans-
   315   316   317   318   319   320   321   322   323   324   325