Page 324 - 《软件学报》2026年第4期
P. 324

吴益露 等: 基于分类检索的操作规划方法                                                            1765



                 这两种方法. 最终的     e p mid  计算如下:

                                                    e p mid = θe p RO  +(1−θ)e p PO                   (9)
                                                          mid      mid
                 其中,   θ 是一个超参数, 最终的中间动作结果为          ˜ a mid = argmax(e p mid ).
                  2.4   训练与测试
                    在训练时, 我们分别训练事件分类器、动作分类器和动作预测器, 每个模型均是一个简单的                              MLP. 开始和结
                 束分类器使用相似的结构, 但并不共享参数. 训练动作分类器时, 我们使用数据增强, 即将视频中每个动作的观测
                 作为训练样本. 在推理时, 我们将批次大小设置为               1, 通过事件分类器确定事件类别, 选择相应的开始和结束分类
                 器以获得开始和结束动作类别, 通过混合规划模块获得完整的序列.
                  3   实验分析

                    本节详细介绍实验设置, 具体包括数据集介绍、评价指标和样本提取. 我们在                         3  个不同的数据集上评估本文
                 方法, 并与之前的方法进行比较. 此外, 我们验证了本文方法中每部分的效果. 随后, 讨论操作规划中的不确定性.
                 最后, 展示方法的可视化结果.
                  3.1   数据集介绍
                    我们遵循之前的工作         [21−26] , 在  3  个主流的教学视频数据集上评估我们的方法, 数据集分别是: COIN              [17] 、
                 CrossTask [15] 和  NIV [14] .
                    COIN  是规模庞大的教学视频数据集, 包含           11 827  个视频、12  个领域、180   个事件和   778  个动作. 我们遵循
                 以往的方法    [21−26] , 按照  70%/30%  的比例对数据集进行划分.
                    CrossTask  数据集, 包含  2 750  个视频、18  个事件和  133  个动作, 其事件主要涉及烹饪任务, 如“制作塔可沙
                 拉”“烤牛排”. CrossTask  提供了官方划分方案, 训练集和测试集分别包含              2 390  个和  360  个视频. 尽管部分方法  [31]
                 使用了官方划分方案, 其他方法         [21−26] 均采用了  70%/30%  的划分策略创建训练/测试集. 为了更公平地比较, 我们在
                 此采用   70%/30%  的数据划分.
                    NIV  是一个相对较小的数据集, 仅包含          150  个视频、5  个事件和   48  个动作. 由于  NIV  未提供官方数据划分方
                 案, 我们同样以    70%/30%  的比例对数据集进行划分.
                    除了规模差异外, CrossTask    和  NIV  每个视频的动作数量超过       COIN. COIN  更为标准, 大多数动作遵循标准顺
                 序, 而  CrossTask  和  NIV  中的动作可能会重复多次或不按标准顺序进行. 因此, 我们的混合规划模块在                  COIN  上的
                 表现优于其他两个数据集. 详细结果将在第              3.5  节中展示.
                  3.2   评价指标
                    为了与之前的工作       [21–26] 保持一致, 我们使用了  3  个已有的指标来评估性能. (1) 平均交并比          (mIoU), 这是一个
                 最不严格的指标. 该指标要求模型输出正确的动作, 但不要求动作的顺序正确. 这里, 我们对                          mIoU  进行特别解释.
                 根据公开的代码, 之前的方法        [21,22] 在整个批次上计算  mIoU, 即将整个批次的动作添加到集合中. 我们认为这种做法
                 不够严谨, 因为批次大小会影响最终结果, 随着批次大小的增加, mIoU                  会增加. 因此, 我们在单个样本上计算           IoU.
                 所以与之前的工作相比, 我们的          mIoU  会略低, 但指标更严谨. (2) 平均准确率      (Acc) 该指标考虑每一步动作的准确
                 性, 不要求序列完全正确, 只关注每个单独的动作是否正确. (3) 成功率                  (SR) 要求整个预测动作序列与真实的动作
                 序列完全一致, 这是最严格的指标. (4) 事件准确率           (EventAcc) 考虑预测序列是否能识别当前事件类别, 当序列中有
                 多于一半的动作成功识别事件类别, 我们就认为这个序列成功识别. (5) 开始准确率                        (SAcc) 和结束准确率    (EAcc)
                 分别计算开始和结束动作的平均准确率. 中间准确率                  (MAcc) 表示中间动作的平均准确率. 我们提出的新指标
                 EventAcc、SAcc、EAcc 与  MAcc 基于原始指标, 可以细化操作规划任务, 更准确地评估模型.
                  3.3   样本提取
                    每个教学视频都标注了描述人类动作的动作标签和边界. 我们遵循现有的方法                          [21−26] , 将每个视频视为图像序
                 列   I 1:L , 其中包含  M  个动作片段, 每个片段带有动作标签     a 1:M  和时间边界  (ts 1:M ,te 1:M ). 我们希望获取每个动作的开
   319   320   321   322   323   324   325   326   327   328   329