Page 326 - 《软件学报》2026年第4期
P. 326

吴益露 等: 基于分类检索的操作规划方法                                                            1767


                    COIN  数据集包含超过      1  万个视频, 是涵盖操作种类最多、事件范围最广的教学视频数据集. 本文方法在消
                 耗最少训练资源的情况下, 取得了最优的结果, 这充分证明了方法的有效性. 我们认为能够在                            COIN  上取得优异表
                 现的原因主要有以下两点. 首先, COIN         包含   180  个事件类别, 动作空间庞大. 相比于以往在整个动作空间中直接
                 规划的方法, 我们首先通过确定事件类别缩小动作空间, 大幅降低了问题的复杂性. 根据表                            2  中展示的更多结果,
                 COIN  的事件分类准确率达到       80%, 较之前的工作有显著提升. 其次, COIN         是一个相对规范的教学视频数据集, 这
                 也使得我们的检索方法能够显著提升规划的成功率.

                                              表 2 COIN  上更多操作规划结果 (%)

                            T     EventAcc    SAcc    EAcc     MAcc      SR      Acc     mIoU
                            3       81.33    58.03    57.01    45.10    30.86    53.38   60.40
                            4       80.50    58.30    56.79    42.98    24.14    50.26   61.87
                            5       79.43    58.24    56.85    44.60    21.35    49.78   62.01

                    我们同样在较小的数据集          CrossTask  上测试了操作规划结果. 如表       3  所示, 本文方法同样取得了具有竞争力
                 的表现. 虽然未能达到最优结果, 但当          T = 3  和  T = 4  时, SR  指标均为次优, 这对于我们仅需极少训练资源的方法来
                 说, 是一个不错的结果. 值得注意的是, PDPP          的结果标注了*, 这是为了确保公平比较, 我们采用了与标准设定相
                 同的结果, 而非    PDPP  论文中的原始结果. 我们认为        CrossTask  上的提升不如  COIN, 主要原因在于, 与    COIN  相比,
                 CrossTask  的操作序列中存在大量动作重复和动作缺失, 导致不确定性更高. 更多关于不确定性分析的讨论可参见
                 第  3.7  节. 尽管如此, 我们的混合规划模块仍然有效, 确保了方法的结果足以超越大多数之前的方法. 表                         4  展示了
                 在  CrossTask  上的更多操作规划结果. 随着      T  值的增加, 事件分类的准确率保持稳定, 但由于检索难度加大, 整体
                 正确率出现了明显下降.

                                    表 3 CrossTask  上预测范围为   T = 3, T = 4  的操作规划结果  (%)

                                                   T = 3                        T = 4
                              方法
                                          SR       Acc      mIoU       SR       Acc      mIoU
                             Random      <0.01     0.94      1.66     <0.01     0.83     1.66
                             Retrieval    8.05     23.30    32.06     3.95     22.22     35.97
                             DDN [18]    12.18     31.29    47.48     5.97     27.10     48.46
                              3
                             P IV [21]   23.34     49.96    73.89     13.40    44.16     70.01
                              E3P [22]   26.40     53.02    74.05     16.49    48.00     70.16
                             PDPP* [23]  26.38     55.62    59.34     18.69    52.44     62.38
                            Skip-plan [24]  28.85  61.18    74.98     15.56    55.64     70.30
                             RAP [25]    29.23     62.35    75.63     16.96    55.77     71.49
                             KEPP [26]   33.38     60.79    63.89     21.02    56.08     64.15
                              Ours       31.68     59.02    61.09     19.36    53.82     60.55


                                             表 4 CrossTask  更多操作规划结果     (%)

                            T     EventAcc    SAcc    EAcc     MAcc      SR      Acc     mIoU
                            3       90.66    68.93    61.32    46.82    31.68    59.02   61.09
                            4       91.52    69.64    62.06    41.80    19.36    53.82   60.55
                            5       92.03    71.02    62.70    37.85    10.79    49.46   59.84
                            6       92.76    71.89    63.58    37.53    6.87     47.60   59.12

                    我们在较小的数据集         NIV  上对方法进行了评估. 如表        5  所示, 本文方法在    T = 3  时取得了最高的    SR  指标
                 (26.61%), 并在  T = 4  时实现了最佳的  Acc 指标  (48.93%), 较基准提升约  7%. 由于  NIV  数据集规模较小, 实验中存
                 在一定的过拟合现象, 导致结果波动较大, 没有任何方法能够在所有指标上全面领先. 我们还在更长时间区间上评
   321   322   323   324   325   326   327   328   329   330   331