Page 325 - 《软件学报》2026年第4期
P. 325

1766                                                       软件学报  2026  年第  37  卷第  4  期


                                                   i
                 始状态点和结束状态点, 即        os i  和   oe i . 对于第   个动作片段, 我们选择开始时间点附近的图像      I ts i−σ ,ts i+σ   作为  os i , 并选
                 择结束时间点附近的图像               作为  oe i , 其中   σ = 1. 对于操作规划, 需要长度为  T  的动作序列作为样本, 但是大
                                     I te i−σ ,te i+σ
                 多数视频中的动作数量并不等于           T . 对于少于  T  个动作的视频, 我们会通过重复的方法补齐动作序列. 对于多于                  T
                 个动作的视频, 我们使用滑动窗口          (长度为   T ) 来剪裁视频, 以此来考虑所有的动作序列. 所以最终每个样本包含                  T
                 个动作,  os 0  作为开始状态,  oe T−1  作为结束状态.
                  3.4   实现细节
                    本文规划器输入的是视频特征. 对于             3  个数据集, 我们按照    P IV  [21] 方法使用  S3D [43] 提取特征, 该模型使用
                                                                    3
                 HowTo100M [16] 数据集进行预训练, 以实现视频-文本联合嵌入. 我们通过枚举每个事件包含的动作, 并基于事件类
                 别划分不同的子空间来构建动作空间. 具体来说, CrossTask               包含  18  个子空间, 每个子空间平均有        7.4  个动作;
                 NIV  包含  5  个子空间, 每个事件平均有     9.5  个动作; 对于包含   12  个领域和  180  个事件的  COIN, 我们在事件级别划
                 分子空间, 因此包含      180  个子空间, 每个子空间平均包含       4.3  个动作.

                  3.5   实验结果
                    我们比较了关于指导性视频中的操作规划的工作. (1) 随机策略                   (random policy): 该基线随机从动作空间中选
                 择动作序列, 代表性能的下限. (2) 基于检索的方法            (retrieval): 该基线通过在特征空间中最小化起点和终点对的距
                 离, 匹配训练集中最近的结果. 我们的方法与该基线类似, 不同之处在于该方法在特征空间中进行检索, 而我们的
                 方法则先进行分类, 再在动作空间中进行检索. (3) DDN              [18] : 该方法首次提出将操作规划任务扩展到教学视频.
                                                               3
                 DDN  使用双分支模型来学习状态-动作转移的双动态. (4) P IV            [21] : 该方法使用弱语言监督进行操作规划. P IV     3  是
                 一个基于   Transformer [50] 的单分支模型, 并配备了一个记忆模块. (5) E3P    [22] : 该方法通过将事件信息编码到序列建
                 模过程中, 从环境状态中规划动作序列, 并依据预测事件规划后续动作. 不同于该方法, 本文方法直接利用事件信
                 息以缩小动作空间, 实验结果表明其效果更优. (6) PDPP            [23] : 该方法将操作规划任务视为拟合分布的过程, 通过扩
                 散模型重建分布. (7) Skip-plan [24] : 将操作规划视为一个数学链问题, 该模型通过绕过不可靠的中间动作, 将较长的
                 链条分解为多个较短的子链条. (8) RAP        [25] : 该模型克服了传统方法的限制, 能够处理固定和可变的动作序列, 并通
                 过弱语言监督和可学习的检索式记忆组件, 提升了序列规划的能力. (9) KEPP                   [26] : 该方法通过构造知识图谱的方法
                 来增强操作规划中的过程知识.
                    我们首先在当前规模最大的教学视频数据集                COIN  上对方法进行了测试, 结果如表          1  所示, 其中加粗的数据
                 表示最优结果, 带下划线的数据表示次优结果. 与之前基于大规模模型且训练方式更为复杂的方法相比, 本文方法
                 在多个指标上均表现出显著提升. 当            T = 3  时, SR  指标提升  6.39%; 当  T = 4  时, SR  指标提升  7.38%. 同样地, 准确
                 率也有着大幅改进, 分别在        T = 3  和  T = 4  时提高了  5.79%  和  6.16%. 需要特别指出的是, 我们对  mIoU  的计算进行
                 了标准化: 与之前方法在整个批次上计算             mIoU  不同, 我们在单个样本上计算        mIoU. 因此, 与之前方法相比, 我们
                 的  mIoU  结果可能相对偏低.

                                      表 1 COIN  上预测范围为     T = 3, T = 4  的操作规划结果  (%)

                                                   T = 3                        T = 4
                              方法
                                          SR       Acc      mIoU       SR       Acc      mIoU
                             Random      <0.01     <0.01     2.47     <0.01    <0.01     2.32
                             Retrieval   4.38      17.40    32.06     2.71     14.29     36.97
                                 [18]
                             DDN         13.90     20.19    64.78     11.13    17.71     68.06
                              3  [21]
                             P IV        15.40     21.67    76.31     11.32    18.85     70.53
                                [22]
                              E3P        19.57     31.42    84.95     13.59    26.72     84.72
                             PDPP [23]   21.33     45.62    51.82     14.41    44.10     51.39
                            Skip-plan [24]  23.65  47.12    78.44     16.04    43.19     77.07
                             RAP [25]    24.47     47.59    85.24     16.76    42.11     84.64
                             KEPP [26]   20.25     39.87    51.72     15.63    39.53     53.27
                              Ours       30.86     53.38    60.40     24.14    50.26     61.87
   320   321   322   323   324   325   326   327   328   329   330