Page 325 - 《软件学报》2026年第4期
P. 325
1766 软件学报 2026 年第 37 卷第 4 期
i
始状态点和结束状态点, 即 os i 和 oe i . 对于第 个动作片段, 我们选择开始时间点附近的图像 I ts i−σ ,ts i+σ 作为 os i , 并选
择结束时间点附近的图像 作为 oe i , 其中 σ = 1. 对于操作规划, 需要长度为 T 的动作序列作为样本, 但是大
I te i−σ ,te i+σ
多数视频中的动作数量并不等于 T . 对于少于 T 个动作的视频, 我们会通过重复的方法补齐动作序列. 对于多于 T
个动作的视频, 我们使用滑动窗口 (长度为 T ) 来剪裁视频, 以此来考虑所有的动作序列. 所以最终每个样本包含 T
个动作, os 0 作为开始状态, oe T−1 作为结束状态.
3.4 实现细节
本文规划器输入的是视频特征. 对于 3 个数据集, 我们按照 P IV [21] 方法使用 S3D [43] 提取特征, 该模型使用
3
HowTo100M [16] 数据集进行预训练, 以实现视频-文本联合嵌入. 我们通过枚举每个事件包含的动作, 并基于事件类
别划分不同的子空间来构建动作空间. 具体来说, CrossTask 包含 18 个子空间, 每个子空间平均有 7.4 个动作;
NIV 包含 5 个子空间, 每个事件平均有 9.5 个动作; 对于包含 12 个领域和 180 个事件的 COIN, 我们在事件级别划
分子空间, 因此包含 180 个子空间, 每个子空间平均包含 4.3 个动作.
3.5 实验结果
我们比较了关于指导性视频中的操作规划的工作. (1) 随机策略 (random policy): 该基线随机从动作空间中选
择动作序列, 代表性能的下限. (2) 基于检索的方法 (retrieval): 该基线通过在特征空间中最小化起点和终点对的距
离, 匹配训练集中最近的结果. 我们的方法与该基线类似, 不同之处在于该方法在特征空间中进行检索, 而我们的
方法则先进行分类, 再在动作空间中进行检索. (3) DDN [18] : 该方法首次提出将操作规划任务扩展到教学视频.
3
DDN 使用双分支模型来学习状态-动作转移的双动态. (4) P IV [21] : 该方法使用弱语言监督进行操作规划. P IV 3 是
一个基于 Transformer [50] 的单分支模型, 并配备了一个记忆模块. (5) E3P [22] : 该方法通过将事件信息编码到序列建
模过程中, 从环境状态中规划动作序列, 并依据预测事件规划后续动作. 不同于该方法, 本文方法直接利用事件信
息以缩小动作空间, 实验结果表明其效果更优. (6) PDPP [23] : 该方法将操作规划任务视为拟合分布的过程, 通过扩
散模型重建分布. (7) Skip-plan [24] : 将操作规划视为一个数学链问题, 该模型通过绕过不可靠的中间动作, 将较长的
链条分解为多个较短的子链条. (8) RAP [25] : 该模型克服了传统方法的限制, 能够处理固定和可变的动作序列, 并通
过弱语言监督和可学习的检索式记忆组件, 提升了序列规划的能力. (9) KEPP [26] : 该方法通过构造知识图谱的方法
来增强操作规划中的过程知识.
我们首先在当前规模最大的教学视频数据集 COIN 上对方法进行了测试, 结果如表 1 所示, 其中加粗的数据
表示最优结果, 带下划线的数据表示次优结果. 与之前基于大规模模型且训练方式更为复杂的方法相比, 本文方法
在多个指标上均表现出显著提升. 当 T = 3 时, SR 指标提升 6.39%; 当 T = 4 时, SR 指标提升 7.38%. 同样地, 准确
率也有着大幅改进, 分别在 T = 3 和 T = 4 时提高了 5.79% 和 6.16%. 需要特别指出的是, 我们对 mIoU 的计算进行
了标准化: 与之前方法在整个批次上计算 mIoU 不同, 我们在单个样本上计算 mIoU. 因此, 与之前方法相比, 我们
的 mIoU 结果可能相对偏低.
表 1 COIN 上预测范围为 T = 3, T = 4 的操作规划结果 (%)
T = 3 T = 4
方法
SR Acc mIoU SR Acc mIoU
Random <0.01 <0.01 2.47 <0.01 <0.01 2.32
Retrieval 4.38 17.40 32.06 2.71 14.29 36.97
[18]
DDN 13.90 20.19 64.78 11.13 17.71 68.06
3 [21]
P IV 15.40 21.67 76.31 11.32 18.85 70.53
[22]
E3P 19.57 31.42 84.95 13.59 26.72 84.72
PDPP [23] 21.33 45.62 51.82 14.41 44.10 51.39
Skip-plan [24] 23.65 47.12 78.44 16.04 43.19 77.07
RAP [25] 24.47 47.59 85.24 16.76 42.11 84.64
KEPP [26] 20.25 39.87 51.72 15.63 39.53 53.27
Ours 30.86 53.38 60.40 24.14 50.26 61.87

