Page 321 - 《软件学报》2026年第4期
P. 321
1762 软件学报 2026 年第 37 卷第 4 期
former 结构来生成可变长度的操作序列. (3) 基于 Diffusion 的方法 [23,29,30] , 将操作规划问题视为一个概率分布重建
问题, 通过扩散模型重建期望的概率分布. 与以往使用复杂结构的方法相比, 我们选择使用更直接的基于分类检索
的方法, 并充分利用教学视频的特性, 提出了一种新的从粗到细的操作规划器.
动作变化的推理或预测逐渐成为一个备受关注的研究方向. 在推理任务中, 模型需要根据已知的动作或视觉
信息推断未见过的动作类别 [51,52] 、视觉信息的文本描述 [53] 以及其他形式 [54,55] . 本文中的操作规划也是视觉推理任
务之一. 目前, 动作预测和早期动作识别 [56−59] 是最受欢迎的视觉推理任务之一, 这些任务在 EPIC-KITCHENS 数据
集 [60] 上得到了广泛研究. 这两类任务的核心在于推理短期的动作变化, 而操作规划则面向更复杂的场景, 需要推
理长期的动作序列. 此外, 这些任务的输入通常仅包含开始的视觉状态, 而操作规划是一个目标驱动的任务, 需同
时考虑开始和结束的视觉信息, 从而在规划中兼顾当前状态与目标状态的联系.
随着大规模视频文本数据集的出现, 例如 HowTo100M [16] , 许多结合文本的多模态视频工作应运而生 [41,43,61] .
主流的做法主要分为: (1) 采用对比损失 [43,62] , 将不同模态的信息进行融合; (2) 将基于掩码的目标函数作为多模态
视频领域研究方向 [3,63,64] ; (3) 端到端的训练方法 [16,43] , 利用大量教学视频的训练, 旨在获得更好的视频和文本特征,
以便应用于下游任务的事件抽取. VideoCLIP [62] 专注于长期的时间建模, 旨在捕捉丰富的上下文信息. 随后, Han 等
人 [65] 研究了直接将上下文信息丰富的叙事文本与视频帧对齐的多模态视频模型. VINA [46] 将视频中步骤定位作为
最终目标, 而不是文本与视频对齐. 本文使用 MIL-NCE [43] 模型来提取教学视频的视觉特征用于操作规划.
2 基于分类检索的操作规划器
本节将详细描述操作规划器. 首先提出操作规划的问题定义, 然后介绍事件分类模块 (event classification
module, ECM), 该模块用于识别事件的类别. 最后介绍混合规划模块 (mixed planning module, MPM), 该模块包含
3 种不同的规划方法. 图 4 是所提方法的框架图, 图中展示了两个样本, 首先样本经过事件分类模块 (图 4(a) 中灰
色模块) 确定事件类别. 根据确定的事件类别将动作空间缩小到特定的子空间中, 在图 4(a) 中样本 i 对应的子空间
用绿色模块表示; 样本 j 对应的子空间用蓝色模块表示. 随后, 样本在缩小的子空间中通过混合规划模块进行规划,
对应于图 4(a) 中的黄色模块. 图 4(b) 中以样本 i 为例, 展示了混合规划模块的详细结构, 首先通过开始和结束动作
分类器确定开始和结束的动作, 再结合检索和预测两种方法确定中间的动作, 从而确定整个序列.
~
i i e i
o start o end
~i
MPM a 1: T
_ : 制作煎饼
A e i
ECM
j ~
MPM a 1: T
~
e j
j j _ : 制作果冻酒杯
o start o end A e j
(a) ࠎႿਆ۱ဢЧ༯֥操作规划器 (CPP) 框架图
输入 混合规划模块 (MPM) A e i _ : 制作煎饼
开始动作 i ~
分类器 a start ~ RO
P min
+ 检索算法
结束动作 i ~ ~ i
a 1: T
分类器 a end θ
~
PO
动作 P mid 1−θ i ~
预测器 + a mid
(b) MPM 混合规划模块, 对应于 (a) 中黄色框
图 4 基于分类检索的操作规划器 (CPP) 框架图和混合规划模块示意图

