Page 319 - 《软件学报》2026年第4期
P. 319
1760 软件学报 2026 年第 37 卷第 4 期
近年来, 视频理解领域 [1−5] 迅速发展, 在动作识别 [6−8] 、时序动作检测 [9,10] 和时空动作检测 [11,12] 等众多下游任务
中取得了显著成果. 然而, 这些任务主要关注于视频中的短期语义信息, 而如何有效理解和利用长时语义信息仍然
是亟待解决的挑战. 随着视频长度的不断增加, 更为复杂的视频理解任务逐渐受到关注, 例如时间维度上的推理 [13] .
与此同时, 随着大量教学视频的提出 [14−17] , 针对教学视频的任务也日益丰富, 其中之一便是操作规划任务. 本文聚
焦于教学视频中的操作规划问题, 该任务由 Chang 等人 [18] 首次提出, 是一个典型的长期视觉推理任务. 具体而言,
操作规划任务要求模型在给定开始和结束视觉状态的情况下, 规划出一个合理的动作序列, 以实现从开始状态到
结束状态的转换, 如图 1 所示. 需要注意的是, 这些动作序列的动作均来源于由教学视频数据集定义的动作空间.
{A 1 ,…, A N }
a 1 a 2 a 3 a 4
加面粉 搅拌 倒进锅中 翻转煎饼
图 1 教学视频中的传统操作规划任务示意图
现有研究 [19,20] 在一些简单任务 (如在桌上堆叠积木) 的规划中表现出巨大潜力, 但在更复杂环境下的操作规划
仍值得进一步研究. 尤其在教学视频中, 环境复杂且包含多种类型的动作, 动作持续时间各不相同, 这使得数据集
的复杂性显著增加. 此外, 与简单规划任务相比, 教学视频中的操作规划仅能依赖开始和结束的视觉状态进行推
理, 而中间状态的信息完全缺失, 这使得问题的设定更加困难. 数据集的复杂性和问题设定的难度共同构成了该任
务的主要挑战.
目前已有许多方法 [18,21−26] 被提出, 在操作规划中进行了有意义的尝试. 我们在遵循以往工作的基础上, 提出了
基于分类检索的操作规划器 (classification-retrieval-based retrieval procedure planner, CPP). 我们的方法主要基于以
下 3 个动机.
(1) 现有的方法基于强化学习, 或使用复杂的损失函数来进行训练, 这些方法无论是在推理还是训练过程中都
3
非常复杂. 在推理过程中, DDN [18] 使用基于采样的前向规划 [27] 方法来规划动作序列; P IV [21] 针对相同的开始和结
束视觉信息, 需要生成 K = 1500 个随机噪声样本, 再通过 Viterbi 后处理方法 [28] 进行平均. 在训练过程中, PDPP 等
基于扩散模型的方法 [23,29,30] 需要经过大量的训练重建概率分布. 此外, 这些方法的规划结果只能在最终阶段看到,
导致解释性较差. 相比之下, 本文方法简单明了, 仅需使用简单的分类器进行训练. 在推理阶段, 我们提出了一种新
的混合规划方法, 使规划过程中的问题能够被直观地观察到, 从而提升了解释性和易用性.
(2) 现有方法未能充分利用事件的语义信息, 而是在整个动作空间中直接进行操作规划. 这种方式存在明显问
题. 如图 2 所示, 在方法 PlaTe [31] 中, 有超过 1/3 的结果未能正确识别事件类别. 我们认为, 事件信息对操作规划至
关重要, 因为动作空间由不同事件的子空间组成. 因此, 准确确定事件类别能够帮助缩小规划范围, 使规划更加高
效和精确. 为此, 我们采用了一种直接有效的方法, 如图 3 所示. 我们提出了一种从粗到细的操作规划器, 首先通过
分类确定事件类别, 接着在该事件类别对应的较小且更明确的动作空间中进行细粒度的规划, 从而显著提升了规
划的效率与准确性.
(3) 进一步考虑了操作规划中的不确定性, 即对于相同的开始和结束动作, 可能存在多种合理的中间动作序
列. 这种不确定性源于数据集中并非所有视频都严格按照固定顺序执行. 例如, 在“制作柠檬水”这一事件中, 开始
和结束动作分别是“挤柠檬”和“搅拌混合物”. 在此过程中, 中间动作可能是“倒水”或“倒柠檬汁”, 两者均为合理选
择. 单纯依赖语义信息进行规划难以准确判断中间动作. 然而, 如果结合视觉信息, 这一问题可能得到有效解决: 当
场景中存在水时, 模型倾向于选择“倒水”; 而当场景中出现柠檬汁时, 模型则更倾向于选择“倒柠檬汁”. 基于此, 我
们从语义和视觉两个层面共同规划中间动作, 提出了混合规划模块以更好地应对这一挑战.

