Page 322 - 《软件学报》2026年第4期
P. 322
吴益露 等: 基于分类检索的操作规划方法 1763
2.1 问题设定
对于给定的视觉信息 O start 和 O end , 我们的模型需要根据给定的动作空间 A 规划出一个动作序列 ˜ π, 其中动作
空间由数据集提供. 动作序列表示为:
˜ π = {˜a 1 , ˜a 2 ,..., ˜a T }, ˜a i ∈ A (1)
其中, T 表示序列中包含多少个动作, ˜ a i 为动作 (标记了 ∼ 的符号是模型推理出的结果, 未标记的符号表示真实的
结果). 教学视频数据集中包含了多种事件的视频, 所以数据集的动作空间就是由多种事件的子动作空间构成, 所
以动作空间可以表示为:
A = {A 1 ∪ A 2 ∪...∪ A N } (2)
其中, N 是数据集中事件的个数, 即子动作空间的个数. 之前的工作在完整的动作空间 A 中进行操作规划, 这样使
O end 确定当前的事
得规划的解空间过大, 所以规划的难度较大. 为了缩小规划的动作空间, 我们首先根据 O start 和
˜ e
件类别 ˜ e, 然后将动作空间缩小为 的子空间 A ˜e . 此时问题转变为:
(3)
˜ π = {˜a 1 , ˜a 2 ,..., ˜a T }, ˜a i ∈ A ˜e
在确定了事件类别后, 我们将操作规划视为一个分类问题, 将动作序列分为 3 个部分:
(4)
˜ π = {˜a start , ˜a mid , ˜a end }, ˜a start , ˜a mid , ˜a end ∈ A ˜e
其中, ˜ a start ˜a end 分别为开始和结束的动作. ˜ a mid 为中间动作, 包含了 T −2 个动作 (去除了开始和结束的动作). 我们
,
首先根据 O start 和 O end 确定 ˜ a start 和 ˜ a end , 然后使用检索和预测相结合的方法来确定最优的 ˜ a mid . 第 2.3 节将详细介绍
不同的规划方法.
2.2 事件分类模块
O end 输入到 ECM 中得到当前的事件类别. 具体来说, 我们将开始
本节介绍事件分类模块. 我们通过将 O start 和
和结束的视觉特征在特征维度连接起来, 而后输入到一个事件分类器中. 因为输入的是抽取好的特征, 所以不需要
特别复杂的模型, 我们选择了一个简单的 4 层的多层感知器 (multilayer perceptron, MLP) 结构作为 ECM. 多层感
知器的输出是所有事件的概率分布 e p e , 对应于真值的独热编码 (one-hot encoding) e, 我们用交叉熵损失函数来训
练这个分类器, 损失函数如下:
(5)
L ECM = −eloge p e
根据获得的事件概率, 我们选择概率最高的事件作为规划子空间, ˜ e = argmax(e p e ).
2.3 混合规划模块
本节详细描述了混合规划模块. 首先介绍开始动作分类器 (action classifiers) 和结束动作分类器, 接着详细介
绍规划方法. 我们展示了 3 种规划方法: 仅检索方法 (retrieval-only method)、仅预测方法 (prediction-only method)
和混合规划方法 (mixed-planning method). 在最终结果展示中, 我们选择了混合规划方法, 详细的消融实验将在第
3.6 节展示.
2.3.1 动作分类器
经过 ECM 过程后, 规划任务被缩小到一个新的动作空间 A ˜e . 可规划的动作数量从 n 变为 . 然后, 在此新空
n ˜e
间中确定 ˜ a start 和 ˜ a end . 由于开始和结束观测是动作片段的一部分, 我们使用一个简单的 3 层 MLP 作为分类器进行
识别. 但与常规的动作识别任务相比, 我们的分类更为困难, 因为只能看到部分动作信息. 如图 4 所示, 我们将 O start
和 O end 分别输入对应的开始动作和结束动作分类器, 获得开始和结束动作的概率, 分别为 e p start 和 e p end . 开始和结束
的真实标签的独热编码表示为 a start 和 a end , 这里同样使用交叉熵损失函数:
(6)
L SC = −a start loge p start , L EC = −a end loge p end
根据获得的概率, 我们选择概率最高的动作作为分类结果:
˜ a start = argmax(e p start ), ˜a end = argmax(e p end ) (7)

