Page 322 - 《软件学报》2026年第4期
P. 322

吴益露 等: 基于分类检索的操作规划方法                                                            1763


                  2.1   问题设定

                    对于给定的视觉信息        O start  和  O end , 我们的模型需要根据给定的动作空间    A  规划出一个动作序列      ˜ π, 其中动作
                 空间由数据集提供. 动作序列表示为:

                                                    ˜ π = {˜a 1 , ˜a 2 ,..., ˜a T }, ˜a i ∈ A         (1)
                 其中,  T  表示序列中包含多少个动作,        ˜ a i  为动作  (标记了  ∼ 的符号是模型推理出的结果, 未标记的符号表示真实的
                 结果). 教学视频数据集中包含了多种事件的视频, 所以数据集的动作空间就是由多种事件的子动作空间构成, 所
                 以动作空间可以表示为:

                                                    A = {A 1 ∪ A 2 ∪...∪ A N }                        (2)
                 其中,  N  是数据集中事件的个数, 即子动作空间的个数. 之前的工作在完整的动作空间                       A 中进行操作规划, 这样使
                                                                                          O end  确定当前的事
                 得规划的解空间过大, 所以规划的难度较大. 为了缩小规划的动作空间, 我们首先根据                          O start  和
                                           ˜ e
                 件类别   ˜ e, 然后将动作空间缩小为   的子空间      A ˜e . 此时问题转变为:

                                                                                                      (3)
                                                   ˜ π = {˜a 1 , ˜a 2 ,..., ˜a T }, ˜a i ∈ A ˜e
                    在确定了事件类别后, 我们将操作规划视为一个分类问题, 将动作序列分为                       3  个部分:

                                                                                                      (4)
                                               ˜ π = {˜a start , ˜a mid , ˜a end }, ˜a start , ˜a mid , ˜a end ∈ A ˜e
                 其中,  ˜ a start ˜a end  分别为开始和结束的动作.   ˜ a mid  为中间动作, 包含了  T −2 个动作  (去除了开始和结束的动作). 我们
                        ,
                 首先根据   O start  和  O end  确定   ˜ a start  和   ˜ a end , 然后使用检索和预测相结合的方法来确定最优的  ˜ a mid . 第  2.3  节将详细介绍
                 不同的规划方法.
                  2.2   事件分类模块
                                                       O end  输入到  ECM  中得到当前的事件类别. 具体来说, 我们将开始
                    本节介绍事件分类模块. 我们通过将            O start  和
                 和结束的视觉特征在特征维度连接起来, 而后输入到一个事件分类器中. 因为输入的是抽取好的特征, 所以不需要
                 特别复杂的模型, 我们选择了一个简单的             4  层的多层感知器     (multilayer perceptron, MLP) 结构作为  ECM. 多层感
                 知器的输出是所有事件的概率分布            e p e , 对应于真值的独热编码    (one-hot encoding)  e, 我们用交叉熵损失函数来训
                 练这个分类器, 损失函数如下:

                                                                                                      (5)
                                                       L ECM = −eloge p e
                    根据获得的事件概率, 我们选择概率最高的事件作为规划子空间,                     ˜ e = argmax(e p e ).
                  2.3   混合规划模块
                    本节详细描述了混合规划模块. 首先介绍开始动作分类器                    (action classifiers) 和结束动作分类器, 接着详细介
                 绍规划方法. 我们展示了       3  种规划方法: 仅检索方法      (retrieval-only method)、仅预测方法  (prediction-only method)
                 和混合规划方法      (mixed-planning method). 在最终结果展示中, 我们选择了混合规划方法, 详细的消融实验将在第
                 3.6  节展示.
                  2.3.1    动作分类器
                    经过  ECM  过程后, 规划任务被缩小到一个新的动作空间               A ˜e . 可规划的动作数量从    n 变为  . 然后, 在此新空
                                                                                          n ˜e
                 间中确定    ˜ a start  和  ˜ a end . 由于开始和结束观测是动作片段的一部分, 我们使用一个简单的      3  层  MLP  作为分类器进行
                 识别. 但与常规的动作识别任务相比, 我们的分类更为困难, 因为只能看到部分动作信息. 如图                          4  所示, 我们将   O start
                 和   O end  分别输入对应的开始动作和结束动作分类器, 获得开始和结束动作的概率, 分别为                    e p start  和  e p end . 开始和结束
                 的真实标签的独热编码表示为          a start  和  a end , 这里同样使用交叉熵损失函数:

                                                                                                      (6)
                                              L SC = −a start loge p start , L EC = −a end loge p end
                    根据获得的概率, 我们选择概率最高的动作作为分类结果:

                                              ˜ a start = argmax(e p start ), ˜a end = argmax(e p end )  (7)
   317   318   319   320   321   322   323   324   325   326   327