Page 95 - 《软件学报》2026年第4期
P. 95

1536                                                       软件学报  2026  年第  37  卷第  4  期


                              Q ∈ R M×d Q   K ∈ R N×d K  V ∈ R N×d V  N  表示键-值对数量,   M  表示查询向量数量. 那
                    设查询矩阵            , 键矩阵         , 值矩阵        , 其中
                 么, 缩放点积注意力计算为:

                                                                    (    )
                                                                     Q· K  ⊤
                                               Attention(Q,K,V) = Softmax  √                          (4)
                                                                       d K
                 其中,   Softmax 函数对  Q· K ∈ R M×N  的每一行进行归一化, 输出为查询对值的加权聚合.
                                     ⊤
                    该注意力机制被应用于组成           Transformer 基本框架的多头自注意力层       MSA(·) 中, 每个头独立学习不同的注意
                                                                              K
                                                                                  V
                                                                          Q
                                               ⊤
                 力子空间. 令输入序列为       X = [x 1 ,..., x N ] ∈ R N×d  , 查询、键、值分别记为  X 、X 、X . 设  l 为注意力头的数量, 那
                 么  MSA 输出结构为:

                                               (        )
                                                 Q
                                                    K
                                            MSA X ,X ,X V  = Concat(h 1 ,...,h i ,...,h l )W          (5)

                                                    (                  )
                                                                K
                                                             K
                                                      Q
                                                          Q
                                                                   V
                                          h i = Attention X ·W ,X ·W ,X ·W i V  , i ∈ [1,l]           (6)
                                                          i
                                                                i
                                                                                d
                                Q
                 其中,  W ∈ R md V ×d ,  W , W , W ∈ R d K ×d   均表示可训练投影矩阵, 通常设置  d K = d V =  m .
                                       V
                                   K
                                       i
                                   i
                                i
                    为进一步提升模型容量与计算效率, 专家混合结构 (MoE                 结构) [35] 被提出用于对不同专家网络进行稀疏激活.
                 该结构引入了门控函数         (gating function), 在给定输入的条件下对多个子网络输出进行加权聚合. 如图                 2  所示,
                 MoE  架构中所使用的专家混合层 (MoE 层) 通过引入多个子网络                (称为专家) 与一个门控网络实现稀疏激活机制.
                 在每个   MoE  层中, 输入首先经过门控网络进行评分, 动态选择其中一小部分专家                    (如  Top-k) 参与前向计算. 被选
                 中的专家对输入进行独立变换, 其输出经过门控权重加权后求和, 作为该层的最终输出. 该结构允许模型在保持计
                 算成本不变的情况下显著提升参数规模与表达能力, 被广泛用于构建高效的大规模神经网络. 因此, MoE                                层可以
                 被看作是嵌入在循环神经网络结构            (recurrent neural network, RNN) 中的一种特殊编码层. 在  MoE  层中, 稀疏门控
                 函数选择两个专家参与计算, 它们的输出将根据门控网络的输出进行调制.

                         Task 1                     Task t
                                      . . .                     . . .
                       p t−1     p t             Pre-trained projection layer     max η t
                          Iterative
                         aggregation
                                       Prompt-tuning
                                         vectors                   Classifier
                        update
                                                                                     ...
                                                                                 Logit scores
                           p 1
                                                                     MLP
                            . . .
                                                                                 Non-linear residual connection
                                                                       forward
                           p t−1
                                                                                 Score function for pre-trained experts
                    Prompt                                  forward              Score function for prompt-tuning
                     pool  p t                 Value    Experts scores
                                              vectors                            Score function for expert gate
                                              图 2 TP-MoE  模型架构简要示意图.

                                                      {         } N
                                                                                    d
                                                                                         N
                                                          d
                    具体来说, MoE    层由给定的     N  个专家网络    f j : R → R d V   和一个门控函数  {G : R → R } 组成. 当给定输入
                                                                 j=1
                 h ∈ R , MoE  层的输出为:
                     d

                                                                  (    )
                                                                exp s j (h)
                                               N ∑          N ∑
                                           y =  G(h) j · f j (h) =  ∑  N  · f j (h)                   (7)
                                              j=1          j=1    exp(s i (h))
                                                                i=1
                 其中,  s j (h) 为门控网络对第   个专家的打分,    G(h) j   为第   j 个专家的  Softmax 输出的权重分布.
                                       j
   90   91   92   93   94   95   96   97   98   99   100