Page 310 - 《软件学报》2026年第2期
P. 310

强敏杰 等: 结合多模态信息的定制化评论生成                                                           789


                 从而聚焦于图像的特定部分. 例如, 针对属性词“猪肋排”和情感极性“积极”, TGA 子层能够帮助模型关注图像中包

                 含猪肋排的部分, 以生成具体的正面评价. 在 TDG 子层中, 通过门控因子                  λ 控制保留多少视觉信息, 从而过滤掉冗
                 余和噪声. 接下来详细介绍融合模块中的各个子层.

                              图片标题生成
                              产品图片                                产品图片和标题



                                                    BLIP-2
                                                                                  盘子上有鲜嫩
                                                                                 多汁的烤猪肋排





                              多模态信息输入
                              产品图片
                                                                       图像标题






                              输入文本
                               (猪肋排, 积极)  +   盘子上有鲜嫩多汁的烤猪肋排        +     盘子上有洋葱圈和薯条


                                                     图 3 图像标题生成

                    ● 文本引导的注意力融合子层          (TGA). 由于视觉表示     H img  的序列长度为  1, 首先使用广播机制将其扩展到与
                 文本序列一致的长度, 以避免维度不匹配问题. 接着, 将文本表示投影到                      Query  空间, 将视觉表示投影到      Key  和

                 Value 空间, 应用文本引导的注意力机制获取文本引导的视觉特征                  Z img :

                                                       Q
                                                                     K
                                                                        V
                                                Q = H txt W , [K;V] = H img [W ;W ]                   (8)

                                                     Z img = TGA(Q,K,V)                               (9)

                                                     H txt = LN(H txt +Z img )                       (10)
                           K
                        Q
                              V
                 其中,  {W ,W ,W } 是训练参数. 随后,   H txt  将通过前馈网络子层:

                                                   H txt = LN(H txt +FFN(H txt ))                    (11)
                    ● 文本驱动的门控融合子层         (TDG). 利用门控机制整合来自不同模态的表示. 首先, 通过门控因子                  λ 衡量模态
                 间的冗余与视觉信息中的噪声量:

                                                                   I
                                                             T
                                                 λ = Sigmoid(W H txt +W H img )                      (12)
                            I
                 其中,  W  T   和  W  是训练参数. 接着, 将门控后的视觉信息融入文本特征中, 得到融合特征              H fused :

                                                                                                     (13)
                                                     H fused = H txt +λ· H img
                    值得注意的是, 本文的方法完全保留了原始文本特征, 这与传统的门控机制有所不同. 其背后的直觉是, 文本
                 信息相比于视觉信息更为重要, 因此本文的设计旨在最大程度保留文本信息, 同时结合视觉模态的基本信息.
                  2.5   定制化评论生成
                    在多模态表示融合完成后, 解码器逐标记地生成输出序列. T5                   解码器与文本编码器结构类似, 均由           L  层相同
   305   306   307   308   309   310   311   312   313   314   315