Page 310 - 《软件学报》2026年第2期
P. 310
强敏杰 等: 结合多模态信息的定制化评论生成 789
从而聚焦于图像的特定部分. 例如, 针对属性词“猪肋排”和情感极性“积极”, TGA 子层能够帮助模型关注图像中包
含猪肋排的部分, 以生成具体的正面评价. 在 TDG 子层中, 通过门控因子 λ 控制保留多少视觉信息, 从而过滤掉冗
余和噪声. 接下来详细介绍融合模块中的各个子层.
图片标题生成
产品图片 产品图片和标题
BLIP-2
盘子上有鲜嫩
多汁的烤猪肋排
多模态信息输入
产品图片
图像标题
输入文本
(猪肋排, 积极) + 盘子上有鲜嫩多汁的烤猪肋排 + 盘子上有洋葱圈和薯条
图 3 图像标题生成
● 文本引导的注意力融合子层 (TGA). 由于视觉表示 H img 的序列长度为 1, 首先使用广播机制将其扩展到与
文本序列一致的长度, 以避免维度不匹配问题. 接着, 将文本表示投影到 Query 空间, 将视觉表示投影到 Key 和
Value 空间, 应用文本引导的注意力机制获取文本引导的视觉特征 Z img :
Q
K
V
Q = H txt W , [K;V] = H img [W ;W ] (8)
Z img = TGA(Q,K,V) (9)
H txt = LN(H txt +Z img ) (10)
K
Q
V
其中, {W ,W ,W } 是训练参数. 随后, H txt 将通过前馈网络子层:
H txt = LN(H txt +FFN(H txt )) (11)
● 文本驱动的门控融合子层 (TDG). 利用门控机制整合来自不同模态的表示. 首先, 通过门控因子 λ 衡量模态
间的冗余与视觉信息中的噪声量:
I
T
λ = Sigmoid(W H txt +W H img ) (12)
I
其中, W T 和 W 是训练参数. 接着, 将门控后的视觉信息融入文本特征中, 得到融合特征 H fused :
(13)
H fused = H txt +λ· H img
值得注意的是, 本文的方法完全保留了原始文本特征, 这与传统的门控机制有所不同. 其背后的直觉是, 文本
信息相比于视觉信息更为重要, 因此本文的设计旨在最大程度保留文本信息, 同时结合视觉模态的基本信息.
2.5 定制化评论生成
在多模态表示融合完成后, 解码器逐标记地生成输出序列. T5 解码器与文本编码器结构类似, 均由 L 层相同

