Page 311 - 《软件学报》2026年第2期
P. 311
790 软件学报 2026 年第 37 卷第 2 期
的子层组成, 但在每层中增加了一个多头交叉注意力子层 (multi-headed cross-attention, MCA). 在每个解码时间步
O ℓ 通过以下公式计算:
t, 第 ℓ 层解码器的隐藏状态
′
O = LN(MSA(O ℓ−1 ))+O ℓ−1 (14)
ℓ
′
′
O = LN(MSA(O ,H fused )+O ) (15)
′′
ℓ ℓ ℓ
′′
′′
O ℓ = LN(FFN(O )+O ) (16)
ℓ
ℓ
生成的输出序列以结束标记“</s>”结尾. 最终, 整个序列的条件概率 p(y|I,T) 通过每一步的概率 p(y t |y <t ,I,T;θ)
计算得到:
|y|
∏
p(y|I,T) = p(y t |y <t ,I,T;θ) (17)
t=1
o
o
p(y t |y <t ,I,T;θ) = σ(W O L,t +b ) (18)
o
o
其中, {W ,b } 是可训练参数, σ(·) 是 Softmax 函数, y <t = y 1 ...y t−1 和 p(y t |y <t ,I,T;θ) 是通过 Softmax 归一化的目标词
汇表上的概率.
3 实 验
本节中进行了大量的实验以评估本文提出模型的性能. 此外, 还提供了各种分析和讨论, 以展示本文模型的有
效性.
3.1 数据与设置
本文构建了一个新的数据集, 用于多模态定制化评论生成任务. 该数据集基于 Gest [46] . Gest 数据集主要来自
Google Local (即谷歌地图) 的餐馆评论和图片. 数据收集过程采用了广度优先搜索算法, 目标是从餐馆页面抓取评
论和相关的用户生成的图片. 在数据收集后, 移除评论长度小于 5 个单词的记录以及超过 10 张图片的评论, 最后
划分成了两个子集 Gest-s1 和 Gest-s2. 其中, Gest-s2 经过了人工标注, 确保每个图像-文本对能够准确地反映图像
的内容, 因此本文选择 Gest-s2 作为基础数据集. 本文数据集中的每条评论文本至少拥有一张对应的图像. 随后, 使
[3]
用情感分析模型 提取情感元素, 并将其作为用户偏好的输入. 数据集的统计信息详见表 1. 实验中, 本文随机选取了
4 000 个样本作为训练集, 500 个样本作为开发集, 其余样本用作测试集.
表 1 数据集的统计数据
类别 数量
每个样本的平均图片数 2.29
每个样本的平均输入字数 4.99
定制化评论的长度 47.62
数据样本总数 5 000
本文使用 T5-Base 和 ViT 作为基座模型, 并使用 Adam [47] 作为优化器在动量 β = 1 的条件下去微调超参数. 本
文模型的学习率被设置为 0.000 1, Batch 大小设置为 4, 共进行 20 轮训练. 为了生成更高质量的评论, 本文使用了
束搜索 (beam search) 技术, Beam 大小设置为 5 并限制了重复 n-grams 大小为 3 [48] . 所有实验均在 NVIDIA Tesla
V100 16 GB 显卡上完成.
本文在实验中采用了 3 种主流的自动评估指标, 即 ROUGE [49] 、BLEU [50] 和 Meteor [51] , 以全面评估模型生成的
文本质量. 这些指标分别从不同的角度对生成内容进行量化分析: ROUGE 主要关注生成文本与参考文本之间的
重叠情况, BLEU 则衡量生成文本与参考文本在词序上的相似度, 而 Meteor 则综合考虑了词形变化和语义匹配的
因素. 通过这些指标, 对模型生成的评论质量进行了细致分析, 验证了本文模型在实际应用中的有效性.
3.2 基准模型
为了评估在多模态定制化评论生成任务上的表现, 本文选取了几种基准模型在数据集上进行了微调并对比,

