Page 311 - 《软件学报》2026年第2期
P. 311

790                                                        软件学报  2026  年第  37  卷第  2  期


                 的子层组成, 但在每层中增加了一个多头交叉注意力子层                   (multi-headed cross-attention, MCA). 在每个解码时间步
                                      O ℓ  通过以下公式计算:
                 t, 第  ℓ 层解码器的隐藏状态

                                                    ′
                                                   O = LN(MSA(O ℓ−1 ))+O ℓ−1                         (14)
                                                    ℓ
                                                              ′
                                                                      ′
                                                 O = LN(MSA(O ,H fused )+O )                         (15)
                                                   ′′
                                                   ℓ          ℓ       ℓ
                                                                ′′
                                                                    ′′
                                                    O ℓ = LN(FFN(O )+O )                             (16)
                                                                ℓ
                                                                    ℓ
                    生成的输出序列以结束标记“</s>”结尾. 最终, 整个序列的条件概率                 p(y|I,T) 通过每一步的概率     p(y t |y <t ,I,T;θ)
                 计算得到:

                                                           |y|
                                                          ∏
                                                  p(y|I,T) =  p(y t |y <t ,I,T;θ)                    (17)
                                                          t=1

                                                                 o
                                                                       o
                                                 p(y t |y <t ,I,T;θ) = σ(W O L,t +b )                (18)
                        o
                          o
                 其中,  {W ,b } 是可训练参数,  σ(·) 是  Softmax 函数,  y <t = y 1 ...y t−1  和  p(y t |y <t ,I,T;θ) 是通过  Softmax 归一化的目标词
                 汇表上的概率.
                  3   实 验
                    本节中进行了大量的实验以评估本文提出模型的性能. 此外, 还提供了各种分析和讨论, 以展示本文模型的有
                 效性.
                  3.1   数据与设置
                    本文构建了一个新的数据集, 用于多模态定制化评论生成任务. 该数据集基于                         Gest [46] . Gest 数据集主要来自
                 Google Local (即谷歌地图) 的餐馆评论和图片. 数据收集过程采用了广度优先搜索算法, 目标是从餐馆页面抓取评
                 论和相关的用户生成的图片. 在数据收集后, 移除评论长度小于                   5  个单词的记录以及超过       10  张图片的评论, 最后
                 划分成了两个子集       Gest-s1  和  Gest-s2. 其中, Gest-s2  经过了人工标注, 确保每个图像-文本对能够准确地反映图像
                 的内容, 因此本文选择      Gest-s2  作为基础数据集. 本文数据集中的每条评论文本至少拥有一张对应的图像. 随后, 使
                             [3]
                 用情感分析模型 提取情感元素, 并将其作为用户偏好的输入. 数据集的统计信息详见表                          1. 实验中, 本文随机选取了
                 4 000  个样本作为训练集, 500  个样本作为开发集, 其余样本用作测试集.

                                                   表 1 数据集的统计数据

                                                类别                         数量
                                          每个样本的平均图片数                       2.29
                                         每个样本的平均输入字数                       4.99
                                            定制化评论的长度                      47.62
                                             数据样本总数                        5 000

                    本文使用    T5-Base 和  ViT  作为基座模型, 并使用   Adam [47] 作为优化器在动量   β = 1 的条件下去微调超参数. 本
                 文模型的学习率被设置为         0.000 1, Batch  大小设置为  4, 共进行  20  轮训练. 为了生成更高质量的评论, 本文使用了
                 束搜索   (beam search) 技术, Beam  大小设置为  5  并限制了重复  n-grams 大小为  3 [48] . 所有实验均在  NVIDIA Tesla
                 V100 16 GB  显卡上完成.
                    本文在实验中采用了        3  种主流的自动评估指标, 即       ROUGE [49] 、BLEU [50] 和  Meteor [51] , 以全面评估模型生成的
                 文本质量. 这些指标分别从不同的角度对生成内容进行量化分析: ROUGE                      主要关注生成文本与参考文本之间的
                 重叠情况, BLEU   则衡量生成文本与参考文本在词序上的相似度, 而                 Meteor 则综合考虑了词形变化和语义匹配的
                 因素. 通过这些指标, 对模型生成的评论质量进行了细致分析, 验证了本文模型在实际应用中的有效性.
                  3.2   基准模型
                    为了评估在多模态定制化评论生成任务上的表现, 本文选取了几种基准模型在数据集上进行了微调并对比,
   306   307   308   309   310   311   312   313   314   315   316