Page 313 - 《软件学报》2026年第2期
P. 313
792 软件学报 2026 年第 37 卷第 2 期
的整体表现.
此外, 本文提出的模型在所有基准模型中表现出显著优势 (统计显著性 p<0.05). 这一结果不仅验证了模型的
有效性, 同时也突显了多模态评论生成框架的优势. 该框架通过融合图像标题生成和文本引导的方式, 充分利用多
模态信息, 在复杂的实际应用场景中实现了更高的性能和更好的用户体验.
表 2 对比实验结果
模型 ROUGE-1 ROUGE-2 ROUGE-L BLEU-1 BLEU-4 Meteor
Opword 7.81 3.97 7.81 0.03 0.03 2.06
T5 29.34 6.85 18.78 24.76 12.16 16.95
语言模型 BART 29.18 6.59 19.09 24.83 12.23 16.74
LLaMA 26.97 6.48 19.02 21.81 11.28 15.02
GPT-4o 27.57 6.02 18.23 22.70 11.40 15.63
ViT-GPT2 23.84 3.20 15.41 16.86 9.57 15.98
视觉模型 GIT 24.33 3.15 16.60 21.05 10.15 14.11
Pix2Struct 25.31 2.38 16.14 21.78 10.07 14.01
BLIP-2 30.25 7.58 20.61 21.02 9.50 15.25
LLaVA-1.5 30.57 8.10 20.49 22.65 10.25 16.12
多模态模型 Selective-Attn 30.23 6.79 19.00 25.23 12.14 17.44
VLP-MABSA 29.81 8.76 22.73 23.25 11.94 17.40
AoM 30.40 9.14 23.71 21.70 10.67 16.79
Ours 31.76 7.65 19.99 26.90 12.73 18.57
3.4 人工评价
本节将从 5 个维度对本文模型与基准模型生成的定制化评论进行全面的人工评价. (1) 流畅度: 评估评论中的
语法准确性、表达流畅性以及整体语言的可读性, 衡量生成文本的文法和风格的一致性. (2) 信息量: 衡量定制化
评论与参考评论之间关键信息的重合程度, 评估生成内容的准确性和信息完整性. (3) 自然度: 评估生成的定制化
评论在语言风格上与人类写作的评论的相似度, 判断其是否具有人类表达的特征. (4) 情感相关度: 评估生成评论
在情感表达上与参考评论的契合度, 分析情感传递的一致性. (5) 多样性: 衡量定制化评论在词汇选择、句子结构
以及表述方式上的变换能力, 分析模型生成的评论内容是否重复、缺乏创意性. 为了确保评估的客观性与可靠性,
我们邀请了 3 名人工标注员对测试集中生成的定制化评论进行评分, 每个维度的评分范围为 1–5 分. 人工评价结
果如表 3 所示.
表 3 人工评价结果
模型 流畅度 信息量 自然度 情感相关度 多样性
T5 3.78 3.90 3.94 3.45 2.83
GPT-4o 4.28 3.67 4.17 4.03 3.97
LLaMA 4.02 3.54 3.92 3.89 3.51
Pix2Struct 3.02 2.17 3.21 2.50 2.12
BLIP-2 4.18 4.26 4.02 4.14 3.83
Ours 4.68 4.76 4.49 4.55 4.23
如表 3 所示, 在评估定制化评论的生成质量时, 本文提出的模型在所有评估维度上均优于其他基准模型. 特别
是在情感相关度方面, 本文模型以 4.55 的分数, 展现了显著的优越性. 这一结果表明, 本文模型在捕捉和表达定制
评论中的情感细节方面具有较高的准确率和敏感性. 此外, 本文模型在多样性维度上的表现也优于其他基准模型.
这一结果表明, 本文模型在生成评论时不仅能够保持上下文的关联性, 还能够展现出丰富的词汇多样性和灵活的
表达方式. 这一能力尤其重要, 因为用户评论的多样性直接关系到模型的应用前景. 在流畅度、信息量以及自然度
方面, 本文模型同样表现出较高的得分, 这些都进一步证明了本文融合策略在理解和生成复杂内容方面的有效性.
例如, 本文模型在流畅度上的评分为 4.68, 领先单模态模型中的最高分 (GPT-4o 模型的 4.28), 这体现了它在语言

