Page 314 - 《软件学报》2026年第2期
P. 314
强敏杰 等: 结合多模态信息的定制化评论生成 793
生成的连贯性和语法正确性方面的能力. 而在信息量和自然度上, 多模态模型同样保持了较高的标准, 分别以
4.76 和 4.49 的得分领先于其他模型. 总之, 本文模型在多个方面超越了所有基准模型, 并展示了其生成内容不仅
更加丰富, 而且情感表达更为精确的能力.
3.5 多模态融合策略的影响
本节将深入探讨不同多模态融合策略在生成定制化评论方面的效果. 多模态融合策略的选择对于最终模型的
性能有着决定性影响, 本文评估了以下几种策略: “仅文本”策略仅使用文本数据作为输入, 不考虑任何视觉信息;
“仅图片”策略仅依赖于图像数据, 不利用任何文本信息; “相加策略”通过直接相加文本和图像的表示向量进行简
单的向量融合; “拼接策略”通过拼接文本和图像的表示向量来进行向量融合; “门控机制”代表使用门控机制根据
模型的当前状态动态调整文本和图像信息的贡献度; “注意力机制”表示使用注意力机制融合两个向量, 允许模型
根据上下文动态地聚焦于文本或图像信息的关键部分.
如表 4 所示, 实验结果表明简单的融合方法虽然提供了基本的多模态交互, 但其性能通常不如更复杂的融合
策略. 这表明单纯的向量操作可能无法充分捕捉和利用文本与图像之间的复杂相互作用.
表 4 多模态融合策略的影响
方法 ROUGE-1 BLEU-1 Meteor
仅文本 29.34 24.76 16.95
仅图片 26.59 22.24 14.24
相加 29.81 24.94 16.96
拼接 29.76 25.23 17.14
门控机制 30.33 25.32 17.28
注意力机制 30.74 26.18 17.83
Ours 31.76 26.90 18.57
进一步地, 门控和注意力机制展现出了显著的性能优势. 这些高级融合策略能够更精确地建模不同模态间的
相互依赖, 有效提升信息整合的质量和效率. 门控机制通过调节信息流动优化了信息的选择性整合, 而注意力机制
则通过加权重点信息提高了模型对关键特征的敏感度和反应能力.
最重要的是, 本文提出的多模态融合策略综合了门控和注意力机制的优点, 在所有比较的策略中实现了最高
的性能指标. 这一结果不仅验证了采用复合策略的有效性, 也强调了全面利用和整合多模态数据中丰富信息和关
系的重要性.
3.6 文本输入的影响
表 5 中的实验结果揭示了不同输入提示策略对评论生成性能的显著影响. 本文设计了以下几种场景: “仅图片”表
示模型仅使用图像信息, 不接收任何文本输入; “属性词”表示模型除了图像外, 还融合了用户偏好中的属性词; “情
感倾向”表示模型除了图像外, 还融合了用户偏好中的情感极性; “图片标题”表示模型利用了图像标题, 以提供更
具体的上下文信息.
表 5 文本输入的影响
方法 ROUGE-1 BLEU-1 Meteor
仅图片 26.59 22.24 14.24
+属性词 30.73 26.15 17.79
+情感倾向 27.35 22.95 14.83
+图片标题 28.39 23.86 15.44
+All (Ours) 31.76 26.90 18.57
实验结果表明, 仅依靠图像的模型在所有指标上的表现均较低. 这反映出图像独立使用时, 虽然能提供视觉信
息, 但缺乏足够的语义深度和具体上下文, 不足以支持生成有针对性和丰富性的评论.

