Page 316 - 《软件学报》2026年第2期
P. 316
强敏杰 等: 结合多模态信息的定制化评论生成 795
值得注意的是, 当图像数量达到一定程度后, 性能增长开始放缓, 并在图像数量为 5 时略有下降. 这表明在一定数
量之后, 额外的图像可能不再带来性能的线性提升, 甚至可能引起信息过载, 从而影响模型的处理效率和输出质量.
总之, 图像的数量对生成的定制评论质量起着关键作用. 实验结果强调了适当数量的图像可以显著提升生成
评论的总体质量和有效性, 但同时也揭示了过多图像可能导致的效益递减.
3.9 实例分析
本节展示了一个来自测试数据的样本, 用于比较本文提出的模型与其他基准模型生成的定制评论的质量. 图 6
清晰地揭示了不同模型在评论生成上的表现差异.
实例分析
参考
评论
(汉堡包, 积极)
(burger, positive)
用户偏好 T5
BLIP-2
Ours
产品图片
图 6 本文模型与基线模型的实例分析图
首先, 单模态预训练模型 (例如 T5) 在生成的评论中提供的信息量较少, 不能充分覆盖参考评论中的关键信
息. 这种模型虽然能生成结构合理的评论, 但在内容丰富性和细节上往往显得有所欠缺.
相比之下, BLIP-2 和本文的模型都显示出了对参考文献信息的全面理解和传达. 特别是, BLIP-2 模型虽然描
述了洋葱圈的美味, 但其情感表达与参考文献中的情绪不完全匹配. 而本文的模型则在这方面做得更好, 不仅准确
捕捉了洋葱圈“稍微干燥”的细节, 也与参考评论中的观点保持了高度一致, 展现了其在情感表达上的精准度. 总的
来说, 本文的模型在生成评论时不只是信息全面, 还能精准表达情感. 这使得本文的模型更能满足用户的需求, 提
高了用户体验.
4 总 结
本文提出了一项名为“多模态定制化评论生成”的新任务, 旨在基于产品图像和用户偏好生成定制化评论. 为
此, 本文提出了一种基于预训练语言模型的多模态评论生成框架. 该框架为了在文本和图像模态之间建立无缝连
接, 引入了一个图像标题生成组件. 此外, 在框架中还设计了一个由文本驱动的融合模块. 该模块进一步优化了不
同模态间的交互, 确保生成的评论在语义上的连贯性和情感上的一致性. 实验结果充分验证了本文模型的有效性.
与传统的基准模型相比, 本文模型不仅提升了评论的信息量和准确性, 而且这些评论更能满足用户的多元化需求.
References
[1] Qiu G, Liu B, Bu JJ, Chen C. Opinion word expansion and target extraction through double propagation. Computational Linguistics,
2011, 37(1): 9–27. [doi: 10.1162/coli_a_00034]

