Page 316 - 《软件学报》2026年第2期
P. 316

强敏杰 等: 结合多模态信息的定制化评论生成                                                           795


                 值得注意的是, 当图像数量达到一定程度后, 性能增长开始放缓, 并在图像数量为                        5  时略有下降. 这表明在一定数
                 量之后, 额外的图像可能不再带来性能的线性提升, 甚至可能引起信息过载, 从而影响模型的处理效率和输出质量.
                    总之, 图像的数量对生成的定制评论质量起着关键作用. 实验结果强调了适当数量的图像可以显著提升生成
                 评论的总体质量和有效性, 但同时也揭示了过多图像可能导致的效益递减.
                  3.9   实例分析
                    本节展示了一个来自测试数据的样本, 用于比较本文提出的模型与其他基准模型生成的定制评论的质量. 图                                  6
                 清晰地揭示了不同模型在评论生成上的表现差异.


                             实例分析

                                                参考
                                                评论
                           (汉堡包, 积极)
                           (burger, positive)
                             用户偏好                T5




                                               BLIP-2



                                                Ours
                             产品图片

                                             图 6 本文模型与基线模型的实例分析图

                    首先, 单模态预训练模型        (例如  T5) 在生成的评论中提供的信息量较少, 不能充分覆盖参考评论中的关键信
                 息. 这种模型虽然能生成结构合理的评论, 但在内容丰富性和细节上往往显得有所欠缺.
                    相比之下, BLIP-2   和本文的模型都显示出了对参考文献信息的全面理解和传达. 特别是, BLIP-2                     模型虽然描
                 述了洋葱圈的美味, 但其情感表达与参考文献中的情绪不完全匹配. 而本文的模型则在这方面做得更好, 不仅准确
                 捕捉了洋葱圈“稍微干燥”的细节, 也与参考评论中的观点保持了高度一致, 展现了其在情感表达上的精准度. 总的
                 来说, 本文的模型在生成评论时不只是信息全面, 还能精准表达情感. 这使得本文的模型更能满足用户的需求, 提
                 高了用户体验.
                  4   总 结

                    本文提出了一项名为“多模态定制化评论生成”的新任务, 旨在基于产品图像和用户偏好生成定制化评论. 为
                 此, 本文提出了一种基于预训练语言模型的多模态评论生成框架. 该框架为了在文本和图像模态之间建立无缝连
                 接, 引入了一个图像标题生成组件. 此外, 在框架中还设计了一个由文本驱动的融合模块. 该模块进一步优化了不
                 同模态间的交互, 确保生成的评论在语义上的连贯性和情感上的一致性. 实验结果充分验证了本文模型的有效性.
                 与传统的基准模型相比, 本文模型不仅提升了评论的信息量和准确性, 而且这些评论更能满足用户的多元化需求.

                 References
                  [1]   Qiu G, Liu B, Bu JJ, Chen C. Opinion word expansion and target extraction through double propagation. Computational Linguistics,
                     2011, 37(1): 9–27. [doi: 10.1162/coli_a_00034]
   311   312   313   314   315   316   317   318   319   320   321