Page 306 - 《软件学报》2026年第2期
P. 306
强敏杰 等: 结合多模态信息的定制化评论生成 785
能撰写的定制化评论. 而这种定制化评论能够根据用户的个人偏好提供特定产品的简要总结, 帮助用户快速了解
产品信息.
因此, 本文提出了一个全新的任务: 多模态定制化评论生成, 其旨在针对未被评论的产品, 根据用户提供的偏
好以及产品图片生成定制化评论. 通过分析定制化评论, 用户可以深入了解到特定产品围绕个人偏好的相关信息.
如图 1 所示, 展示了基于用户偏好和产品图片生成定制化评论的示例. 模型通过分析用户的偏好信息, 了解到用户
喜欢猪肋排和薯条, 并对这些食物持积极的情感倾向. 同时, 模型还获取了商家的产品图片, 从而进一步了解菜品
的细节, 如份量和色泽等. 结合以上信息, 模型为用户生成了一条与其个人偏好及产品图片相契合的定制化评论.
用户偏好
(猪肋排和薯条, 积极) 评论
这家餐厅非常好吃! 烤猪肋排看起
产品图片 来色泽诱人, 表面均匀涂抹的酱汁
输入 生成
让人垂涎欲滴。他们的小食拼盘
非常丰富, 有酥脆的薯条、
炸洋葱圈, 以及其他配菜,
模型 给我满满一盘的满足感!
定制化评论
多模态信息
图 1 基于用户偏好和产品图片生成定制化评论的示例
生成定制化评论的一个直接方法是使用产品的图片. 然而, 仅凭图片无法完全描述产品的详细信息或有效传
达关于产品的看法. 因此, 本文提出将图片与用户偏好结合使用, 以生成更全面和定制化的评论. 这里的用户偏好
包括了与产品相关的属性词和情感倾向, 有助于详细阐述产品特点并反映用户的真实感受. 这种视觉和文本信息
的整合使得评论更加完整和细致, 准确捕捉产品的特征和用户的意见.
近年来, 预训练模型 [7,8] 在多模态任务中表现出显著的优势. 通过将多种预训练模型进行结合, 能够有效地处
理文本与图片数据, 这些模型利用大规模数据集进行预训练, 提前学习不同模态下的语义知识, 从而更好地捕捉文
本与图像之间的复杂关系及潜在信息. 因此, 本文采用了预训练模型 T5 和 [9] ViT [10] 作为基础模型, 构建了一个多模
态预训练语言模型. 该模型能够同时处理视觉和文本信息. 首先, 本文采用了 BLIP-2 [11] 模型为每张产品图片生成
标题, 以弥合文本和图像之间的差距. 随后, 将产品图片、用户偏好和生成的图片标题组合, 作为模型输入送入编
码器. 接下来, 将编码后的视觉和文本向量表示输入到一个基于文本引导的融合模块中, 该模块能够有效融合多种
模态的信息. 最后, 模型根据融合模块输出的向量表示生成定制化评论. 实验结果表明, 本文提出的模型在指标上
优于对比基准模型. 总体而言, 本文探索并证明了多模态预训练语言模型通过结合视觉与文本信息有效生成定制
化评论的可行性, 为该领域未来研究奠定了基础.
本文的主要贡献如下.
● 提出了一种新的多模态定制化评论生成任务, 旨在针对未被评论的产品, 根据用户提供的偏好以及产品图
片生成定制化评论.
● 提出了一个基于预训练模型的多模态评论生成框架, 其中包括多模态信息编码、图片标题生成和基于文本
引导的融合模块.
● 为了评估模型的有效性, 本文进行了一系列对比与消融实验, 研究了模型各组件的性能与作用. 实验结果表
明, 相比于其他最新的基准模型, 本文在 ROUGE、BLEU 和 Meteor 这 3 个评价指标上均有较大的提升.
1 相关工作
1.1 情感分析与推荐系统
早期的情感分析研究主要集中在文档级情感分类上 [12−15] , 这种方法涉及分析整个文档, 以判断其表达的总体

