Page 308 - 《软件学报》2026年第2期
P. 308
强敏杰 等: 结合多模态信息的定制化评论生成 787
论, 输出是属性词或情感词; 在推荐系统中, 输入通常是用户或商品的 ID, 并基于历史评论推断用户偏好和商品属
性, 输出是推荐结果及理由; 在评论摘要生成任务中, 输入是完整的评论文本, 输出是精简的摘要; 而在虚假评论检
测任务中, 输入是已有的评论, 目标是判断评论的真实性. 相比之下, 本文的任务输入为用户偏好和产品图像, 输出
是基于这些信息生成的定制化评论. 本文任务的重点在于为尚未评论的产品生成评论, 且仅使用用户偏好和产品
图像作为输入, 从而确保评论的个性化和相关性. 这使得本文的任务不仅不同于传统的定制化评论生成方法 (通常
依赖历史数据或用户档案), 而且避免了评论摘要生成和虚假评论检测任务中对于已有评论的依赖.
2 基于预训练模型的多模态评论生成
本文研究了一项新任务: 多模态定制化评论生成. 该任务根据用户偏好和相关图像为产品生成定制化评论. 形
式上, 该任务的输入是一个元组 {I,T}, 其中, I = {I 1 ,I 2 ,...,I n } 表示产品图像, T = {T 1 ,T 2 ,...,T n } 表示描述用户偏好的
输入词. 本文的模型输出为一个定制化评论 C. 该评论为产品提供了详细且定制化的描述. 这一任务具有较高的挑
战性, 因为评论需要根据特定产品和用户偏好进行定制, 这使得任务变得复杂, 要求对语言和视觉信息有深入的
理解.
如图 2 所示, 本文提出一种基于预训练语言模型的多模态评论生成框架, 以应对上述挑战. 为了在文本和图像
模态之间建立无缝连接, 框架引入一个图像标题生成模块. 该模块为图片生成描述性且与上下文相关的标题. 随
后, 利用文本编码器将输入文本转化为丰富的文本特征表示, 并采用图像编码器将相应图片编码为视觉特征表示.
接着, 利用基于文本引导的融合模块来整合文本和视觉特征表示. 最终, 融合后的向量表示被输入到解码器中, 用
于生成定制化评论. 为了实现良好的参数初始化, 本文采用 T5 和 ViT 作为基础模型, 两者均为基于 Transformer
结构的预训练模型, 已从广泛的数据集中获取了丰富的语义知识. 接下来将详细描述各个模块的具体实现.
TGA 基于文本引导的融合模块
MatMul TDG
Text-driven MatMul
H img
gated fusion
MatMul Feed forward λ H fused
Q K V Text-guided
H txt
attention
文本 图像
0 1 2 3 M 1 ··· N N+1 N+K
I L I L I L I L I L T L T L T L ··· T L 文本解码器
Feed forward
Feed forward Feed forward
ViT ×L T5 ×L
Self attention Self attention Cross attention ×L
Masked
··· T 1 ··· T N T N+1 ··· T N+K self attention
图像块 用户偏好 图片标题
这家餐厅非常好吃! 烤猪肋排看起来色
盘子上有鲜嫩 泽诱人, 表面均匀涂抹的酱汁让人垂涎
(猪肋排, 积极) 多汁的烤猪肋排 欲滴。他们的小食拼盘非常丰富, 有酥
脆的薯条、炸洋葱圈, 以及其他配菜,
用户偏好 图片标题 给我满满一盘的满足感!
产品图片 多模态信息输入 定制化评论
图 2 基于预训练语言模型的多模态评论生成框架
2.1 文本编码器
文本编码器的输入为一段文本 T . 该文本由用户偏好和产品图片标题组成. 用户偏好包括属性词和情感极性,

