Page 312 - 《软件学报》2026年第2期
P. 312
强敏杰 等: 结合多模态信息的定制化评论生成 791
其中包含 Opword、BART [52] 、T5、LLaMA [53] 、GPT-4o [54] 、ViT-GPT2、GIT [55] 、Pix2Struct [56] 、BLIP-2 [11] 、
LLaVA-1.5 [57] 、Selective-Attn [58] 、VLP-MABSA [59] 和 AoM [60] . 下面是这些基准模型的简要介绍.
● Opword: 直接将给定的输入文本作为定制化评论.
● BART: 一个结合了双向编码器和自回归解码器的序列到序列模型. 通过将输入数据进行噪声化处理并恢
复, BART 在文本生成任务中表现出色, 尤其在摘要生成、翻译和文本生成等方面.
● T5: Google 提出的一个将所有 NLP 任务统一为文本到文本格式的模型. T5 的核心思想是将输入和输出都
作为文本进行处理, 使得它能够广泛适用于翻译、摘要、分类和问答等多种任务, 体现了极大的灵活性和强大的
通用性.
● LLaMA: Meta 公司开发的大型语言模型, 旨在提供更高效的计算和内存利用率. LLaMA 模型在多语言处理、
自然语言生成等任务中表现优异, 适合在有限资源下执行复杂的自然语言处理任务.
● GPT-4o: 基于 OpenAI 的 GPT 架构开发的对话生成模型, 通过在大量的文本数据和人类对话数据上进行训
练, 它能够生成连贯且上下文相关的对话. GPT-4o 广泛应用于聊天机器人、客户服务、教育和娱乐等领域.
● ViT-GPT2: 一个多模态模型, 由一个图像编码器 (ViT) 和文本解码器 (GPT2) 组成, 能够基于给定的图像生
成自然语言文本.
● GIT: 一种生成式图像到文本的 Transformer, 用于统一图像/视频字幕和问答等视觉语言任务. 它简化了现有
的多模态编码器/解码器结构, 并在单一语言建模任务下只采用了一个图像编码器和一个文本解码器. 同时, 通过
扩大预训练数据和模型尺寸, 提高了模型性能.
● Pix2Struct: 一种专为纯视觉语言理解设计的预训练图像到文本模型, 适用于对包含视觉情境语言的任务进
行微调. 值得注意的是, Pix2Struct 的预训练任务是通过学习将屏幕截图解析为简化的 HTML 来完成的.
● BLIP-2: 一个大型多模态语言模型, 能够利用预训练的冻结图像编码器和大规模语言模型来指导视觉语言
的预训练. BLIP-2 通过 Querying Transformer 来实现跨模态的对齐, 并在多个视觉语言任务上取得了优异的性能.
● LLaVA-1.5: 一种多模态大模型, 它通过将视觉编码器与大语言模型结合, 能够理解图像内容并进行基于图
像的对话和推理.
● Selective-Attn: 一种利用选择性注意机制增强 ViT 特征融合表示的方法, 旨在增强文本和视觉特征对模型
性能的贡献.
● VLP-MABSA: 一种针对 MABSA 的任务特定视觉语言预训练框架. 该框架是所有预训练和下游任务的统
一多模态编码器-解码器架构. 该框架分别从语言、视觉和多模态设计了 3 种类型的特定任务预训练任务.
● AoM: 设计了一个属性词感知注意模块来同时选择与属性词语义相关的文本标记和图像块. 为了准确聚合
情感信息, 它将情感嵌入引入 AoM 中, 并使用图卷积网络对视觉-文本和文本-文本交互进行建模.
3.3 实验结果与分析
如表 2 所示, 传统单模态方法 (如 T5 和 BART) 在 ROUGE-L 和 BLEU 等指标上表现出较为显著的优势, 其
原因在于语言模型擅长处理文本特定任务, 能够高效建模上下文语义. 然而, 由于其输入仅限于文本, 难以充分捕
捉多模态情境中图像信息的复杂性. 这些方法的输入词汇过于简单, 信息量有限, 无法充分反映评论的具体内容和
情感色彩. 此外, 以语言模型为主的 GPT-4o 尽管因其大规模预训练展现了良好能力, 但在本文任务中的表现略逊
于 T5 和 BART, 其中可能的原因是 GPT-4o 缺乏对该任务的特定优化, 生成结果的可控性较差.
与此同时, 预训练语言模型 (如 T5 和 BART) 在处理复杂信息时的性能通常优于仅依赖图像输入的方法 (如
ViT-GPT2 和 Pix2Struct). 这表明, 文本输入相比图像能够提供更直接且详细的信息, 视觉模型由于仅依赖图像输
入, 表现出显著的局限性, 虽然视觉模型能够捕获图像的底层特征, 但难以生成细粒度的文本描述, 导致 ROUGE
和 BLEU 指标普遍低于语言模型.
值得注意的是, 多模态方法 (如 BLIP-2 和 LLaVA) 在所有单模态方法中表现最佳. 这一结果表明, 多模态信息
在生成任务中的互补性, 文本提供了结构化和明确的语义信息, 图像则补充了丰富的视觉线索, 从而显著提升模型

