Page 97 - 《软件学报》2026年第5期
P. 97
1976 软件学报 2026 年第 37 卷第 5 期
特征处理和个性化推荐方面展现了强大的优势, 并且在实际应用中具有很高的可行性和适用性. 它不仅提升了推
荐系统的性能, 还为复杂场景下的专利转让推荐提供了一种有效的解决方案.
为了进一步分析 MHGN 的推理性能, 本文对 MHGN 和各个基线方法完成一个轮次训练的时间进行对比实
验, 具体结果如表 4 所示. 可以看到, 推荐性能最接近 MHGN 的基线方法 LATTICE 所需的推理时间最长; GRCN
虽然推理花费的时间最短, 但 GRCN 整体推荐性能明显落后于 MHGN. MGCN、FREEDOM、DRAGON 使用的
推理时间与 MHGN 最为接近, 但推荐性能上均落后于 MHGN, 可以进一步看出本文模型在专利推荐场景中的优
越性.
表 4 MHGN 及基线模型的推理时间比较 (ms)
模型 专利-666 专利-1446 专利-3911 专利-24168
[44]
DualGNN 184.731 195.367 201.553 193.551
[46]
LATTICE 264.807 284.198 787.043 7 216.047
[53]
MGCN 26.697 21.763 23.869 21.589
BM3 [54] 102.173 81.853 80.007 74.624
FREEDOM [47] 27.768 28.045 27.943 27.514
DRAGON [49] 26.352 26.329 26.386 27.472
GRCN [45] 9.857 6.667 16.765 50.003
MG [55] 132.922 119.79 122.253 109.883
MHGN 26.483 27.201 17.332 108.444
3.6 消融实验
本节主要介绍 MHGN 的消融实验情况, 分别研究适配向量、注意力机制、图像编码器、文本模态、图像模
态、多模态融合方式等模块组件在模型中的作用. 为此, 本文构建了 9 个变体模型: MHGN-c1 去掉了适配向量, 以
评估适配向量在多模态特征融合中的作用; MHGN-c2 去掉了注意力机制, 旨在分析注意力机制对模型性能的贡献;
MHGN-c3 则同时去掉了适配向量和注意力机制, 以探讨这两者在模型中的共同效果; MHGN-c4 将 ViT 图片编码
器替换为 ResNet, 以评估 ViT 编码器对专利图片的适用性; MHGN-c5 去掉了文本模态的表征, 分析文本模态数据
对模型的作用, 类似地, MHGN-c6 去掉了图像模态数据, 分析图像模态数据的重要性. 为了分析文本和图像的特征
融合方式对 MHGN 模型的影响, 设计了 3 种不同融合方式的变体, 其中, MHGN-c7、MHGN-c8、MHGN-c9 分别
为向量相加、门控融合和注意力机制融合方式.
从表 5 的实验结果可以看出, 各变体的性能均较完整模型有所下降, 验证了适配向量和注意力机制对模型效
果的关键性作用. 具体来说, 当去掉适配向量时 (MHGN-c1), 模型在所有数据集上的 AUC 和 ACC 指标均显著下
降, 这表明适配向量在减少多模态特征噪声、增强特征融合方面发挥了重要作用. 同样, 当去掉注意力机制时
(MHGN-c2), 模型的整体表现也有所下降, 说明注意力机制在突出重要特征、提高推荐准确性方面具有明显优势.
当同时去掉适配向量和注意力机制时 (MHGN-c3), 模型的性能同样都显著降低. 综合来看, 适配向量和注意力机
制的引入有效地提升了多模态特征的学习能力和模型的整体表现, 在专利转让推荐任务中发挥了关键作用. 最后,
将 ViT 替换为 ResNet 后 (MHGN-c4), 模型在 4 个数据集上的性能均显著下降. 专利图片通常包含复杂的图形和
文本信息, 这些信息的长距离依赖特性可能对 ViT 的自注意力机制更为适合. 这体现了 ViT 在专利图片处理上表
现出的显著优势, 因此在专利相关任务中使用 ViT 作为图片编码器更为有效.
当去掉图像模态数据, 仅保留文本单模态数据及表征 (MHGN-c5) 时, 可以看到推荐性能下降非常明显, 在数
据集“专利-3911”中性能几乎下降了一半, 说明图像数据表征在 MHGN 中具有重要作用. 类似地, 当去掉文本数据,
仅保留图像单模态数据及表征 (MHGN-c6) 时, 整体推荐性能有所下降, 但下降幅度略优于 MHGN-c5, 并没有出
现 MHGN-c5 的情况. 此外, 在文本表征与图像表征的融合方式上, MHGN 采用的拼接方法具有较好的性能.

