Page 95 - 《软件学报》2026年第5期
P. 95
1974 软件学报 2026 年第 37 卷第 5 期
表 2 实验数据集统计信息
数据集名称 企业数量 专利数量 交互数 密度 (%)
专利-666 240 666 333 0.208
专利-1446 265 1 446 725 0.189
专利-3911 539 3 911 1 955 0.093
专利-24168 3 017 24 168 12 084 0.017
本文从专利原文中提取了文本和图像信息, 并对已授权的专利, 收集了其对应转让企业的信息. 为了进一步提
取出有效信息, 本文对专利数据和企业数据进行了预处理, 提炼出专利数据中所包含的专利号、摘要、关键字、
权利要求书等文本信息作为文本属性, 将专利的摘要图作为预处理图像. 另外, 本文从企业查询信息平台中获取企
业信息, 并抽取企业信息中的企业名称、经营范围、简介、行业归属和标签等字段作为企业的属性, 根据第 2 节
方法中的预训练模型对专利的多模态属性和企业属性进行特征提取.
3.2 对比方法
为了充分验证所提出模型的效果, 本文选取了以下几种先进的多模态推荐模型进行实验对比.
(1) DualGNN [44] : 从用户-项目二部图中构建一个额外的用户-用户相关图, 并利用它来融合相关图中邻居的用
户表征.
(2) LATTICE [46] : 该方法着重于项目的多模态特征, 对每个模态分别构造项目-项目图, 通过融合项目-项目图
的多模态特征来挖掘项目之间的潜在结构. 接着对项目-项目图和用户-项目交互图进行图卷积操作, 以学习用户
和项目表征.
(3) MGCN [53] : 该方法首先利用商品行为信息进行去噪以提高特征区分度, 同时设计了行为感知融合器来自适
应学习不同模态特征的相对重要性, 可以全面建模用户偏好.
(4) BM3 [54] : 该方法采用自监督的多模态推荐算法, 通过利用简单的随机删除增强方法从用户和商品的表征
中提升潜在的对比视图, 然后重构用户-商品交互图并调整模态特征, 在跨模态和单模态视角下学习用户和商品的
表征.
(5) FREEDOM [47] : 该方法是对 LATTICE 的改进, 它认为 LATTICE 的潜在图结构学习是无效的和非必要的.
因此冻结了项目-项目图, 同时对多模态推荐中的用户-项目交互图进行去噪, 增强了用户和项目的表征.
(6) DRAGON [49] : 该方法基于经常交互的项目构建用户-用户图, 并从项目多模态特征构建项目-项目图. 然后,
利用图学习的用户-项目异构图 (二部图) 和同构图 (用户-用户和项目-项目), 以获得用户和项目的双重表征.
(7) GRCN [45] : 该方法通过改进的 GCN 网络自适应地修正用户-项目交互图, 剪枝潜在的误报的边, 从而能更
好地利用图卷积网络提取有意义的用户偏好信号, 提高推荐性能.
(8) MG [55] : 该方法是一种面向多模态推荐系统的优化方法, 采用了一种称为“镜像梯度 (mirror gradient)”的优
化策略, 在优化过程中通过梯度策略增强推荐模型的鲁棒性, 减轻来自多模态信息输入的不稳定影响.
3.3 实验设置
在本文中, 所提出方法的实验运行在一个 80 GB 的 NVIDIA A100 GPU 上, 使用 PyTorch 框架实现本文所提
模型. 对于不同的专利数据集, 为获得最优的实验效果, 会赋予不同的参数设置, 学习率在{0.000 1, 0.001, 0.01}范
围内调整, 批大小 batch_size 在{16, 64, 128, 256}范围内调整, 随机失活值 dropout 在{0.2, 0.3, 0.4, 0.5, 0.6, 0.7}范
围内调整. 对于所有基线方法, 为获得最佳推荐结果, 按照文献的建议和实验配置调整最佳参数.
此外, 所有对比模型的多模态特征均由预训练模型得到, 为了公平地比较模型的实验性能, 本文遵循各模型所
用的预训练方法, 对专利和企业数据特征提取, 其中 DualGNN 的文本预训练模型采用 Sentance2Vector [56] , 图像预
训练模型采用 ResNet50 [57] , 其余基线模型均采用文本预训练模型 Sentence-BERT [58] 和图像预训练模型 Caffe [59] . 为
了保持一致性, 本文将所有方法的文本特征和图像特征维度统一设置为 1 024.

