Page 91 - 《软件学报》2026年第5期
P. 91
1970 软件学报 2026 年第 37 卷第 5 期
其中, h ¯ txt 表示单个类型的文本表征, W i 和 b i 分别表示可训练的投影矩阵和偏差项. 最后将所有类型的文本表征进
i
行拼接, 形成企业初始文本表征 c (0) , 过程如下所示:
¯ txt
¯ txt ¯ txt
c (0) = concat[h , h ,..., h ] (3)
1 2 n
2.1.2 专利初始特征编码
对于专利数据而言, 其技术方案通常含有丰富的文本信息和图像信息, 文本提供了详细的专利描述和解释, 而
图像能够直观地展示专利技术方案的结构、流程和工作原理, 因此可以通过多模态融合的方法来进行专利的表
征. 首先, 分别通过单独的预训练模型对专利文本和图像进行表征生成.
(1) 文本表征. 每篇专利的文本信息都可由标题、摘要、关键词、权利要求书等构成, 类似地, 按第 2.1.1 节中
企业的编码方式, 首先通过预训练的 RoBERTa 模型得到专利的各个文本属性表征, 然后经过 MLP 和拼接操作得
到专利的初始文本表征, 记为 p txt .
(2) 图像表征. 专利的图像信息来自专利的摘要图或技术方案图, 通常含有技术方案的模型结构图和方法流程
图. 在文本描述的基础上, 图像信息进一步突出了专利技术方案中各组成部分之间的功能关系和依赖性. 为了更好
224×224 的图片 , 接着, 采用了
I
地进行专利的图像表征, 首先统一对专利图片进行标准化处理, 得到大小一致为
Google 的 Vision Transformer (ViT) [52] 预训练模型来捕捉专利的图像特征, 再通过 MLP 将其投影到固定维度, 对于
I
专利 P 对应的图像 , 特征提取过程如下所示:
h img = ViT(I) (4)
(5)
p img = W img h img + b img
其中, ViT 表示预训练模型, h img 表示 ViT 输出的图像表征. 最终得到了专利的图像初始表征 p img .
采用 ViT 作为图像编码器是由于其能够有效地编码图片中的语义特征, 尤其在处理专利的结构图和设计图
时, 能够更好地提取其中蕴含的结构信息. 相较于传统的卷积神经网络, ViT 可以更充分地捕捉专利的图片信息.
后续消融实验部分也进一步验证了 ViT 在图像特征提取中的优越性, 表明其对提取利用图像特征具有显著作用.
2.2 多模态特征编码
为了捕捉多模态的上下文依赖, 本文分别在不同模态下构造企业-专利交互图, 通过图注意力神经网络来学习
企业的偏好表征.
{ }
根据上述初始特征编码可以得到专利的任意模态表征 p m ∈ p txt , p img 以及企业文本表征 c (0) , 其中, p txt 和 p img
分别表示文本模态和图像模态表征. 首先, 将专利的原始表征投影到度量空间中, 以提取与企业偏好相关的专利表
征, 其计算公式如下:
¯ p m = leaky_ReLU(W m p m + b m ) (6)
其中, leaky_ReLU(·)、 W m ∈ R D×D m 和 b m ∈ R D 分别表示激活函数、可训练权重矩阵和偏置向量. p m 是指模态 m 下
的初始表征, D m 表示原始模态表征的维度, 而 D 是经过投影处理的表征 ¯ p m 的维度.
随后, 引入邻居聚合机制以更好地学习企业偏好. 给定一个企业 c, 通过分析其与邻居节点的相似度, 利用迭
m 为例, 其他模态的处理方法相同. 在初始迭代
代操作逐步调整其表征. 在描述过程中, 为了简洁, 本文以单一模态
中, 将企业初始文本表征 c (0) 作为初始化表征. 分别在每个模态下, 利用企业初始表征和与企业偏好相关的专利表
征 ¯ p m 计算其亲和度分数, 具体公式如下:
( )
T
exp ¯ p c (t−1)
m
p c,p = ∑ ( ) (7)
T
exp ¯ J c (t−1)
m
j∈N (c)
c
c
其中, p c,p 表示企业 与专利 p 之间的亲和度, N (c) 表示企业-专利交互图中企业 的邻居节点集合. 其中, 企业偏
好通过合并企业与邻居专利节点的加权和进行更新, 迭代公式如下:
∑
c (t) = c (t−1) + p c,p ¯ p m (8)
p∈N (c)
通过上述迭代过程, 可以获得企业在模态 m 下的偏好表征, 记 ¯ c m = c (t) (t = 1,2,...,T) 为企业 在模态 m 下的
c

