Page 163 - 《软件学报》2026年第4期
P. 163
1604 软件学报 2026 年第 37 卷第 4 期
效果的能力. 与现有基线相比, 其生成的解释不仅合理可信, 更在人工评估中表现出较高的一致性与可理解度.
在无监督概念可解释方法中, 另一重要方向是基于原型的概念建模. 该类方法通过编码训练样本的局部区域,
自动学习具备代表性的原型概念, 并基于其与输入样本的相似度完成分类. 与显式的符号标签不同, 原型学习方法
赋予模型从特征空间中抽取“具象例子”的能力, 不同研究对原型施加了多样的结构约束与语义属性, 从而呈现出
更丰富的可解释机制.
Chen 等人 [24] 在 2019 年提出的原型部件网络 (ProtoPNet) 是该方向的开创性工作, 框架图如图 6 所示. 该方法
通过识别图像中典型部位并聚合原型证据进行分类, 模拟了人类识别中的“比对典型特征”过程. ProtoPNet 利用卷
积特征 z ∈ R H×W×D 与原型 p j ∈ R 1×1×D 之间的相似度生成激活图, 原型层计算公式如下.
( 2 )
||˜z−p j || +1
g p j (z) = max log 2 .
2
˜ z∈patches(z) ||˜z−p j || +ε
2
该式得分越高, 代表图像中某部分越接近该原型. 原型激活图通过全局最大池化获得概念匹配得分, 最终以线
性加权输出预测结果. 经典的 ProtoPNet 网络训练过程分为 3 个阶段.
● 阶段 1, 原型表示学习: 优化卷积网络 f 和原型层 P, 固定全连接层权重 ω h . 该阶段使用交叉熵损失、类内
聚集损失和类间分离损失联合优化, 其中 P 为集合, { } m .
P = p j j=1
1 ∑
1 ( )
min CrossEntropy h◦g p ◦ f (x i ),y i +λ 1 Clst+λ 2 Sep
P,ω conv n i=1
1 n ∑ 1 n ∑ .
2 2
Clst = min min ||z−p j || ; Sep = − min min ||z−p j ||
2 2
n j:p j ∈P y i z∈patches( f(x i )) n j:p j <P y i z∈patches( f(x i ))
i=1 i=1
● 阶段 p j “推”到与其最近的训练样本 latent patch 上, 使其可视化:
2, 原型投影: 将每个原型
← argmin||z−p j || 2
p j
z∈Z j .
Z j = {˜z : ˜z ∈ patches( f (x i )), ∀i, s.t. y i = k}
● 阶段 ω h , 鼓励基于自身类别原型进行分类:
3, 基于原型的分类: 使用带 l 1 正则项调整全连接层权重
1 n ∑ ( ) K ∑ ∑
min CrossEntropy h◦g p ◦ f (x i ),y i +λ 3 ω (k,j) .
ω h n h
i=1 k=1 j:p j <P k
Max pool
3.954 5.030 Black footed albatross
p 1 g p 1
5.443 Indigo bunting
1.447 4.738 Cardinal
p 2 g p 2
27.895 Clay colored sparrow
··· ··· ···
···
2.617 5.662 Common yellowthroat
Similarity score
p m g p m
Convolutional layers f Prototype layer g p Fully connected layer h Output logits
图 6 ProtoPNet 网络框架图 [24]
图 7 中展示了 ProtoPNet 模型在图像分类中的推理过程, 该模型通过原型比对的方式实现可解释性分类. 具
体而言, 输入图像首先经过卷积网络提取特征, 再与预先学习到的多个原型进行匹配, 每个原型代表某类典型局部
特征 (如鸟的喙或羽毛纹理). 模型在输入图像中定位与各原型最相似的区域, 并计算对应的相似度分数; 随后将这
些分数与类别连接权重结合, 得到每个原型对该类别的支持度. 所有原型的支持度相加形成该类别的总分, 最终由
总分最高的类别作为模型输出.

