Page 164 - 《软件学报》2026年第4期
P. 164
王家祺 等: 可解释深度学习的概念建模方法综述 1605
Why is this bird classfied as a red-bellied woodpecker?
Evidence for this bird being a red-bellied woodpecker: Evidence for this bird being a red-cockaded woodpecker:
Original image Prototype Training image Activation map Similarity Class Points Original image Prototype Training image Activation Similarity Class Points
(box showing part that where prototype score connectioncontributed (box showing part that where prototype map score connection contributed
looks like prototype) comes from looks like prototype) comes from
6.499 × 1.180 = 7.669 2.452 × 1.046 = 2.565
4.392 × 1.127 = 4.950 2.125 × 1.091 = 2.318
3.890 × 1.108 = 4.310 1.945 × 1.069 = 2.079
··· ··· ··· ··· ··· ··· ··· ··· ··· ··· ··· ··· ··· ···
Total points to red-bellied woodpecker: 32.736 Total points to red-cockaded woodpecker: 16.886
图 7 ProtoPNet 推理过程 [24]
为增强模型结构的层次性, Nauta 等人 [55] 提出了原型树网络 (ProtoTree), 将原型建模为二叉树节点, 构建从根
到叶的显式分类路径. 每个内部节点包含可学习原型, 其存在性决定图像的路径选择, 叶节点则负责学习类别分布.
ProtoTree 引入剪枝技术和原型可视化机制, 有效增强了全局解释性. Hase 等人 [56] 进一步提出分层原型网络 (HPNet),
支持从粗到细的多级原型组织结构, 使模型不仅能判断“该图像为何属于某类别”, 还能解释其在层级分类体系中
的归属关系. HPNet 能在处理未见类别 (如“手枪”) 时输出合理推断 (如归类为“武器”), 提升了模型泛化能力.
在对 ProtoPNet 框架的进一步拓展中, 本团队提出了 TesNet (transparent embedding space network) [57,58] , 通过
构建透明嵌入空间学习概念表示, 显著增强了原型之间的判别性与解释能力. TesNet 将每个原型视为子空间中的
基向量, 不同类别的原型子空间在 Grassmann 流形 (Grassmann manifold) 上进行投影, 使得类间分布更加离散可
分. 该方法还引入原型可视化机制, 将原型与图像中的关键区域进行显性对应, 提升语义解释的直观性和可信度.
TesNet 在多个细粒度图像分类任务中显著提升了分类性能与解释质量. 此外, 其后续的期刊拓展版进一步扩展至
Transformer 架构, 并引入了用于缓解概念冗余的剪枝算法, 提升概念压缩率与语义紧凑性. 同样为缓解 ProtoPNet
中原型冗余与类别隔离的问题, Rymarczyk 等人 [59] 提出 ProtoPShare 方法, 在适配 Vision Transformer 架构时, Xue
等人 [60] 提出 ProtoPFormer 结合全局与局部原型建模机制, 全局原型提供对象的整体表示, 局部原型专注前景区域,
两者协同校正, 强化了模型对判别性区域的关注.
此外, 为克服原型匹配在几何变换下的脆弱性, Donnelly 等人 [61] 设计了可变形原型网络 (deformable Proto-
PNet), 将原型表示为可自适应空间位置的部件组合, 从而增强了模型对目标尺度与姿态变化的适应能力, 在多个
主干 CNN 上均获得显著性能提升. 考虑到概念的层次性, MCPNet (multi-level concept prototype network) [62] 则进一
步引入多层次语义原型机制, 通过在多个网络层中学习局部、中层与全局原型, 并利用概念分布损失和类别对齐
约束提升了原型的可区分性与一致性. MCPNet 不依赖外部标注, 兼容主干网络架构, 并支持基于原型路径的可视
化解释, 在 few-shot 场景与多数据集实验中均展现出强大解释能力与准确率.
3.3 基于混合概念的事中可解释方法
融合监督与无监督学习范式的混合型事中可解释方法, 在监督信息稀缺的条件下, 依然能够构建出具备语义
解释能力的深度模型. 通过综合两种学习机制的优势, 这类方法提升了模型在低标注场景下的适应性和可解释性,
增强了对模型行为的理解能力.
为缓解 CBM 在概念数量有限时性能下降的问题, Sawada 等人 [63] 提出了 CBM-AUC, 结合了传统 CBM 与优
化后的 SENN 结构, 以同时学习监督概念与无监督概念. 针对原始 SENN 编码器-解码器结构在处理大规模图像时
计算效率低的问题, 作者设计了 M-SENN 架构: 首先, 用鉴别器替代解码器, 训练目标转为最大化输入数据与中间

