Page 160 - 《软件学报》2026年第4期
P. 160
王家祺 等: 可解释深度学习的概念建模方法综述 1601
点: 与其在模型训练完成后费力地“解释”黑盒模型, 不如在模型设计之初就构建具备可解释性的结构, 从源头上确
保模型的透明性与可理解性. 这类方法在模型设计阶段就将概念嵌入与结构可解释性作为建模目标, 使解释性与
预测性在训练过程中共同优化, 从根本上提升模型的透明度、稳健性与语义一致性.
3 事中可解释的概念建模方法
事中可解释方法 (intrinsically interpretable method) 指的是在训练过程中引导神经网络主动学习与语义概念对
齐的内部表示, 从而使网络结构本身具备内生的可解释性. 根据概念生成方式及数据依赖类型, 这类方法通常分
为 4 类: ① 有监督方法依赖于明确的概念标签提供训练指导; ② 无监督方法通过网络内部结构自动形成概念表示;
③ 混合方法在此基础上融合少量标注与无监督机制, 以平衡准确性与适用性; ④ 生成方法借助外部模型构建概念
嵌入, 引导模型学习更具语义深度的特征. 本文在表 2 中构建了一个多维度的分析框架, 系统整理了事中可解释方
法在概念类型、解释机制、适用范围、数据类型及任务网络结构等方面的差异, 涵盖卷积神经网络、变换器网络、
自编码器 (AE) [43] 、变分自编码器 (VAE) [44] 以及大型语言模型 (LLM) 等主流架构.
表 2 基于概念的事中可解释性方法
概念标注 方法 概念类型 解释类型 解释范围 数据类型 网络类型
[45]
CBM N-C, C-C 局部/全局 图像 CNN
[46]
ProbCBM N-C, C-C 局部/全局 图像 CNN
[47]
CW N-C 全局 图像 CNN
有监督 符号化概念
CEM [48] N-C, C-C 全局 图像 CNN
[49]
PCBM N-C, C-C 局部/全局 图像 CNN
[50]
CT N-C, C-C 局部/全局 图像 TRANSF
Interpretable CNN [51] N-C, V 全局 图像 CNN
SENN [52] N-C, C-C 局部 图像 CNN+AE
相似模式簇
BotCL [53] N-C, C-C 局部 图像 CNN+AE
SelfExplain [54] C-C, V 局部/全局 文本 CNN+AE
[24]
ProtoPNet N-C, C-C, V 局部/全局 图像 CNN
[55]
ProtoTree N-C, C-C, V 局部/全局 图像 CNN
无监督
HPNet [56] N-C, C-C, V 局部/全局 图像 CNN
[57,58]
TesNet N-C, C-C, V 局部/全局 图像 CNN/TRANSF
原型
[59]
ProtoPShare N-C, C-C, V 局部/全局 图像 CNN
[60]
ProtoPFormer N-C, C-C, V 局部/全局 图像 TRANSF
[61]
Deformable ProtoPNet N-C, C-C, V 局部/全局 图像 CNN
MCPNet [62] N-C, C-C, V 局部/全局 图像 CNN
CBM-AUC [63] N-C, C-C 全局 图像、视频 CNN
相似模式簇
[64]
混合 Ante-hoc N-C 局部/全局 图像 CNN+AE
符号化概念
GlanceNets [65] N-C, C-C 全局 图像 CNN+VAE
LaBo [66] C-C 局部/全局 图像 CNN+LLM
生成 Label-free CBM [67] 文本概念 C-C 局部/全局 图像 CNN+LLM
Align2Concept [68] N-C, C-C, V 局部/全局 图像 CNN+LLM
3.1 基于有监督概念的事中可解释方法
与事后方法类似, 事中有监督的概念建模方法也依赖于标注有符号化概念的数据集 (如每个瓶颈层神经元代
表一个语义属性), 以显式引导模型中间层学习对人类可理解概念的表达. 典型代表是概念瓶颈模型 (concept
bottleneck model, CBM) [44] , 如图 5 所示, 该模型在输入与预测目标之间引入一个由语义概念神经元构成的“瓶颈

