Page 162 - 《软件学报》2026年第4期
P. 162
王家祺 等: 可解释深度学习的概念建模方法综述 1603
在准确性、可解释性与交互能力方面表现突出.
针对 CBM 依赖大量概念标注和性能受限的问题, Yuksekgonul 等人 [49] 提出了事后概念瓶颈模型 (post-hoc
concept bottleneck model, PCBM), 该方法可将任意预训练模型转化为具备可解释性的 CBM 架构, 无需对训练数据
进行额外标注, 从而提升灵活性和实用性. PCBM 可从外部概念数据集迁移概念信息, 或结合多模态模型从自然语
言描述中提取语义表示. 其构建流程包括: 首先通过概念激活向量学习概念子空间; 然后借助文本编码器将语言描
述映射至共享嵌入空间; 最后采用可解释预测器 (如稀疏线性模型或决策树) 将概念映射至最终预测. 实验结果表
明, PCBM 在多个数据集上与原始模型性能相当, 而其高效变体 PCBM-h 更是在所有测试任务中匹配甚至超越原
模型, 充分验证了其在无需标注条件下的可行性与有效性.
不同于以上概念瓶颈结构, Chen 等人 [46] 提出了概念白化 (concept whitening, CW) 技术, 通过对网络中特定层
的改造, 实现潜在空间与预定义概念的对齐, 从而更清晰地揭示模型是如何逐步掌握语义概念的. CW 模块嵌入在
神经网络内部, 通过白化和旋转操作对特征进行规范化, 使潜在空间的轴与人类关注的概念方向一致. 白化是一种
将协方差矩阵转化为单位矩阵的线性变换, 降低特征间冗余性, 而旋转矩阵进一步将语义概念与特征轴对齐. 在训
练过程中, CW 同时优化主任务损失 (如交叉熵) 与概念对齐损失, 后者通过最大化概念方向上的激活来实现对齐
目标. 这种机制不仅保持了原始任务性能, 还显著增强了模型对概念的表征能力与解释效果.
以上方法中概念监督数据不必局限于主训练集本身, 也可来自外部数据源, 包括独立的概念数据集 (如 CUB-
CW、CUB-CT)、半监督标注集 (如 CEM), 或结构化知识图谱 (如 PCBM). 这种扩展方法一方面执行标准的端到
端训练以保证模型性能, 另一方面在特定层引入语义约束, 使模型结构中自然嵌入可解释概念, 从而构建出兼顾性
能与可解释性的模型框架.
3.2 基于无监督概念的事中可解释方法
无监督概念模型赋予神经网络自主学习语义结构的能力, 而无需将概念与预定义符号显式对应. 通过识别特
征空间中的相似模式或原型, 这类模型能够自动发现数据中的潜在结构与语义规律, 从而在不依赖人工标注的前
提下提升模型的可解释性.
一类代表性方法通过对相似特征模式进行聚类, 以实现对模型特征空间的解耦. Zhang 等人 [51] 提出了一种方
法, 将传统卷积神经网络 (CNN) 转化为结构上更具可解释性的网络, 核心在于揭示高层卷积核所学习的物体部分
表示. 在该模型中, 每个高层卷积核被设计为专门响应某一特定物体区域, 且无需额外的标注信息. 作者预定义一
组仅响应局部区域的模板, 并以模板与卷积核之间的互信息作为损失函数, 鼓励每个卷积核学习并编码特定语义
区域, 避免不同卷积核对相同区域的冗余激活. 实验结果表明, 该方法在多个 CNN 架构和数据集上均显著提升了
物体部分的定位稳定性与可解释性.
另一个方向是通过模型架构设计实现自解释能力. Alvarez-Melis 等人 [52] 提出了自解释神经网络 (self-explaining
neural network, SENN), 该框架从线性模型出发扩展至更复杂的深度结构. SENN 通过一个概念编码器提取输入特
征并进行聚类; 然后使用参数化模块根据输入生成每个概念的相关性权重; 最终以概念与其权重的线性组合输出
预测结果. 为提升表达稀疏性与概念可辨性, 作者引入稀疏正则化, 确保每个输入仅依赖少量不重叠的概念.
SENN 实验结果表明, 该模型在保持分类性能的同时, 能提供结构清晰、解释直观的概念表达. 不过, SENN 的设
计更偏向于学习覆盖全局的概念表达, 缺乏对局部解释的支持. 为此, bottleneck concept learner (BotCL) [53] 进一步
引入槽注意力机制 (slot attention), 以自动识别图像中的局部概念表示. BotCL 在重建损失的基础上引入对比损失,
增强跨类概念的辨别能力, 促进语义聚类的明确性. 实验证明, 在多个图像分类任务中, BotCL 在准确性和解释性
上均优于包括 SENN 在内的多种基线模型. 该模型不仅能够自动识别关键局部概念, 还能通过槽注意力机制对其
进行可视化, 例如在 ImageNet 上识别鲨鱼的口部和鳍部, 从而构建结构化的图像语义表示.
在自然语言处理领域, 研究者也在探索可解释模型的构建. Rajagopal 等人 [54] 提出的 SelfExplain 模型, 将全局
与局部可解释机制融合进文本分类器中, 以短语级概念替代传统词级特征作为解释单位. 该模型一方面通过最大
内积搜索检索训练集中对当前输入最具代表性的全局概念, 另一方面评估这些局部概念与目标标签之间的相关
性, 从而量化其重要性. 在 5 个主流文本分类数据集上, SelfExplain 展现出在不损失性能的情况下, 显著增强解释

