Page 158 - 《软件学报》2026年第4期
P. 158
王家祺 等: 可解释深度学习的概念建模方法综述 1599
除了建立类别与符号概念之间关系的方法外, 另一类研究聚焦于探索符号概念与神经网络内部神经元活动之
间的映射关系, 旨在为神经元提供语义层面的解释, 揭示模型内部表征的可解释性基础. 在这一方向上, Zhou 等人 [33]
的研究分析了深度卷积神经网络在执行场景分类任务过程中是否能够自动学习出具备语义意义的对象检测器. 研
究发现, 在训练过程中, 隐藏层神经元不仅执行特征提取任务, 还能够自主形成对特定对象或其组成部分的敏感响
应. 为了更精确地量化每个神经元的语义含义, 研究者基于输入激活响应, 分析其所关联的图像区域, 并结合人类
众包标注, 对神经元激活进行语义匹配与精度评估. 实验结果表明, 大多数神经元都能被映射至可识别的语义概
念, 在所有隐藏层中平均精度超过 70%. 更为关键的是, 随着网络层级的加深, 所学习的概念类型从低级的颜色、
纹理等逐渐过渡到更高级的对象及其组成结构, 展现出从感知到认知的语义抽象能力. 与以上工作类似, ND
(network dissection) [34] 系统性地提出了一种用于解释神经元语义的标准化方法. 其核心目标是将神经网络中的每
个神经元激活与具体可解释概念建立明确联系. 为此, 研究者构建了一个广泛且密集标注的数据集 BRODEN, 该
数据集整合了多种来源, 涵盖颜色、纹理、对象、场景等多种层级的语义标签. ND 方法通过区域重叠率 (inter-
section over union, IoU) 来度量神经元激活图与标注概念区域之间的匹配度, 从而为每个神经元赋予最具代表性的
语义标签. ND 的输出结果展示了每个神经元所响应的概念类型, 并允许多个神经元共同表征同一语义概念, 从而
提升了语义表达的多样性与丰富性. 然而, 该方法的准确性高度依赖于概念标签集的覆盖范围与标注质量. 如果某
些实际存在于激活图中的概念未被数据集标注, 则该神经元可能因缺乏有效对应而被视为“不可解释”, 进而影响
整体解释率. 这类研究结果表明, 深度神经网络中的单个神经元在未经显式监督的情况下, 仍具有自动捕捉高层语
义特征的能力. 这不仅打破了神经网络完全“黑盒”的刻板印象, 也为构建基于概念的可解释机制提供了理论依据
和技术路径, 证明了神经元级别的语义对齐是可行且具有实用价值的.
2.2 基于无监督概念的事后可解释方法
第 2.1 节介绍的有监督概念建模方法依赖于明确的概念标签. 然而, 针对深度神经网络各层语义进行细粒度
标注是一项成本高昂且极其耗时的任务, 难以适应实际场景中多变的应用需求. 在现实应用中, 为每一个新任务构
建一套完整的概念标注体系往往不可行, 因此, 有必要探索无需人工监督的概念建模路径. 基于此动机, 研究者们
提出了利用聚类算法对神经网络隐空间中的相似模式进行分析, 并进一步研究这些模式与模型预测结果之间的关
系. 这种方法不仅能够揭示模型内部所学习到的结构性语义表示, 还在一定程度上减轻了对人工标注的依赖, 提升
了可解释性方法的通用性与可扩展性.
与需要预设概念标签的 TCAV 不同, 自动概念提取方法 (automatic concept-based explanation, ACE) [36] 是一种
无需人工监督即可分析训练完成的分类模型中某一类别预测逻辑的技术路径. 该方法的核心流程包括以下几个阶
段: 首先, 对属于目标类别的图像进行多分辨率图像分割, 以获取涵盖纹理、局部结构以及完整对象在内的多层次
视觉区域. 这一过程旨在全面捕捉潜在的概念候选. 然后, 将这些图像区域嵌入到模型的高层潜在空间中, 并使用
K-means 聚类对它们进行分组, 以提取相似模式簇作为候选概念. 为避免噪声干扰, ACE 会排除那些可能导致异常
预测的图像区域, 例如边缘无关区域或缺乏语义代表性的片段. 接着, 将每一个聚类得到的概念候选输入 TCAV
框架中, 计算其对特定类别预测结果的平均概念敏感度得分. 得分越高, 表示该概念对该类别预测具有更强的正向
贡献. 最终, ACE 输出一个基于 TCAV 得分排序的高相关概念列表, 从而实现无监督的语义解释流程. 如图 4 所
示, 该方法通过分割、嵌入、聚类和排序这 4 个阶段, 完成了从数据驱动模式提取到语义解释的完整闭环.
尽管由于图像分割、聚类或相似性度量的局限性, ACE 可能会识别出部分无意义或不一致的模式, 但通过大
量人类评估实验验证发现, ACE 所提取的概念在跨样本之间具有高度一致性, 且通常可被人类观察者使用相同的
自然语言标签描述. 这一发现表明, ACE 在不依赖人工标注的情况下, 仍能够发现具备认知合理性的概念结构, 成
为无监督概念建模方向中的代表性方法之一.
尽管自动概念提取方法 (ACE) 能够在无需标签监督的条件下, 从神经网络中识别出概念性模式, 但其提取的
概念集合未必能全面解释模型的预测行为. 为克服这一局限, Yeh 等人 [37] 提出了一种改进方法, 引入了“概念完整
性得分”这一指标, 用于衡量一组概念对模型预测的覆盖能力. 该得分的核心公式如下:

