Page 159 - 《软件学报》2026年第4期
P. 159
1600 软件学报 2026 年第 37 卷第 4 期
Accuracy using g(vc(x))−baseline accuracy
η f (c 1 ,...,c m ) = ,
Accuracy of f (x)−baseline accuracy
其中, f (x) 表示原始模型对输入 x 的预测, vc(x) 表示输入在特征空间的表示, g 表示将概念表示映射回输出的解释
模型, baseline 通常指随机猜测或多数类的预测. 高完整性得分即 η f 越接近 1 表示该组概念能够较充分地解释模
型的决策依据. 然而, 研究者进一步指出, 仅关注完整性可能不足以构建可靠的概念解释, 因为这忽略了概念的可
解释性、语义一致性以及与人类直觉的契合度等因素. 为此, 作者提出了一种优化的概念发现算法, 在保证解释完
整性的同时, 增强概念在潜在空间中与邻域区域的相关性, 从而提取出更具语义意义的解释单元. 此外, 借鉴了夏
普利值 (Shapley value) 的思想, 提出了用于概念层的重要性评估指标——ConceptSHAP, 用于更精确地量化各个
概念对类别预测的边际贡献. ConceptSHAP 分数表示如下:
∑
(m−|S |−1)!|S |! [ ]
s i (η) = η(S ∪{c i })−η(S ) ,
S ⊆CS {c i } m!
其中, CS = {c 1 ,...,c m } 代表全部概念集, 包含 m 个概念; η(S ) 表示仅使用概念子集 S 的完整性得分, η(S ∪{c i }) 表示
c i 的完整性得分. 通过在合成数据集上的实证验证, 该方法在发现完备且语义合理的概念集合方面, 相
使用 S 加上
较于 ACE 展现出显著优势, 为提升模型解释性与透明度提供了新的路径.
第1步: 多分辨率图像分割 第2步: 聚类相似的部分 第3步: 计算概念显著图
和概念得分
··· ···
0.8
0.7
··· 0.4
图 4 自动概念提取算法 (ACE) [36]
在 ACE 框架的基础上, ICE (invertible concept-based explanations) [38] 进一步提升了概念识别与重要性评估的
准确性. 该方法用非负矩阵分解替代了 K-means 聚类, 直接在特征图上提取稀疏而具有可加性的概念向量, 从而更
有效地捕捉模型在分类器顶层的概念组合. 与依赖 TCAV 得分不同, ICE 将概念的重要性视为模型输出的线性近
似权重, 提升了解释与模型行为的一致性. 实验表明, 与 PCA 和 K-means 等传统方法相比, ICE 在重构误差和人类
可解释性评价上均表现更优.
在此基础上, MCD (multidimensional concept discovery) [39] 提出通过识别深度网络隐藏空间中的多维线性子空
间 (即概念子空间) 来实现全局层面的模型解释. 该方法首先使用稀疏子空间聚类 (sparse subspace clustering,
SSC) 发现潜在概念, 再通过 PCA 提取每个概念簇的主方向, 并构建一个与输出层连接的线性映射, 用于计算完整
性得分, 从而量化概念对预测的整体解释能力. 此外, CRAFT (concept recursive activation factorization for explaina-
bility) [40] 进一步扩展了 ACE 和 ICE 提出的无监督概念挖掘框架. CRAFT 首先通过随机裁剪方式生成图像片段, 记
录这些子图在模型中间层的激活响应, 并使用 NMF 进行概念因子分解, 获得高质量的概念表示. CRAFT 的一大
特色是强调概念的层级结构, 采用递归方法提取概念与子概念, 并结合显著性图与敏感性分析进行可视化与重要
性度量, 提升了模型多层语义结构的解释能力.
综上所述, 基于概念的事后可解释方法因其无需更改模型架构, 且能在保持预测性能的前提下提供语义层面
的解释, 尤其适用于模型结构不可更动或需复用预训练模型的场景. 这些方法为研究者和工程实践提供了强有力
的工具, 有助于揭示模型的内部机制、诊断预测逻辑, 并增强用户信任. 然而, 这类方法也面临一些挑战与局限. 首
先, 由于其适用于已训练完毕的模型, 通常无法通过结构干预进一步提升解释性, 易受到原始架构设计的约束. 其
次, 所提取的“概念”并非总能与人类语义一致, 可能导致解释的模糊性或主观性. 最后, 事后方法在鲁棒性方面普
遍较弱, 容易受到对抗样本干扰, 在面对攻击时可能给出误导性解释.
基于这些问题, 越来越多研究者开始将焦点转向事中可解释方法. Rudin 等人 [42] 提出了一个颇具影响力的观

