Page 159 - 《软件学报》2026年第4期
P. 159

1600                                                       软件学报  2026  年第  37  卷第  4  期


                                                  Accuracy using g(vc(x))−baseline accuracy
                                      η f (c 1 ,...,c m ) =                       ,
                                                    Accuracy of f (x)−baseline accuracy
                 其中,   f (x) 表示原始模型对输入    x 的预测,  vc(x) 表示输入在特征空间的表示,       g 表示将概念表示映射回输出的解释
                 模型, baseline 通常指随机猜测或多数类的预测. 高完整性得分即               η f  越接近  1  表示该组概念能够较充分地解释模
                 型的决策依据. 然而, 研究者进一步指出, 仅关注完整性可能不足以构建可靠的概念解释, 因为这忽略了概念的可
                 解释性、语义一致性以及与人类直觉的契合度等因素. 为此, 作者提出了一种优化的概念发现算法, 在保证解释完
                 整性的同时, 增强概念在潜在空间中与邻域区域的相关性, 从而提取出更具语义意义的解释单元. 此外, 借鉴了夏
                 普利值   (Shapley value) 的思想, 提出了用于概念层的重要性评估指标——ConceptSHAP, 用于更精确地量化各个
                 概念对类别预测的边际贡献. ConceptSHAP        分数表示如下:

                                              ∑
                                                     (m−|S |−1)!|S |! [        ]
                                         s i (η) =                η(S ∪{c i })−η(S ) ,
                                                 S ⊆CS {c i }  m!
                 其中,   CS = {c 1 ,...,c m } 代表全部概念集, 包含  m 个概念;  η(S ) 表示仅使用概念子集  S  的完整性得分,  η(S ∪{c i }) 表示
                          c i  的完整性得分. 通过在合成数据集上的实证验证, 该方法在发现完备且语义合理的概念集合方面, 相
                 使用  S  加上
                 较于 ACE 展现出显著优势, 为提升模型解释性与透明度提供了新的路径.

                                     第1步: 多分辨率图像分割      第2步: 聚类相似的部分        第3步: 计算概念显著图
                                                                                和概念得分
                                                           ···    ···
                                                                              0.8

                                                                              0.7

                                                 ···                          0.4

                                               图 4 自动概念提取算法        (ACE) [36]

                    在  ACE  框架的基础上, ICE (invertible concept-based explanations) [38] 进一步提升了概念识别与重要性评估的
                 准确性. 该方法用非负矩阵分解替代了            K-means 聚类, 直接在特征图上提取稀疏而具有可加性的概念向量, 从而更
                 有效地捕捉模型在分类器顶层的概念组合. 与依赖                TCAV  得分不同, ICE  将概念的重要性视为模型输出的线性近
                 似权重, 提升了解释与模型行为的一致性. 实验表明, 与               PCA  和  K-means 等传统方法相比, ICE  在重构误差和人类
                 可解释性评价上均表现更优.
                    在此基础上, MCD (multidimensional concept discovery) [39] 提出通过识别深度网络隐藏空间中的多维线性子空
                 间  (即概念子空间) 来实现全局层面的模型解释. 该方法首先使用稀疏子空间聚类                         (sparse subspace clustering,
                 SSC) 发现潜在概念, 再通过 PCA 提取每个概念簇的主方向, 并构建一个与输出层连接的线性映射, 用于计算完整
                 性得分, 从而量化概念对预测的整体解释能力. 此外, CRAFT (concept recursive activation factorization for explaina-
                 bility) [40] 进一步扩展了  ACE  和  ICE  提出的无监督概念挖掘框架. CRAFT 首先通过随机裁剪方式生成图像片段, 记
                 录这些子图在模型中间层的激活响应, 并使用 NMF 进行概念因子分解, 获得高质量的概念表示. CRAFT                             的一大
                 特色是强调概念的层级结构, 采用递归方法提取概念与子概念, 并结合显著性图与敏感性分析进行可视化与重要
                 性度量, 提升了模型多层语义结构的解释能力.
                    综上所述, 基于概念的事后可解释方法因其无需更改模型架构, 且能在保持预测性能的前提下提供语义层面
                 的解释, 尤其适用于模型结构不可更动或需复用预训练模型的场景. 这些方法为研究者和工程实践提供了强有力
                 的工具, 有助于揭示模型的内部机制、诊断预测逻辑, 并增强用户信任. 然而, 这类方法也面临一些挑战与局限. 首
                 先, 由于其适用于已训练完毕的模型, 通常无法通过结构干预进一步提升解释性, 易受到原始架构设计的约束. 其
                 次, 所提取的“概念”并非总能与人类语义一致, 可能导致解释的模糊性或主观性. 最后, 事后方法在鲁棒性方面普
                 遍较弱, 容易受到对抗样本干扰, 在面对攻击时可能给出误导性解释.
                    基于这些问题, 越来越多研究者开始将焦点转向事中可解释方法. Rudin                     等人  [42] 提出了一个颇具影响力的观
   154   155   156   157   158   159   160   161   162   163   164