Page 156 - 《软件学报》2026年第4期
P. 156

王家祺 等: 可解释深度学习的概念建模方法综述                                                         1597


                  2   事后可解释的概念建模方法

                    基于概念的解释方法允许在不干扰模型内部结构的前提下, 对模型进行深入分析, 因此被称为基于概念的事
                 后可解释方法     (post-hoc interpretable method). 该类方法通常在模型训练完成后实施, 旨在提供关于模型所学习到
                 的概念表示及其决策依据的洞察. 根据是否使用概念标注信息, 事后方法可进一步分为有监督方法与无监督方法.
                 其中, 有监督方法依赖于带有概念标注的数据, 通过引入明确定义的符号概念来引导模型行为的解释过程; 而无监
                 督方法则通过聚类等技术, 从模型的中间表示中自动识别潜在的概念簇, 这些簇基于数据自身结构而形成, 无需预
                 先设定标签, 从而为模型决策提供了一种更数据驱动、探索性的解释路径.
                    为系统梳理该类方法, 本文构建了一个多维度分析框架, 从概念类型、解释类型、解释范围、数据类型、任
                 务场景及网络结构等维度对典型的事后概念方法进行了整理与比较                        (见表  1). 其中, 网络类型涵盖了卷积神经网
                 络  (CNN) [1−3] 和变换器架构  (Transformer, 缩写为  TRANSF) [4,5] 等主流模型.

                                               表 1 基于概念的事后解释性方法

                   概念标注             方法             概念类型      解释类型       解释范围      数据类型        网络类型
                                  TCAV [23]                    C-C     局部/全局        图像          CNN
                                   CARs [29]                  C-C, V   局部/全局        图像          CNN
                                   IBD [30]                   C-C, V   局部/全局        图像          CNN
                                   CaCE [31]                   C-C       全局         图像          CNN
                   有监督                            符号化概念
                                   CPM [32]                    C-C       局部         文本        TRANSF
                                Object detector [33]          N-C, V     全局         图像          CNN
                                   ND [34]                    N-C, V     全局         图像          CNN
                                  Net2Vec [35]                N-C, V     全局         图像          CNN
                                   ACE [36]                   C-C, V   局部/全局        图像          CNN
                             Completeness-aware CE [37]        C-C       全局       图像/文本         CNN
                   无监督             ICE [38]       相似模式簇       C-C, V   局部/全局        图像       CNN/TRANSF
                                   MCD [39]                   C-C, V     全局         图像          CNN
                                  CRAFT [40]                   C-C       全局         图像          CNN

                    事后可解释方法为预训练模型的理解提供了一种低侵入性、可迁移性强的解决方案, 尤其适用于对预测精度
                 与泛化能力要求较高的应用场景. 在不牺牲模型性能的前提下, 这类方法能够显著增强模型的透明度与用户信任
                 度, 通过人类可理解的概念语言, 提供了一种更高层级的语义解释. 尽管如此, 事后方法也存在一定局限性. 由于概
                 念是在模型训练完成后才被引入, 其解释行为未必反映模型在训练过程中真实采用的语义机制, 因此可能存在“贴
                 标签式解释”的风险. 此外, 这类方法应被视为增强人类理解的补充工具, 而非对模型内部机制的完整还原. 在解释
                 可用性与建模真实性之间取得平衡, 仍是该领域面临的重要挑战之一.
                  2.1   基于有监督概念的事后可解释方法
                    基于有监督概念的事后可解释方法通过利用已标注的符号化概念, 对模型进行语义层面的深入分析. 该类方
                 法依赖一组明确定义的概念标签, 用于探究模型的预测行为是否与这些高层语义概念存在关联, 从而揭示模型的
                 决策依据与内部机制. 通过构建模型表示与人类认知概念之间的对应关系, 此类方法有助于增强模型行为的可理
                 解性与透明度, 提升用户对模型预测的信任度. 该类方法通常可进一步细分为两个子方向: 一类着眼于概念与类别
                 之间的关系建模, 即分析特定概念在模型分类决策中扮演的角色; 另一类则侧重于概念与神经元激活之间的对应
                 关系, 用于揭示模型内部表示中的语义分布结构.
                    在前者方向中, 概念激活向量测试方法            [23] 是具有代表性的工作, 尤其适用于处理有监督概念的建模任务. 如图                3
                 所示, TCAV 提出了一种无需修改模型结构即可评估模型是否依赖特定概念的解释框架, 具体包括以下核心步骤.
                    首先, 针对用户定义的每一个概念, 准备两个图像样本集: 一个为正样本集, 包含具有该概念的图像; 另一个为
   151   152   153   154   155   156   157   158   159   160   161