Page 157 - 《软件学报》2026年第4期
P. 157

1598                                                       软件学报  2026  年第  37  卷第  4  期


                 负样本集, 用于表示不包含该概念的图像. 这些图像被输入待解释模型, 从中提取高层特征表示. 随后, 在特征空间
                 中训练一个线性分类器, 用于区分正负样本, 得到该分类边界的法向量, 即概念激活向量, 用于刻画该概念在特征
                 空间中的方向性表示. 接下来, 为评估模型预测对该概念的依赖程度, TCAV                    计算模型在给定输入下的类别预测方
                 向与  CAV  之间的点积, 即类别方向导数与概念向量之间的敏感性指标. 概念敏感度可以形式化如下:

                                                                    l
                                                   S C,k,l (x) = ∇h k ( f l (x))·v ,
                                                                    C
                                       l
                 其中,   f l (x) 为第  l 层的激活,   v  为该层概念  C  的概念激活向量. 该指标反映了概念在模型预测该类别时的正向影响
                                       C
                 程度. 进一步地, TCAV 定义了一个评分指标          (TCAV score):

                                                        |{x ∈ X k : S C,k,l (x) > 0}|
                                                TCAV C,k,l =             .
                                                               |X k |
                    该值用于衡量在所有输入中, 有多少比例的样本对该概念表现出显著正向敏感性得分越高, 说明该概念对模
                 型分类结果的影响越大, 解释效力越强. TCAV 方法的优势在于无需修改原始模型结构, 具备较强的通用性与适应
                 性, 同时能够提供定量化的语义解释, 是目前概念-类别关系分析中的代表性方法之一. 经典的                            TCAV  方法通过训
                 练线性分类器获得概念方向          (CAV), 并利用方向导数度量概念对模型预测的影响, 为可解释性研究提供了灵活的
                 全局分析框架. 然而, TCAV 基于向量表示, 忽略了卷积神经网络中特征图所蕴含的空间结构信息, 限制了对复杂
                 语义模式的精细刻画. 为此, 后续本团队提出了语义激活张量方法                    TSAT [41] , 通过支持张量机学习概念张量, 保留
                 通道和空间维度的结构信息, 提升了解释的语义精度与稳定性. 该方法不仅在保留模型原有结构的前提下实现了
                 高质量的概念建模, 还显著优于         TCAV  在复杂语义概念和高分辨率图像上的可解释性能.

                                               3. 通过预训练网络提取输入的高层特征
                         1. 用户定义的概念示例                  f l :  →  m     h l, k :   m →
                                                         n
                          (如条纹) 和其他示例
                                                                                    th
                                                                                   K  class
                                                           ···          ···
                                                                   m
                         2. 待分析类 (斑马) 的
                            训练数据示例                                     5. 给定测试图片, 根据方向导数和概念
                                                     f l (     )  f l (    ) f l (     )  f l (     )  激活向量量化模型预测对概念敏感度
                                                  f l (     )   f l (     )
                                                      f l (     )          S C,k,l (  )
                                                           l
                                                           v C  f l (     )
                                                         f l (     )  f l (     )  =▽h l,k ( f l (  ))·v C l
                                               4. 训练SVM分类器, 概念激活向量正交于分类边界
                                                图 3 概念激活向量算法流程         [23]

                    除了  TCAV  等方法关注概念与类别之间的相关性建模, 近年来也出现了一些更具结构性和因果性解释能力
                 的扩展方法. 其中, IBD (interpretable basis decomposition) [30] 提出了一种将预测证据分解为最相关语义组件的策略,
                 用于构建类-概念关系. IBD      将类别与概念均视为网络倒数第            2  层潜在空间中的向量, 并通过在该潜在空间中构建
                 一组线性分类器来表示概念方向. 随后, 模型通过优化一个回归过程, 利用这些概念向量与样本嵌入之间的内积预
                 测类别输出, 回归系数用于衡量各概念对类别预测的相关性强度, 而残差项则反映模型中未被概念解释所覆盖的
                 预测变异性. 此外, IBD    还为每个概念生成对应的热力图, 以显示哪些输入区域最能激活该概念, 从而增强解释的
                 可视化效果.
                    与此类“相关性驱动”方法不同, 另一类方法更进一步, 专注于分析特定概念对模型输出的因果影响. 典型代表
                 是因果概念效应      (causal concept effect, CaCE) [31] , 其核心思想是评估概念在预测中是否具有因果作用. 具体做法是
                 对原始样本进行概念级别的干预, 生成去除某个概念后的反事实样本, 进而衡量该概念的有无对模型输出的影响
                 差异. 该差异即被定义为       CaCE  值, 用于量化该概念的因果效应. 为了高效实现这一过程, 研究者提出了两种策略:
                 一是在可控环境中对样本进行人工干预, 显式添加或删除某一概念; 二是使用生成模型                           (如变分自编码器) 对带或
                 不带目标概念的图像进行建模, 从而生成近似的反事实版本. 这些策略被应用于多个数据集, 并与非因果版本的
                 TCAV  与基础版   CaCE  进行比较, 实验结果表明, CaCE     更有效地识别出真正与预测决策存在因果关系的概念.
   152   153   154   155   156   157   158   159   160   161   162