Page 157 - 《软件学报》2026年第4期
P. 157
1598 软件学报 2026 年第 37 卷第 4 期
负样本集, 用于表示不包含该概念的图像. 这些图像被输入待解释模型, 从中提取高层特征表示. 随后, 在特征空间
中训练一个线性分类器, 用于区分正负样本, 得到该分类边界的法向量, 即概念激活向量, 用于刻画该概念在特征
空间中的方向性表示. 接下来, 为评估模型预测对该概念的依赖程度, TCAV 计算模型在给定输入下的类别预测方
向与 CAV 之间的点积, 即类别方向导数与概念向量之间的敏感性指标. 概念敏感度可以形式化如下:
l
S C,k,l (x) = ∇h k ( f l (x))·v ,
C
l
其中, f l (x) 为第 l 层的激活, v 为该层概念 C 的概念激活向量. 该指标反映了概念在模型预测该类别时的正向影响
C
程度. 进一步地, TCAV 定义了一个评分指标 (TCAV score):
|{x ∈ X k : S C,k,l (x) > 0}|
TCAV C,k,l = .
|X k |
该值用于衡量在所有输入中, 有多少比例的样本对该概念表现出显著正向敏感性得分越高, 说明该概念对模
型分类结果的影响越大, 解释效力越强. TCAV 方法的优势在于无需修改原始模型结构, 具备较强的通用性与适应
性, 同时能够提供定量化的语义解释, 是目前概念-类别关系分析中的代表性方法之一. 经典的 TCAV 方法通过训
练线性分类器获得概念方向 (CAV), 并利用方向导数度量概念对模型预测的影响, 为可解释性研究提供了灵活的
全局分析框架. 然而, TCAV 基于向量表示, 忽略了卷积神经网络中特征图所蕴含的空间结构信息, 限制了对复杂
语义模式的精细刻画. 为此, 后续本团队提出了语义激活张量方法 TSAT [41] , 通过支持张量机学习概念张量, 保留
通道和空间维度的结构信息, 提升了解释的语义精度与稳定性. 该方法不仅在保留模型原有结构的前提下实现了
高质量的概念建模, 还显著优于 TCAV 在复杂语义概念和高分辨率图像上的可解释性能.
3. 通过预训练网络提取输入的高层特征
1. 用户定义的概念示例 f l : → m h l, k : m →
n
(如条纹) 和其他示例
th
K class
··· ···
m
2. 待分析类 (斑马) 的
训练数据示例 5. 给定测试图片, 根据方向导数和概念
f l ( ) f l ( ) f l ( ) f l ( ) 激活向量量化模型预测对概念敏感度
f l ( ) f l ( )
f l ( ) S C,k,l ( )
l
v C f l ( )
f l ( ) f l ( ) =▽h l,k ( f l ( ))·v C l
4. 训练SVM分类器, 概念激活向量正交于分类边界
图 3 概念激活向量算法流程 [23]
除了 TCAV 等方法关注概念与类别之间的相关性建模, 近年来也出现了一些更具结构性和因果性解释能力
的扩展方法. 其中, IBD (interpretable basis decomposition) [30] 提出了一种将预测证据分解为最相关语义组件的策略,
用于构建类-概念关系. IBD 将类别与概念均视为网络倒数第 2 层潜在空间中的向量, 并通过在该潜在空间中构建
一组线性分类器来表示概念方向. 随后, 模型通过优化一个回归过程, 利用这些概念向量与样本嵌入之间的内积预
测类别输出, 回归系数用于衡量各概念对类别预测的相关性强度, 而残差项则反映模型中未被概念解释所覆盖的
预测变异性. 此外, IBD 还为每个概念生成对应的热力图, 以显示哪些输入区域最能激活该概念, 从而增强解释的
可视化效果.
与此类“相关性驱动”方法不同, 另一类方法更进一步, 专注于分析特定概念对模型输出的因果影响. 典型代表
是因果概念效应 (causal concept effect, CaCE) [31] , 其核心思想是评估概念在预测中是否具有因果作用. 具体做法是
对原始样本进行概念级别的干预, 生成去除某个概念后的反事实样本, 进而衡量该概念的有无对模型输出的影响
差异. 该差异即被定义为 CaCE 值, 用于量化该概念的因果效应. 为了高效实现这一过程, 研究者提出了两种策略:
一是在可控环境中对样本进行人工干预, 显式添加或删除某一概念; 二是使用生成模型 (如变分自编码器) 对带或
不带目标概念的图像进行建模, 从而生成近似的反事实版本. 这些策略被应用于多个数据集, 并与非因果版本的
TCAV 与基础版 CaCE 进行比较, 实验结果表明, CaCE 更有效地识别出真正与预测决策存在因果关系的概念.

