Page 167 - 《软件学报》2026年第4期
P. 167

1608                                                       软件学报  2026  年第  37  卷第  4  期


                 中间层输出、标注信息或辅助模块. 相较于定性评估的主观性, 这类方法具有可复现性和对比性, 主要包括以下几
                 个关键维度.
                    (1) 概念准确度   [45] : 在  CBM  等显式建模语义概念的模型中, 概念准确度用于衡量模型中间层对语义概念的预
                 测质量, 是评估概念可解释性的重要基础指标. 该指标依赖具有明确概念标签的数据集, 反映模型对预定义概念的
                 学习能力与表达精度. 具体度量方式可根据概念的类型有所不同, 对于分类型概念, 常采用                           0-1  错误率或  F1 分数
                 来评估模型对离散语义属性          (如颜色、形状等) 的识别准确性; 对于连续型概念, 则通常使用均方误差                    (MSE) 或均
                 方根误差   (RMSE) 来衡量模型在概念数值预测中的偏差程度.
                    (2) 概念部位定位距离      [58] : 该指标用于衡量模型中学习到的概念是否具备明确的视觉对应性, 能否准确定位到
                                                                                      (  )
                 图像中的语义部件. ProtoPNet 等原型网络中可以广泛应用, 通过激活图中最大响应位置                      κ b (c)   推理出原图中预测
                                                                                        j
                                (  )
                 的  landmark  位置   ˆ P b (c)  , 计算其与真实  landmark  之间的归一化欧氏距离:
                                 j
                                                  (  )  (  )
                                                  (c)   (c)
                                                ˆ P b  = κ b  ·δ jump +δ center
                                                  j      j
                                               
                                               
                                                                   (  )
                                                              (c)   (c)  || .
                                                                        2
                                                 (    (  ))  || ˆ P − ˆ P b
                                                              k     j
                                                   (c)  (c)
                                                  ˆ P , ˆ P b  =  √
                                                    k    j
                                               
                                               d x i
                                                                   2
                                                                  ¯ w +h ¯ 2
                    (3) 概念冗余度   [58] : 概念冗余度衡量所学概念之间的相似性重叠程度, 用以检验模型是否存在多个原型表达相
                                                                          ρ (c)  来度量不同概念之间的独立性. 若多
                 同语义的问题. 为避免模型学习出多个语义重叠的概念, 引入冗余率指标
                 个概念被分配至同一       landmark, 则认为存在冗余. 冗余率定义如下:

                                                     #unique predicted landmark
                                               (c)
                                              ρ = 1−                      ,
                                                           #prototypes
                 其中,  ρ (c)  数值越高, 表示概念之间的冗余越严重, 模型的语义表达多样性较差.
                    (4) 概念对分类预测的影响: 除了关注模型的整体分类准确率外, 评估特定概念是否真正对模型的最终预测产
                 生影响, 也是衡量可解释性质量的重要维度. 典型的定量指标包括: TCAV 分数, 用于衡量模型对某一概念的预测
                 敏感性; CaCE [31] 通过构造反事实样本, 定量分析概念存在与否对预测结果的因果影响; ConceptSHAP                  [37] , 该方法基
                 于 SHAP 框架, 评估每个概念在预测输出中的边际贡献. 这些方法从不同角度揭示了模型在决策过程中是否真正
                 “使用”了人类可理解的语义概念. 此外还有一类指标可以度量概念表示是否有助于提升模型的整体预测精度和泛
                 化能力. 常见的评估方式包括: 概念完备得分用于衡量概念子空间在多大程度上能够解释原始模型的决策; 保真度
                 表示基于概念的预测在准确率上是否能够逼近或重构原始模型的输出.
                    (5) 概念与神经元的关系: 在相关研究中, 研究者通常构建具备像素级语义标注的数据集                          [34,35] , 以评估深度神
                 经网络中单个神经元与具体语义概念之间的对齐关系. 常用的评估指标为                         IoU, 用于衡量某一神经元激活区域与
                 语义概念标注区域之间的重叠程度, 从而量化该神经元对特定概念的专注程度与表达能力. 公式表达如下:

                                                        ∑
                                                           |M k (x)∩ L c (x)|
                                                           x
                                                  IoU k,c = ∑         ,
                                                           |M k (x)∪ L c (x)|
                                                           x
                 其中,   M k (x) 表示在图像  x 上第   个神经元单元的二值激活区域;         L c (x) 表示图像  x 上关于概念   的像素级语义标
                                         k
                                                                                          c
                 注掩码.
                    (6) 概念解释的鲁棒性: 传统评估指标, 如概念准确度、IoU 等, 只衡量解释与真值之间的静态吻合度, 却无法
                 量化解释在扰动或多次推理中的“自我一致性”. 换言之, 这些指标回答的是“解释有多准”, 却忽略了“解释是否始
                 终如一”. 概念解释的鲁棒性正是聚焦于解释本身               (显著图、概念权重、注意力分布等) 在面对输入扰动、模型随
                 机性或推理路径变化时的稳定性. 其公式如下:

                                                 Robust(x, x ) = sim(e(x),e(x )),
                                                                      ′
                                                         ′
                             x 的解释向量                         ′              ′     sim 常取余弦相似度.
                 其中, 原始输入              (显著图) 为   e(x), 扰动输入   x  的解释向量为   e(x ), 通常
                    (7) 以人为中心的评估框架: 可解释性本质上是一项“为人而生”的特质. 元预测器 (meta-predictor)                 [70]  框架将人
                 置于评估闭环的核心——通过测量用户在获得解释后, 能否准确预测模型的后续行为来直接量化解释的实用价
   162   163   164   165   166   167   168   169   170   171   172