Page 153 - 《软件学报》2026年第4期
P. 153
1594 软件学报 2026 年第 37 卷第 4 期
重复进行前向传播, 计算开销较大.
与之相对, 后向传播方法 (back-propagation method) 通过一次或有限次反向传播即可估计不同神经元或输入
特征的重要度, 具有更高的效率. 典型方法包括敏感度分析 [19,20] , 其通过计算模型输出对输入的梯度, 衡量输入扰
动对预测的影响程度, 适用于生成显著性图或热力图. 另一代表方法是逐层相关传播 [21] , 该方法从输出向输入逐
层传播“相关性值”, 通过规则化反向传播过程将预测结果分配回输入维度, 从而揭示各输入部分在决策中的具体
贡献. 相比直接使用梯度, LRP 同时考虑了输入激活和梯度信息, 在深层网络中具有更强的稳定性和解释鲁棒性.
另一类是基于概念的解释方法 (concept-based explanation method), 其核心目标不再是简单地定位模型“关注
了什么”, 而是试图从语义层面回答“模型理解了什么”. 这类方法强调构建与人类认知一致的语义中间表示, 以实
现对模型内部特征表示的更高层次解释. 相比信息流方法所提供的像素级显著性图, 基于概念的解释更具语义深
度和认知契合性. 具体而言, 概念解释方法通常依赖于引入人类可识别的概念标签 (如“翅膀”“斑马纹”“车窗”)、原
型样本 (代表性图像区域或特征块), 或构建语义嵌入空间, 在模型特征与概念语义之间建立映射. 典型方法如
TCAV [23] , 通过在高层特征空间中训练一个支持向量机区分概念样本与非概念样本, 并将其分类边界的法向量作
为概念方向, 用以衡量模型在预测过程中对特定语义概念的依赖程度. 另一种经典的方法 ProtoPNet (prototypical
part network) [24] , 在网络中显式引入概念原型模块, 通过对输入样本与若干“原型特征图”的相似度匹配, 实现可追
溯的分类决策路径. 每个原型代表一个可视化的语义概念 (如“鸟的头部”“车的轮胎”), 可通过原型-图像的对齐图
示明确呈现, 用户可以直观理解模型为何做出当前预测.
此外, 随着多模态模型和大语言模型的发展, 部分研究开始引入自然语言描述作为概念表达形式, 使模型具备
生成式的解释能力. 这类方法在语言与图像、概念之间建立对应, 有助于在人机交互或审计任务中提升可用性. 图 1
对比了两种方法, 前者更侧重标注模型关注的输入区域或像素点, 后者则尝试构建“概念组合”作为模型决策依据.
传统深度学习 黑盒AI系统 鸟类
算法
预测结果
输入 分类图片
基于信息流的
可解释算法
AI系统的决策 解释预测
依赖于这些像素点
AI系统的决策
依赖于概念的组合
响应
基于概念的 鸟类
可解释算法 概念
预测结果
输入 分类图片
图 1 基于信息流的可解释算法与基于概念的可解释算法
总体而言, 基于信息流的解释方法强调特征层面的可视化与重要性评估, 适用于快速定位模型关注区域, 但难
以揭示更高层次的语义关联; 而基于概念的解释方法则通过构建与人类认知相符的语义结构, 为理解模型内部机
制提供了更具认知深度的视角. 两类方法在解释粒度、表达方式与可理解性上各具优势, 共同构成了当前可解释

