Page 155 - 《软件学报》2026年第4期
P. 155
1596 软件学报 2026 年第 37 卷第 4 期
类可理解的语言表达模型内部表示的语义含义. 例如, 在鸟类分类任务中, 文本概念可以表现为“一只黑头黄身的
小鸟”或“具有长喙和灰色翅膀的水鸟”等, 这些描述语句能够作为模型预测的语义解释依据. 早期的文本概念主要
依赖于人工标注或专家先验, 常用于多标签分类、视觉问答等任务中的辅助信息引入. 随着大语言模型 (large
language model, LLM) 与多模态预训练模型的发展, 近年来大量研究开始探索使用自动化方式从图像或模型激活
中生成文本概念. 这使得文本概念能够以可扩展、低成本的方式嵌入到模型训练或解释框架中, 增强模型的语言
解释能力与人机交互性. 文本概念多用于事中可解释模型的构建, 如语言引导的注意力机制、描述驱动的生成解
释等, 尤其适用于需要符号层语义输出的高风险场景, 如医疗辅助诊断、司法证据呈现等. 其优势在于解释结果的
自然语言可读性与跨模态通用性, 是当前可解释性研究中备受关注的新兴方向.
除了根据概念的表示形式进行划分外, 基于概念的可解释性方法还可按照解释结构与作用机制划分为 3 种典
型类型: 类-概念关系 (concept-class, C-C)、神经元-概念关联 (neuron-concept, N-C) 和概念可视化 (visualization, V).
这 3 类方法从不同层面提供了解释的视角, 以适应多样化的应用需求和模型理解目标.
类-概念关系 (C-C): 该类方法关注模型中某一概念与输出类别之间的关系建模, 能够揭示特定概念在分类决
策中所起的作用. 例如, 一张图像被分类为“熊猫”, 可能是因为模型检测到了“毛茸茸的耳朵”“黑色眼圈”等多个概
念特征. 通过构建概念与类别之间的映射规则, 模型能够更清晰地表达其决策的语义依据, 有助于增强用户对模型
行为的信任与可控性.
神经元-概念关联 (N-C): 此类方法旨在将语义概念与神经网络中的特定神经元或通道建立对应关系, 提升模
型内部表示的透明度. 其实现方式可以是事后分析神经元的激活响应, 找出与特定概念高度相关的神经元; 也可以
在训练阶段引入监督机制, 使模型内部单元显式学习特定概念的表示. 这种方式有助于揭示模型在处理输入时的
语义分布结构, 增强对其内部工作机制的认知理解.
概念可视化 (V): 通过热力图、显著性图等可视化手段, 突出输入样本中最能代表某一概念的区域或特征, 从
而帮助用户直观地理解模型是如何在输入数据中捕捉与响应语义模式的. 这种可视化不仅提升了模型解释的直观
性, 也在模型注意力机制与人类感知之间建立起联通, 增强模型行为的可感知性和可解释性.
此外, 基于概念的可解释方法还可以按照解释的范围划分为全局解释与局部解释. 全局解释侧重于对整个模
型的语义结构和行为逻辑进行宏观理解, 例如识别模型使用了哪些核心概念及它们之间的关系; 局部解释关注模
型在特定输入样本下的具体决策过程, 通过分析样本触发的概念激活路径, 为用户提供个性化、场景化的解释信息.
图 2 展示了本文中基于概念的可解释方法的分类框架, 帮助用户根据是否需要对模型进行结构修改、使用何
种类型的概念表示, 以及期望获取何种粒度的解释效果, 选择最适合的方法.
有监督概念
有
基于概念的事 是否有标注概念?
后可解释方法
不可以 没有 无监督概念
基于概念的可
解释方法 是否可以修改模型? 有监督概念
可以 没有
有 无监督概念
基于概念的事
中可解释方法 是否有标注概念?
混合概念
没有但 有一些
可以生成
生成概念
图 2 可解释概念建模方法的分类框架及选择指南

