Page 165 - 《软件学报》2026年第4期
P. 165
1606 软件学报 2026 年第 37 卷第 4 期
特征的互信息, 避免传统重构误差目标对学习的不利影响; 其次, 引入中间网络共享机制, 让编码器与参数化器共
用特征提取模块, 从而有效压缩模型参数并提升效率. CBM-AUC 在多个任务上展现出优于原始 CBM 和 SENN
的准确性, 且通过 Grad-CAM 可视化分析, 验证了模型能准确聚焦于语义关键区域, 无论是监督还是无监督概念.
此外, Sarkar 等人 [64] 提出了一种通用框架, 可将“自我解释模块”无缝嵌入任意深度神经网络流程中. 该方法核
心为一个概念编码器, 负责从特征中学习用于解释模型预测的语义概念, 并配合重建损失和保真度损失共同优化,
以增强解释的信息承载力与忠实性. 在 CIFAR-10、ImageNet、AwA2 和 CUB-200 等数据集上, 该方法不仅保持
了与标准分类模型相当的准确率, 同时生成了语义一致、具有洞察力的解释, 且在有监督和无监督场景下均超越
多个现有基线, 展示了良好的通用性.
与前述研究聚焦于模型性能或集成方式不同, Marconato 等人 [65] 提出的 GlanceNets 则旨在提升概念表示的质
量与鲁棒性. 该方法采用变分自编码器替代传统自编码器, 引入解耦表示学习与开放集识别机制, 强化模型对高层
语义概念的建模能力. 为应对“概念泄漏”问题 (即模型学习到与任务无关的伪概念), GlanceNets 在测试阶段借助
开放集识别策略, 有效筛除不符合训练分布的输入样本, 提升预测的可靠性. 此外, 该方法支持多级监督粒度, 既适
用于弱监督甚至无监督环境, 又可通过显式概念监督增强语义一致性和模型可解释性.
3.4 基于生成概念的事中可解释方法
随着大语言模型 (LLM) 的快速发展, 其丰富的语言知识为构建概念瓶颈层提供了新的可能性. Yang 等人 [66]
提出的 LaBo (label bottleneck) 模型便是这一方向的代表性工作. 如图 8 所示, LaBo 利用 GPT-3 生成候选语义概
念, 并通过子模函数进行筛选优化, 构建具有判别力的概念瓶颈层. 具体流程包括: 首先定义图像分类任务的数据
集, 并利用预训练的多模态模型 (如 CLIP [69] ) 将图像和文本映射至共享语义空间; 然后基于子模函数从 GPT-3 提
供的大量候选中选出最优概念集合; 接着建立从图像特征到概念得分的映射; 最后通过线性函数将概念得分转换
为最终分类结果. 在包含常规物体、细粒度物体、动作、纹理、皮肤病变和卫星图像等共计 11 个数据集上,
LaBo 均展示出在小样本条件下优于传统端到端模型的性能, 并在大样本设置中仍保持良好竞争力, 展现了其在提
升可解释性的同时兼顾准确性的潜力.
Prompt: Describe what the axolotl looks like: Concept space E C ∈ N C ×d Test image
LLM: The axolotl’s limbs are delicate, and the tail is long and thin.
Extract concept using LM and delete class names:
Candidate concepts: limbs are delicate; tail is long and thin Text encoder
Class 1: axolotl
C1, 1 Limbs are delicate Image encoder
S 1
k concept
Submodular C1, 2 Tail is long and thin
LLM Candidate
optimization ··· ···
C1, k Gills are bright pink x ∈ d
Class 2: red panda
Concept scores: g(x, C)=x·E ∈ N C
T
C2, 1 Thick, soft fur
S 2 C
Submodular k concept C2, 2 Reddish brown fur ··· ··· ··· ··· (1, N C )
LLM Candidate
optimization ··· ···
C2, k Ears are also red W∈ N×N C
··· σ Dot
Class N: tree frog ··· ··· ··· ··· Class-concept
weight matrix Softmax product
CN, 1 Toes are long
S N
Submodular k concept CN, 2 Green body
LLM Candidate (1, N)
optimization ··· ···
^
T
σ
CN, k Smooth bumpy skin y =argmax(g(x, C)· (W) )
N classes Generate concepts Select concepts Bottleneck-C (N C concepts) Predict the label with concepts
图 8 LaBo 模型结构 [66]
与 LaBo 类似, Label-free CBM [67] 也采用 GPT-3 自动生成初始概念集. 其方法首先基于类别名称, 通过提示生
成相关描述性文本并提取潜在概念; 随后通过一系列过滤规则进行概念筛选, 如剔除冗长概念、去除与类别过于
接近或相互重复的概念、筛除训练集中不常见的无效概念等. 优化后的概念集合通过 CLIP-Dissect 训练获得概念

