Page 161 - 《软件学报》2026年第4期
P. 161
1602 软件学报 2026 年第 37 卷第 4 期
层”, 通过这一结构将学习过程划分为两阶段: 首先预测预定义的概念表示, 再基于这些概念生成最终输出. 该过程
的数学表达式如下:
ˆc = f c (x), ˆy = f y (ˆc)
,
ˆ y = f y ◦ f c (x) = f y ( f c (x))
其中, 第 1 行公式为概念预测函数表示从输入到概念的映射函数 (通常为神经网络); 第 2 行公式表示从输入到概
念的映射函数 (通常为神经网络), 整个 CBM 可以表达为一个复合函数. 与传统端到端模型直接从原始输入 (如图
像像素) 到预测结果 (如疾病严重程度) 不同, CBM 支持在概念层级进行解释、干预与控制. 训练阶段通过施加中
间监督损失, 使瓶颈层的神经元与人类标注的概念对齐; 测试阶段则支持用户直接编辑模型预测出的概念值并传
递影响至最终输出. 这一机制极大增强了人机交互能力, 允许专家如放射科医师直接修正模型对某结构的错误理
解 (例如, 将正常骨组织识别为骨刺), 以此改善整体预测.
输入
概念
硬化症
骨刺 目标任务
CNN
··· 关节炎程度
狭窄空隙
概念
翅膀颜色
尾部颜色 目标任务
CNN
··· 鸟的种类
喙部长度
图 5 概念瓶颈层模型结构 (CBM) [44]
尽管 CBM 实现了面向概念的决策路径, 但其“确定性概念预测”在面对数据模糊性或语义歧义时可能削弱解
释的稳定性与可信度. 为缓解这一问题, Kim 等人 [46] 提出了概率概念瓶颈模型 (probabilistic concept bottleneck
model, ProbCBM), 通过对每个概念学习一个正态分布嵌入, 引入预测不确定性建模. 传统 CBM 使用确定性模型
ˆ C = g(x), 而
预测概念 ProbCBM 使用概率嵌入表达每个概念:
p(z c |x) ∼ N (u c ,diag(σ c )),
其中, u c 和 σ c 由神经网络预测, 表示每个概念的均值和不确定性. 具体而言, 该模型利用蒙特卡洛采样从概念分布
中估算其存在概率, 并通过这些概念嵌入进一步推断最终类别. 概念是否存在的概率计算如下:
1 N s ∑ ( ( ))
( ) (n) − 2 (n) + 2
p c = 1|x ≈ s a ||z −z || −||z −z || ,
c c c c
N s
n=1
+ −
其中, z 和 z 分别是概念存在与不存在的锚点, s(·) 代表 Sigmoid 函数, a 表示可学习的缩放函数. 在训练过程中,
c
c
ProbCBM 联合使用二元交叉熵与 KL 散度作为损失函数; 推理阶段则可通过采样或均值估计实现. 相比原始
CBM, ProbCBM 提供了一种更加稳健、可信的语义解释方式.
然而, 传统概念瓶颈模型, 在提升解释性的同时, 常牺牲预测精度. 为解决这一权衡问题, Zarlenga 等人 [48] 提出
了概念嵌入模型 (concept embedding model, CEM), 为每个概念学习两个具备语义意义的嵌入向量, 分别代表其激
活与非激活状态. 通过对这两种向量的混合, CEM 构建出更丰富的概念表示, 并借助标签预测器完成下游任务预
测. CEM 同样支持测试阶段的概念干预, 使领域专家能纠正模型对特定概念的误判, 从而调整最终输出. 此外, 作
者还提出了两个评价指标: 概念对齐得分用于衡量学得的概念表示与真实标签的一致性, 信息瓶颈分析则用于评
估概念表示在压缩与表达之间的权衡. 实验证明, CEM 在多个数据集 (包括 CUB 与 CelebA) 上均优于现有 CBM,

