Page 161 - 《软件学报》2026年第4期
P. 161

1602                                                       软件学报  2026  年第  37  卷第  4  期


                 层”, 通过这一结构将学习过程划分为两阶段: 首先预测预定义的概念表示, 再基于这些概念生成最终输出. 该过程
                 的数学表达式如下:

                                                   
                                                   ˆc = f c (x), ˆy = f y (ˆc)
                                                   
                                                                      ,
                                                   
                                                    ˆ y = f y ◦ f c (x) = f y ( f c (x))
                 其中, 第  1  行公式为概念预测函数表示从输入到概念的映射函数                 (通常为神经网络); 第      2  行公式表示从输入到概
                 念的映射函数     (通常为神经网络), 整个      CBM  可以表达为一个复合函数. 与传统端到端模型直接从原始输入                    (如图
                 像像素) 到预测结果      (如疾病严重程度) 不同, CBM 支持在概念层级进行解释、干预与控制. 训练阶段通过施加中
                 间监督损失, 使瓶颈层的神经元与人类标注的概念对齐; 测试阶段则支持用户直接编辑模型预测出的概念值并传
                 递影响至最终输出. 这一机制极大增强了人机交互能力, 允许专家如放射科医师直接修正模型对某结构的错误理
                 解  (例如, 将正常骨组织识别为骨刺), 以此改善整体预测.

                                                输入
                                                             概念
                                                                硬化症
                                                                骨刺      目标任务
                                                         CNN
                                                               ···     关节炎程度
                                                                狭窄空隙

                                                             概念
                                                                翅膀颜色
                                                                尾部颜色    目标任务
                                                         CNN
                                                               ···      鸟的种类
                                                                喙部长度


                                              图 5 概念瓶颈层模型结构         (CBM) [44]

                    尽管 CBM 实现了面向概念的决策路径, 但其“确定性概念预测”在面对数据模糊性或语义歧义时可能削弱解
                 释的稳定性与可信度. 为缓解这一问题, Kim            等人  [46] 提出了概率概念瓶颈模型       (probabilistic concept bottleneck
                 model, ProbCBM), 通过对每个概念学习一个正态分布嵌入, 引入预测不确定性建模. 传统                    CBM  使用确定性模型
                         ˆ C = g(x), 而
                 预测概念             ProbCBM  使用概率嵌入表达每个概念:

                                                   p(z c |x) ∼ N (u c ,diag(σ c )),
                 其中,   u c  和  σ c  由神经网络预测, 表示每个概念的均值和不确定性. 具体而言, 该模型利用蒙特卡洛采样从概念分布
                 中估算其存在概率, 并通过这些概念嵌入进一步推断最终类别. 概念是否存在的概率计算如下:

                                                     1  N s ∑ ( (           ))
                                            (    )            (n)  − 2  (n)  + 2
                                           p c = 1|x ≈   s a ||z −z || −||z −z ||  ,
                                                              c  c     c  c
                                                    N s
                                                       n=1
                      +   −
                 其中,  z  和  z  分别是概念存在与不存在的锚点,        s(·) 代表  Sigmoid  函数,  a 表示可学习的缩放函数. 在训练过程中,
                          c
                      c
                 ProbCBM 联合使用二元交叉熵与 KL 散度作为损失函数; 推理阶段则可通过采样或均值估计实现. 相比原始
                 CBM, ProbCBM 提供了一种更加稳健、可信的语义解释方式.
                    然而, 传统概念瓶颈模型, 在提升解释性的同时, 常牺牲预测精度. 为解决这一权衡问题, Zarlenga 等人                       [48] 提出
                 了概念嵌入模型      (concept embedding model, CEM), 为每个概念学习两个具备语义意义的嵌入向量, 分别代表其激
                 活与非激活状态. 通过对这两种向量的混合, CEM 构建出更丰富的概念表示, 并借助标签预测器完成下游任务预
                 测. CEM 同样支持测试阶段的概念干预, 使领域专家能纠正模型对特定概念的误判, 从而调整最终输出. 此外, 作
                 者还提出了两个评价指标: 概念对齐得分用于衡量学得的概念表示与真实标签的一致性, 信息瓶颈分析则用于评
                 估概念表示在压缩与表达之间的权衡. 实验证明, CEM               在多个数据集      (包括  CUB  与  CelebA) 上均优于现有  CBM,
   156   157   158   159   160   161   162   163   164   165   166