Page 166 - 《软件学报》2026年第4期
P. 166
王家祺 等: 可解释深度学习的概念建模方法综述 1607
瓶颈层的映射权重, 并通过稀疏化输出层完成最终分类. 该方法有效提升了模型可解释性, 同时保持与黑盒模型相
当的性能, 进一步证明了语言模型在无监督或弱监督场景中构建概念空间的可行性.
与 LaBo 等依赖多阶段后处理的文本概念构建方法不同, 本团队提出的 ProCoNet [68] 在文本生成环节引入了
基于 in-context learning 的提示策略, 借助 GPT-3 直接生成高度聚焦于视觉属性的文本概念. 该策略无需额外的拆
解与过滤步骤, 有效提升了生成文本的相关性与效率. 这些自动生成的文本概念不仅能精准对应模型识别到的视
觉原型, 还使模型能够同时提供“看起来像什么” (视觉层面) 与“像什么” (语言层面) 的双重解释. 在认知心理学双
重编码理论的启发下, ProCoNet 被设计为一种融合视觉原型与语言概念对齐的多模态可解释图像识别框架, 构建
了如下 3 个核心表示空间. 视觉空间: 用于提取图像的局部原型特征, 基于 ProtoPNet 架构获取显著区域的视觉原
型; 文本概念空间: 利用 GPT-3 自动生成具有视觉可识别性的描述性短语, 并通过 CLIP 的文本编码器映射至嵌入
空间; 多模态空间: 由预训练的 CLIP 模型提供跨模态对齐能力, 用作视觉与文本之间的桥梁. 由于视觉原型与文
本概念嵌入分别来自图像与语言模态, 原始分布位于不同的流形 (manifolds) 上. ProCoNet 在 Stiefel 流形上优化投
影矩阵, 通过 Cayley 变换将视觉原型投影至多模态空间中与文本概念对齐, 同时保持其局部几何结构的稳定性.
这一设计不仅提升了语义对齐的一致性, 还避免了对人工标注或测试阶段图像裁剪的依赖, 从而增强了模型的可
解释性与泛化能力.
总体来看, 事中概念模型通过在网络结构中显式集成概念表示, 赋予模型更高层次的可解释性. 这种架构天然
具备透明性强、可交互性好、语义契合度高等优势, 使得用户不仅可以理解模型的预测结果, 还能在概念层面进
行干预和反事实推理, 尤其适用于医疗、金融等对合规与可控性要求较高的场景. 然而, 事中模型也存在若干挑
战. 首先, 为了保证可解释性, 其结构往往受到限制, 可能牺牲一定的性能, 尤其在表达复杂模式时受限; 其次, 与事
后解释方法相比, 事中方法在建模初期需设计概念结构与机制, 增加了实现难度与对专业知识的依赖; 再次, 部分
模型的解释粒度有限, 难以覆盖决策全过程或应对任务迁移时的泛化需求. 因此, 尽管事中概念模型在提升语义透
明性方面具有显著优势, 如何在解释性、性能与泛化能力之间实现更优平衡, 仍是未来研究的重要方向.
4 可解释性算法性能评估方法
为了科学地评估基于概念的可解释人工智能方法的有效性与实用性, 研究者提出了多种性能评估策略. 这些
方法不仅用于衡量模型解释的质量和可信度, 也有助于理解概念与模型行为之间的关系. 总体来看, 现有的可解释
性算法评估手段可划分为定性指标、定量评估.
4.1 定性评估指标
定性评估侧重于通过可视化与人工分析的方式, 检验模型解释是否具备语义清晰性、感知一致性与人类直观
可理解性. 这类方法通常不依赖具体的数值度量, 而是强调解释的直观合理性与使用者的主观接受程度, 是概念可
解释性研究中不可或缺的重要环节.
(1) 原型可视化 [24,55] : 在原型网络 (如 ProtoPNet、ProtoTree) 中, 研究者通常通过激活图或原型图像 patch 可视
化模型学习到的概念. 直观展示模型“看到了什么”并据此做出预测, 有助于判断这些原型是否具备一致的视觉特
征. 例如, 如果多个图像中的原型部分均对应鸟类的“翅膀”, 则说明该概念具备一致性和可解释性. 通过这种方式
可视化“概念对预测的贡献区域”, 有助于评估概念语义与图像内容的一致性.
(2) 人工评估 [52] : 基于人类的主观认知, 强调从人类用户的视角出发判断模型生成的概念是否具备清晰的语义
意义和直观的可解释性, 主要可以分为人工命名一致性、可理解性评分、语义聚类可感知性. 人工命名一致性: 由
多位评审者对自动提取的概念进行命名, 统计命名的一致性指标以评估概念的语义清晰度. 可理解性评分: 邀请用
户或领域专家对每个概念的可感知性、合理性和实用性打分, 反映其对人类认知的契合程度. 语义聚类可感知性:
分析不同样本被聚类为同一概念时的主观一致性, 即“是否看起来属于一类”.
4.2 定量评估指标
定量评估方法侧重于以数值方式衡量可解释性模型的解释质量、可信度与任务表现, 此类方法通常依赖模型

