Page 154 - 《软件学报》2026年第4期
P. 154

王家祺 等: 可解释深度学习的概念建模方法综述                                                         1595


                 深度学习研究的重要基础. 基于概念的方法在提高模型语义透明性、构建人类理解层的因果链路、增强模型的可
                 控性与信任感等方面展现出独特优势, 尤其适用于需要与人类认知对齐的高风险场景. 正因如此, 概念建模已成为
                 近年来可解释性研究中最受关注和发展最快的分支方向之一.
                  1.2   概念表示形式
                    在可解释人工智能中, “概念”不仅是人类认知中的基本语义单位, 更是连接深度神经网络内部表示与人类理
                 解之间的关键桥梁. 为了实现对深度模型“理解了什么”的语义层解释, 亟需在机器可计算的表示空间中对“概念”
                 进行有效的构建、表达与操作. 这不仅要求从理论上界定概念的表示形式, 还需结合具体任务中的建模实践, 分析
                 其在不同解释机制下的适配方式与表现能力.
                    “概念”的定义存在多样性, Molnar       [28] 曾将其广义描述为“任何抽象实体, 如颜色、物体, 甚至是想法”. 从认知
                 视角来看, 概念是在特定知识背景下, 人类对一类具有共同特征对象的抽象总结, 是感知数据与语义理解之间的重
                 要中介. 概念通常包含内涵与外延两个层面: 内涵              (intension) 指概念本质属性的规则、特征或原型, 是人类在心智
                 中对该概念的认知结构, 常用命题、向量或结构模型表示; 外延                   (extension) 则是满足这些内涵属性的具体实例集
                 合, 体现为数据样本或可视图像, 是概念在现实世界中的投射. 综上, 本文对概念的形式化表达如下:

                                                     C = {x ∈ X|ϕ(x) = 1},
                 其中,  X  表示输入空间   (图像、文本等),    ϕ(x) 表示概念内涵的认知函数       (如特征组合、神经激活规则等),          C 表示概念
                 的外延, 即现实世界中满足内涵的实例集合. 本文将概念内涵归纳为                    4 种主要类型: 符号化概念       (symbolic concept)、
                 相似模式簇    (similar pattern cluster)、原型  (prototype) 以及文本概念  (textual concept). 每一种类型都代表了概念在
                 可解释性研究中的独特角色和应用方式.
                    (1) 符号化概念. 符号化概念是指由人类预先定义并具有明确语义标签的高级抽象概念, 通常用于对模型内部
                 行为进行解释和对齐. 这类概念通常以属性、词语或结构性标签的形式存在, 如“翅膀”“红色”“圆形边缘”等, 能够
                 与特定视觉或语义特征直接对应. 在实际应用中, 符号化概念往往依赖于专家知识、人工注释或辅助元数据, 通过
                 将模型特征与这些语义单位建立映射, 提升可解释性的透明度与认知一致性. 例如, 在鸟类图像分类任务中, “翅
                 膀”或“鸟喙”可以作为符号化概念, 用于说明模型是基于哪些语义因素做出决策. 与其他类型的概念相比, 符号化
                 概念具备高度的可控性和明确性, 既可用于在事后分析中进行语义对齐, 也常用于在事中模型设计中作为先验引
                 导, 是当前可解释性建模中最常用的概念类型之一.
                    (2) 相似模式簇. 相似模式簇是指神经网络内部激活特征中具有相似空间分布或响应模式的一组聚类区域. 这
                 些聚类往往隐含着某种潜在的高阶语义结构, 例如纹理、边缘形状或局部结构模式, 尽管它们并非由人类直接标
                 注, 但在聚合后往往能对应某种可感知的抽象概念, 如“斑马的条纹”或“建筑的窗格”. 这类概念通常通过无监督聚
                 类算法从网络中间层特征中提取, 可在模型训练阶段或训练完成后进行分析, 因此被广泛应用于事中建模与事后
                 解释两类方法中. 与符号化概念相比, 相似模式簇更强调概念的自发性与可挖掘性, 无需预设标签, 适用于数据驱
                 动的解释机制. 在自动化概念构建与模型内部语义结构重构等任务中, 该类型概念发挥着重要作用, 是实现可扩展
                 性与语义泛化的重要手段之一.
                    (3) 原型. 原型是指训练数据中某一类样本或其局部区域中最具代表性的实例, 用于表达该类别在语义或特征
                 空间中的核心特征. 原型可以是完整样本             (如一张图像), 也可以是样本中关键的局部区域              (如鸟类图像中的头部区
                 域), 其作用是作为模型决策的可视化依据与语义参考点, 帮助解释“模型为什么将该输入判为某类”. 与无监督生
                 成的相似模式簇不同, 原型通常以结构化方式嵌入到模型中, 作为显式的模型组件进行建模, 例如在                               ProtoPNet [24]
                 等原型网络中, 每一个类别都由若干可视化原型构成, 模型通过比较输入与原型之间的距离做出分类决策. 这种方
                 式不仅实现了端到端的可解释性, 也使得模型内部表示具备可视追踪和人类语义对齐的能力. 由于原型需要在模
                 型训练过程中显式编码和优化, 它主要用于事中可解释方法, 不适用于训练完成后的事后分析. 原型方法特别适合
                 对透明性要求较高的任务场景, 如医疗图像诊断.
                    (4) 文本概念. 文本概念是指通过简洁的自然语言短语对类别或中间语义特征进行描述的概念形式, 旨在以人
   149   150   151   152   153   154   155   156   157   158   159