Page 152 - 《软件学报》2026年第4期
P. 152

王家祺 等: 可解释深度学习的概念建模方法综述                                                         1593


                 “厨房”“SUV  车型”或“奔跑的动物”, 往往因拍摄角度、背景环境、遮挡因素、类内变异等因素而呈现出显著的多
                 样性. “厨房”可能包含橱柜、灶台、水槽、微波炉等多种组合形式, 其判定标准难以归结为固定规则; “奔跑的动
                 物”不仅涉及物体本身的外观, 还涉及动态姿态和语义情境. 这类概念的边界具有明显的模糊性和上下文依赖性,
                 难以通过一组稳定命题进行精确定义. 这些认知上的模糊与复杂暴露了经典内涵理论的局限性. 随着认知科学的
                 发展, 人们逐渐认识到, 大量现实概念更符合原型结构、样例积累和知识依赖的认知模型. 这也促使人工智能研究
                 引入现代认知视角, 尝试通过原型表示、相似模式聚类、语言描述等方式建模概念的现代内涵, 以增强模型的语
                 义可解释性和人机认知一致性.
                    有别于此前对深度学习可解释性方法的综述工作, 本文聚焦可解释深度学习中的概念建模方法, 系统总结其
                 在建模策略、解释机制与应用实践的研究进展和技术路径. 以模型解释机制介入的时间点为划分依据, 将现有工
                 作系统性地归纳为两大路径: 事后解释方法与事中解释方法. 前者通过模型分析和语义挖掘, 在训练完成后重构模
                 型内部的语义结构; 后者则在模型设计和训练过程中, 主动嵌入可解释结构、先验知识或语义约束, 从而实现内生
                 的解释能力. 在此分类框架下, 本文将梳理不同方法的建模思路与技术特点, 比较其在语义透明性、应用适应性与
                 性能保障方面的差异, 并分析当前研究所面临的主要挑战与发展趋势, 旨在为构建语义层面可解释的深度模型提
                 供系统参考与理论支撑.
                    本文第   1  节对可解释人工智能的基本定义及其在深度学习中的研究背景进行综述, 重点梳理“可解释性”与
                 “概念”的关系, 并基于认知科学视角对概念的内涵与外延进行分类, 明确“概念建模”在可解释性研究中的理论基
                 础与表达方式. 第     2  节对已有的事后可解释方法中概念建模的相关研究进行总结, 涵盖激活可视化、神经元解剖、
                 概念向量分析等方法, 并对其优势与局限进行分析. 第                3  节对事中可解释方法中的概念建模策略进行系统归纳, 涉
                 及原型网络、概念瓶颈网络以及相关可解释性损失函数等机制, 探讨模型内生可解释性的实现路径. 第                                 4  节总结
                 可解释性研究中常用的评价指标与度量手段, 包括语义一致性、人类认知对齐等方面的评估方法, 并评述当前在
                 概念层面可解释性度量方面的挑战. 第            5  节对该领域未来值得关注的研究方向进行展望, 特别关注概念抽象层次
                 的泛化能力、跨模态语义一致性以及与大模型语义表示的融合趋势等问题.
                  1   可解释深度学习

                  1.1   可解释性的基本定义

                    在可解释人工智能领域, 英文术语“Explanation”与“Interpretation”虽在中文中常被统称为“可解释”, 但在英文
                 语境下二者存在细微而重要的区别. 理解这一差异, 有助于厘清不同可解释性方法的侧重点及技术路径.
                    根据文献    [19] 的定义, Interpretation 通常指的是将模型内部的抽象表示        (如某个类别、语义标签或中间预测
                 结果) 映射到一个人类能够理解的认知域中, 即解释整个模型或其行为规律的过程. 例如, 某深度分类模型预测图
                 像属于“鸟类”这一类别时, 若能提供模型对“鸟类”概念的整体理解方式, 如对羽毛形状、颜色或身体结构的关注
                 模式, 则属于解释的整体性建模范畴. 而           Explanation 更强调的是对单个预测决策的具体成因进行剖析, 即在某一
                 特定输入   (如一张鸟类图片) 下, 模型依赖了哪些特征做出该决策. 它通常被定义为: “在可解释特征空间中, 对影响
                 模型某一决策结果的要素集合的识别过程.” 这种解释往往以热力图、特征掩码、梯度权重等形式呈现, 用以回答
                 “模型是基于哪些像素/特征做出该判断”的问题. 本文在此基础上总结出两类主流的可解释性方法.
                    一类是基于信息流的解释方法, 主要通过分析模型内部特征流动和传播路径来定位重要输入区域. 该类方法
                 的核心思想是: 通过分析模型内部信息如何在各层之间流动, 以及特征在输入与输出之间如何被利用, 从而估计哪
                 些输入区域或特征对模型预测起到了关键作用. 这类方法通常回答的是“模型关注了什么”, 其目标是标记出输入
                 中最具决策影响力的部分. 经典的信息流解释方法可大致分为前向扰动方法与后向传播方法. 前向扰动方法
                                       [27]
                 (forward-perturbation method)  通过对输入进行遮蔽、替换或模糊等有控制的干扰, 观察输出变化来评估输入各
                 区域的重要性. 例如, 可遮挡输入图像的某个区域, 并测量模型输出的波动程度, 从而判断该区域对决策的影响. 该
                 类方法的优点是实现简单、解释直观、不依赖模型梯度信息, 因此适用于各种模型结构; 但由于需要对每个区域
   147   148   149   150   151   152   153   154   155   156   157