Page 168 - 《软件学报》2026年第4期
P. 168
王家祺 等: 可解释深度学习的概念建模方法综述 1609
值, 从而规避了偏见等问题. 具体地, 通过以下公式来把“解释对人有没有用”量化成一个 Utility-K 值:
( )
P ψ (K) (x) = f (x)
Utility-K = ,
(0)
P(ψ (x) = f (x))
其中, 分子表示用 K 个带解释的样本训练后, 人在新样本上能猜对模型结果的概率, 分母表示完全不看解释时的
概率, 人猜对的概率比值 >1 就说明解释确实帮到人; =1 说明没用; <1 反而更差. 实验时 K 取多个值, 画出 Utility-K
曲线, 再算曲线下面积 (AUC) 得到最终 Utility 分数. 作者基于 1 150 名受试者的大规模心理物理学实验, 在 3 个真
实场景中系统检验了主流归因方法的人本效用, 结果一致表明: 传统的“忠实度”指标与人类的实际收益之间几乎
不存在有效关联.
尽管已有多种指标被提出并广泛使用, 但整体来看当前可解释性评估体系仍处于早期阶段, 评估指标零散、
定义不统一, 且大多依赖特定模型或任务. 未来应致力于构建标准化的评估基准与统一的评价体系, 以支持不同模
型间更公平、可比的解释能力对比, 从而为构建可信、可控的智能系统打下坚实基础.
5 未来展望与挑战
尽管基于概念的可解释深度学习方法在提升模型的语义透明性和人类可理解性方面取得了诸多进展, 但该领
域仍处于快速演进阶段, 面临多方面的挑战, 仍有广阔的研究空间亟待深入探索. 现有方法在概念建模、理论支撑、
模态对齐、模型规模适配等方面尚存诸多不足. 为了推动可解释性研究从局部实验走向系统化发展, 以下几个方
向可能成为未来突破的关键路径.
(1) 语义异构性与概念建模的复杂性. 在现实物理世界中, 任务场景千差万别, 概念空间随之呈碎片化分布. 医
疗影像需要捕捉“坏死灶边缘毛糙度”这类微米级特征; 自动驾驶则要同时解析“信号灯相位-行人意图-车辆轨迹”的
多层耦合语义. 二者在概念粒度、抽象层级与专业知识壁垒上差异巨大. 目前主流研究仍聚焦于简单图像分类, 依
赖预定义概念即可勉强应对, 一旦转向复杂场景, 静态概念集既难以穷尽隐含模式, 又无法跟随数据演化 (如
COVID-19 影像特征持续变异), 导致解释缺口不断放大. 因此, 亟需构建自适应概念发现机制, 依托无监督或自监
督学习, 从原始数据中自动蒸馏概念基元, 摆脱对人工先验的依赖. 更进一步, 可打造可生长的概念图谱——底层
由数据驱动生成细粒度原型, 顶层由大语言模型实时映射为人类可读的语义标签, 形成分层锚定; 同时内置增量扩
展与概念遗忘模块, 当数据分布漂移或医学指南更新时, 系统自动淘汰失效概念、吸纳新兴模式, 使概念空间始终
与物理世界同步演化.
(2) 概念解释的基础理论研究亟待突破. 当前可解释人工智能中的“概念解释”研究面临理论瓶颈. 首先, 神经
网络生成的连续向量空间与人类心智赖以运作的离散符号体系之间存在难以弥合的认知鸿沟——前者基于高维
数值分布, 后者依赖结构化符号推理, 两者在表示机制和操作规则上存在本质差异. 其次, 现有研究缺乏对“概念”本
质的深层理解, 大量工作停留在围绕 ProtoPNet、CBM 等模型的工程化改进, 却鲜少追问概念在认知层面的真正
内涵. 最后, 缺乏统一的理论框架来定义何为“好的概念解释”, 导致不同方法之间难以比较, 解释质量评估缺乏客
观标准. 破解这一难题需要从认知对齐的角度重新审视概念解释问题, 核心思路是构建“神经-符号”桥梁, 借鉴认
知科学中的“原型理论” [71] 和“概念空间理论” [72] , 将人类概念建模为概率原型与语境依赖边界的统一体. 具体而言,
可构建一个 3 层映射理论框架: 神经表示层, 刻画深度网络中的分布式特征表示, 通过高维向量空间编码输入的底
层特征模式; 概念抽象层, 建立连接神经表示与符号概念的中间抽象, 采用概念空间理论 [72] 的几何结构将概念表
示为具有凸性质的区域, 其中原型对应区域中心, 边界体现概念的模糊性和语境敏感性; 认知理解层, 对应人类的
概念认知结构, 确保抽象概念与人类直觉和专家知识保持一致. 在技术实现上, 通过信息论原理量化不同层间的信
息传递损失和压缩效率, 运用拓扑几何学描述概念在高维空间中的邻域结构、连通性和可分性, 结合认知心理学
实验验证概念分类的生态有效性, 从而确保概念表示既具备数学严谨性, 又符合人类认知规律.
(3) 多模态概念建模与对齐机制亟需完善. 多模态概念建模面临多重挑战. 首先, 模态异构性导致的表示鸿沟.
视觉信息以像素矩阵编码, 语言信息以符号序列表达, 听觉信息以频谱特征呈现, 这些异构表示在数学结构、信息
密度和时空特性上存在本质差异, 难以直接建立映射关系. 其次, 语义粒度的多尺度不匹配. 视觉概念可能对应像

