Page 150 - 《软件学报》2026年第4期
P. 150

软件学报 ISSN 1000-9825, CODEN RUXUEW                                        E-mail: jos@iscas.ac.cn
                 2026,37(4):1591−1614 [doi: 10.13328/j.cnki.jos.007530] [CSTR: 32375.14.jos.007530]  http://www.jos.org.cn
                 ©中国科学院软件研究所版权所有.                                                          Tel: +86-10-62562563



                                                              *
                 可解释深度学习的概念建模方法综述

                 王家祺  1,2 ,    冯    毅  1,2 ,    刘华锋  1,2 ,    景丽萍  1,2 ,    于    剑  1,2


                 1
                  (交通数据挖掘与具身智能北京市重点实验室           (北京交通大学), 北京 100044)
                 2
                  (北京交通大学 计算机科学与技术学院, 北京 100044)
                 通信作者: 刘华锋, E-mail: hfliu1@bjtu.edu.cn; 景丽萍, E-mail: lpjing@bjtu.edu.cn

                 摘 要: 近年来, 深度神经网络在多个领域取得了显著进展, 但其作为典型的黑盒模型, 内部机制仍难以为人所理
                 解, 给医疗诊断、金融风控、自动驾驶等高风险应用场景带来了严峻挑战. 提升模型的可解释性, 已成为实现高可
                 信机器学习的核心问题之一. 现有可解释性方法大致可分为两类: 基于信息流的解释和基于概念的解释. 基于信息
                 流的解释主要侧重于神经元或特征重要性分析, 如定位图片中对分类结果起关键作用的像素区域. 虽然能揭示模
                 型“关注了什么”, 但难以提供具备人类语义的认知解释; 相比之下, 基于概念的解释通过构建语义空间, 将模型内
                 部表示映射为可理解的概念结构, 能够以“模型理解了什么”的方式提供更具语义深度和认知契合的解释, 在增强
                 语义透明性和用户信任方面展现出独特优势. 深度学习的不可解释性源于其语义表达的缺失, 因此, 如何构建对人
                 类认知友好的概念空间与表示机制, 已成为可解释模型研究的关键突破口. 围绕可解释深度学习中的概念建模方
                 法展开综述, 依据建模介入阶段将相关研究划分为事后解释与事中解释两大路径: 前者通过神经元解剖、语义聚
                 类等手段挖掘已有模型的概念表示, 后者则在训练过程中引入结构化先验或语义约束, 以实现模型的内生可解释
                 性. 基于该分类框架, 系统梳理了典型方法的建模思路与代表性成果, 比较其在语义透明性与实际应用中的性能差
                 异, 并总结当前研究面临的挑战与未来发展方向, 旨在为理解和构建语义可解释的深度模型提供系统性参考与方
                 法指引.
                 关键词: 可解释性; 深度学习; 概念表示; 事后解释; 自解释
                 中图法分类号: TP18

                 中文引用格式: 王家祺, 冯毅, 刘华锋, 景丽萍, 于剑. 可解释深度学习的概念建模方法综述. 软件学报, 2026, 37(4): 1591–1614. http://
                 www.jos.org.cn/1000-9825/7530.htm
                 英文引用格式: Wang  JQ,  Feng  Y,  Liu  HF,  Jing  LP,  Yu  J.  Survey  on  Concept-based  Modeling  Methods  for  Interpretable  Deep
                 Learning. Ruan Jian Xue Bao/Journal of Software, 2026, 37(4): 1591–1614 (in Chinese). http://www.jos.org.cn/1000-9825/7530.htm

                 Survey on Concept-based Modeling Methods for Interpretable Deep Learning
                                                              1,2
                                    1,2
                           1,2
                                                 1,2
                 WANG Jia-Qi , FENG Yi , LIU Hua-Feng , JING Li-Ping , YU Jian 1,2
                 1
                 (Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence (Beijing Jiaotong University), Beijing 100044, China)
                 2
                 (School of Computer Science & Technology, Beijing Jiaotong University, Beijing 100044, China)
                 Abstract:  In  recent  years,  deep  neural  networks  have  achieved  significant  progress  across  various  domains.  However,  as  typical  black-box
                 models,  their  internal  mechanisms  remain  difficult  for  humans  to  understand,  posing  serious  challenges  in  high-stakes  applications  such  as
                 medical diagnosis, financial risk management, and autonomous driving. Enhancing model interpretability has become one of the core issues
                 in  building  highly  trustworthy  machine  learning  systems.  Existing  interpretability  methods  can  be  broadly  classified  into  two  categories:


                 *    基金项目: 国家重点研发计划  (2024YFE0202900); 国家自然科学基金  (62436001); 国家自然科学基金青年基金 (62406019); 北京市自然
                  科学基金青年基金     (4244096); 北京交通大学人才基金  (2024XKRC075)
                  王家祺和冯毅为共同第一作者.
                  本文由“高可信自适应机器学习”专题特约编辑王熙照教授、张敏灵教授、曹付元教授推荐.
                  收稿时间: 2025-05-12; 修改时间: 2025-06-30, 2025-08-15; 采用时间: 2025-08-20; jos 在线出版时间: 2025-09-02
                  CNKI 网络首发时间: 2025-12-11
   145   146   147   148   149   150   151   152   153   154   155