Page 6 - 《软件学报》2026年第5期
P. 6

软件学报 ISSN 1000-9825, CODEN RUXUEW                                        E-mail: jos@iscas.ac.cn
                 2026,37(5):1885−1886 [doi: 10.13328/j.cnki.jos.007546] [CSTR: 32375.14.jos.007546]  http://www.jos.org.cn
                 ©中国科学院软件研究所版权所有.                                                          Tel: +86-10-62562563



                                                        *
                 多媒体智能理解与生成专题前言

                 孙立峰  1 ,    闵巍庆  2 ,    马占宇  3 ,    蒋树强  4 ,    彭宇新  5 ,    田    丰  6 ,    黄庆明  4


                 1
                  (清华大学 计算机科学与技术系, 北京 100084)
                 2
                  (中国科学院 计算技术研究所 智能算法安全全国重点实验室, 北京 100190)
                 3
                  (北京邮电大学 人工智能学院, 北京 100876)
                 4
                  (中国科学院大学 计算机科学与技术学院, 北京 100049)
                 5
                  (北京大学 王选计算机研究所, 北京 100080)
                 6
                  (中国科学院 软件研究所 人机交互技术与智能信息处理实验室, 北京 100190)
                 通信作者: 闵巍庆 E-mail: minweiqing@ict.ac.cn
                 中文引用格式: 孙立峰, 闵巍庆, 马占宇, 蒋树强, 彭宇新, 田丰, 黄庆明. 多媒体智能理解与生成专题前言. 软件学报, 2026, 37(5):
                 1885–1886. http://www.jos.org.cn/1000-9825/7546.htm

                    多媒体技术是对文字、图像、图形、音视频等多种媒体信息进行内容处理和交互展示的技术. 随着互联网、
                 移动互联网、社交网络等泛在网络环境下多媒体数据的爆发式增长, 以及以大模型为代表的人工智能技术的迅猛
                 发展, 多媒体技术正迎来新一轮的发展浪潮. 如何高效、精准地理解与生成多媒体内容, 已成为该领域的前沿热
                 点. 认知科学的研究表明, 人脑能够通过视觉、听觉和语言等多种感官信息的关联协同认知外部世界, 因此如何借
                 鉴人脑的跨模态处理特性和认知机理, 是实现多媒体内容智能理解与生成的关键. 大模型等人工智能技术为多媒
                 体领域带来了方法论的变革, 推动了多媒体智能理解与生成技术的快速发展, 与此同时也催生出诸多新挑战. 例
                 如, 如何实现开放环境下可靠的多媒体内容感知与理解? 如何平衡神经系统和符号系统, 实现神经-符号相结合的
                 跨媒体推理? 如何基于多模态大模型实现精细可控的个性化多模态生成与编辑? 如何协同多模态环境感知、知识
                 引导和物理约束建立世界模型, 以增强智能体的多模态自主交互能力等.
                    本专题公开征文, 共收到投稿         25  篇. 论文均通过了形式审查, 内容涉及多媒体检索、问答、推荐和生成等. 特约
                 编辑先后邀请了      30  多位专家参与审稿工作, 每篇投稿至少邀请            2  位专家进行评审. 稿件经初审、复审、ChinaMM
                 2025  会议宣读和终审   4  个阶段, 历时  3  个多月, 最终有  8  篇论文入选本专题. 根据主题, 这些论文可以分为            3  组.
                    (1) 多模态学习
                    《融合音乐知识结构化表征的高精度符号音乐理解》提出了基于音乐理论的音乐知识与音乐序列的结构化
                 表征方法, 结合卷积神经网络、自注意力机制以及自适应增强的特征融合方法, 实现对序列语境的感知与语义特
                 征的增强, 提高了符号音乐理解的准确率.
                    《基于音频-语言模型的端到端说话人日志系统》提出了一种音频-语言多模态模型, 通过两阶段训练策略实
                 现语音识别能力与判断说话人归属能力的协同优化, 将音频-语言模型的能力泛化到各种下游任务中, 验证了所提
                 方法的有效性.
                    《交通场景多模态双阶反馈的三维目标检测方法》提出了一种多传感器融合方法, 利用                              RGB  图像深度补全
                 生成伪点云, 与真实点云结合以识别感兴趣区域, 缓解了伪点云精度受限与计算量增大的矛盾, 提升了特征提取效
                 率与检测精度.
                    (2) 多媒体检索、问答和推荐
                    《基于   CLIP  引导标签优化的弱监督图像哈希》提出了一种                CLIP  引导标签优化的弱监督哈希方法, 通过微
                 调  CLIP  挖掘图像关联的潜在文本标签, 利用优化后的文本和图像进行跨模态全局语义交互, 并针对用户标签的


                 *    收稿时间: 2025-09-28; jos 在线出版时间: 2025-09-29
   1   2   3   4   5   6   7   8   9   10   11