Page 6 - 《软件学报》2026年第5期
P. 6
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
2026,37(5):1885−1886 [doi: 10.13328/j.cnki.jos.007546] [CSTR: 32375.14.jos.007546] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
*
多媒体智能理解与生成专题前言
孙立峰 1 , 闵巍庆 2 , 马占宇 3 , 蒋树强 4 , 彭宇新 5 , 田 丰 6 , 黄庆明 4
1
(清华大学 计算机科学与技术系, 北京 100084)
2
(中国科学院 计算技术研究所 智能算法安全全国重点实验室, 北京 100190)
3
(北京邮电大学 人工智能学院, 北京 100876)
4
(中国科学院大学 计算机科学与技术学院, 北京 100049)
5
(北京大学 王选计算机研究所, 北京 100080)
6
(中国科学院 软件研究所 人机交互技术与智能信息处理实验室, 北京 100190)
通信作者: 闵巍庆 E-mail: minweiqing@ict.ac.cn
中文引用格式: 孙立峰, 闵巍庆, 马占宇, 蒋树强, 彭宇新, 田丰, 黄庆明. 多媒体智能理解与生成专题前言. 软件学报, 2026, 37(5):
1885–1886. http://www.jos.org.cn/1000-9825/7546.htm
多媒体技术是对文字、图像、图形、音视频等多种媒体信息进行内容处理和交互展示的技术. 随着互联网、
移动互联网、社交网络等泛在网络环境下多媒体数据的爆发式增长, 以及以大模型为代表的人工智能技术的迅猛
发展, 多媒体技术正迎来新一轮的发展浪潮. 如何高效、精准地理解与生成多媒体内容, 已成为该领域的前沿热
点. 认知科学的研究表明, 人脑能够通过视觉、听觉和语言等多种感官信息的关联协同认知外部世界, 因此如何借
鉴人脑的跨模态处理特性和认知机理, 是实现多媒体内容智能理解与生成的关键. 大模型等人工智能技术为多媒
体领域带来了方法论的变革, 推动了多媒体智能理解与生成技术的快速发展, 与此同时也催生出诸多新挑战. 例
如, 如何实现开放环境下可靠的多媒体内容感知与理解? 如何平衡神经系统和符号系统, 实现神经-符号相结合的
跨媒体推理? 如何基于多模态大模型实现精细可控的个性化多模态生成与编辑? 如何协同多模态环境感知、知识
引导和物理约束建立世界模型, 以增强智能体的多模态自主交互能力等.
本专题公开征文, 共收到投稿 25 篇. 论文均通过了形式审查, 内容涉及多媒体检索、问答、推荐和生成等. 特约
编辑先后邀请了 30 多位专家参与审稿工作, 每篇投稿至少邀请 2 位专家进行评审. 稿件经初审、复审、ChinaMM
2025 会议宣读和终审 4 个阶段, 历时 3 个多月, 最终有 8 篇论文入选本专题. 根据主题, 这些论文可以分为 3 组.
(1) 多模态学习
《融合音乐知识结构化表征的高精度符号音乐理解》提出了基于音乐理论的音乐知识与音乐序列的结构化
表征方法, 结合卷积神经网络、自注意力机制以及自适应增强的特征融合方法, 实现对序列语境的感知与语义特
征的增强, 提高了符号音乐理解的准确率.
《基于音频-语言模型的端到端说话人日志系统》提出了一种音频-语言多模态模型, 通过两阶段训练策略实
现语音识别能力与判断说话人归属能力的协同优化, 将音频-语言模型的能力泛化到各种下游任务中, 验证了所提
方法的有效性.
《交通场景多模态双阶反馈的三维目标检测方法》提出了一种多传感器融合方法, 利用 RGB 图像深度补全
生成伪点云, 与真实点云结合以识别感兴趣区域, 缓解了伪点云精度受限与计算量增大的矛盾, 提升了特征提取效
率与检测精度.
(2) 多媒体检索、问答和推荐
《基于 CLIP 引导标签优化的弱监督图像哈希》提出了一种 CLIP 引导标签优化的弱监督哈希方法, 通过微
调 CLIP 挖掘图像关联的潜在文本标签, 利用优化后的文本和图像进行跨模态全局语义交互, 并针对用户标签的
* 收稿时间: 2025-09-28; jos 在线出版时间: 2025-09-29

