国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:赵恩源,宋宁,聂婕,王鑫,郑程予,魏志强
单位:赵恩源,中国海洋大学 信息科学与工程学部, 山东 青岛 26610011,宋宁,中国海洋大学 信息科学与工程学部, 山东 青岛 26610002,聂婕,中国海洋大学 信息科学与工程学部, 山东 青岛 26610003,王鑫,清华大学 计算机科学与技术系, 北京 10008404,郑程予,中国海洋大学 信息科学与工程学部, 山东 青岛 26610005,魏志强,中国海洋大学 信息科学与工程学部, 山东 青岛 266100;青岛海洋科技中心, 山东 青岛 26606106
关键词:遥感视觉问答;多模态智能融合;多模态推理;多尺度表征
基金:国家重点研发计划(2021YFF0704000);国家自然科学基金(62172376);国家自然科学基金区域创新发展联合基金(U22A2068);中央引导地方科技发展专项资金(YDZX2022028)
遥感视觉问答(remote sensing visual question answering, RSVQA)旨在从遥感图像中抽取科学知识. 近年来, 为了弥合遥感视觉信息与自然语言之间的语义鸿沟, 涌现出许多方法. 但目前方法仅考虑多模态信息的对齐和融合, 既忽略了对遥感图像目标中的多尺度特征及其空间位置信息的深度挖掘, 又缺乏对尺度特征的建模和推理的研究, 导致答案预测不够全面和准确. 针对以上问题, 提出一种多尺度引导的融合推理网络(multi-scale guided fusion inference network, MGFIN), 旨在增强RSVQA系统的视觉空间推理能力. 首先, 设计基于Swin Transformer的多尺度视觉表征模块, 对嵌入空间位置信息的多尺度视觉特征进行编码; 其次, 在语言线索的引导下, 使用多尺度关系推理模块以尺度空间为线索学习跨多个尺度的高阶群内对象关系, 并进行空间层次推理; 最后, 设计基于推理的融合模块来弥合多模态语义鸿沟, 在交叉注意力基础上, 通过自监督范式、对比学习方法、图文匹配机制等训练目标来自适应地对齐融合多模态特征, 并辅助预测最终答案. 实验结果表明, 所提模型在两个公共RSVQA数据集上具有显著优势.
来源:2024年第5期
《软件学报》期刊编辑部