国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:李登,武阿明,韩亚洪
单位:李登,天津大学 智能与计算学部, 天津 30035011,武阿明,西安电子科技大学 电子工程学院, 陕西 西安 71040102,韩亚洪,天津大学 智能与计算学部, 天津 30035003
关键词:视觉-语言预训练;超图神经网络;多元实体对齐;注意力机制;多模态理解
基金:国家自然科学基金(62376186, 61932009)
视觉-语言预训练(visual-language pre-training, VLP)旨在通过在大规模图像-文本多模态数据集上进行学习得到强大的多模态表示. 多模态特征融合、对齐是多模态模型训练的关键挑战. 现有的大多数视觉-语言预训练模型对于多模态特征融合、对齐问题主要方式是将提取的视觉特征和文本特征直接输入至Transformer 模型中. 通过Transformer模型中的attention模块进行融合, 由于attention机制计算的是两两之间的相似度, 因而该方法难以实现多元实体间的对齐. 鉴于超图神经网络的超边具有连接多个实体、编码高阶实体相关性的特性, 进而实现多元实体间关系的建立. 提出基于超图神经网络的多元实体对齐的视觉-语言多模态模型预训练方法. 该方法在Transformer 多模态融合编码器中引入超图神经网络学习模块学习多模态间多元实体的对齐关系以增强预训练模型中多模态融合编码器实体对齐能力. 在大规模图像-文本数据集上对所提视觉-语言预训练模型进行预训练并在视觉问答、图文检索、视觉定位以及自然语言视觉推理多个视觉-语言下游任务上进行微调实验, 实验结果表明所提方法相比于baseline方法在多个下游任务中性能均有提升, 其中在NLVR2任务上相比baseline方法准确率提升1.8%.
来源:2025年第11期
《软件学报》期刊编辑部