软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2023年第5期:视觉语言预训练综述

发布日期:

作者:殷炯,张哲东,高宇涵,杨智文,李亮,肖芒,孙垚棋,颜成钢

单位:殷炯,杭州电子科技大学 计算机学院, 浙江 杭州 31001811,张哲东,杭州电子科技大学 自动化学院, 浙江 杭州 31001802,高宇涵,杭州电子科技大学丽水研究院, 浙江 丽水 323000;杭州电子科技大学 自动化学院, 浙江 杭州 31001803,杨智文,杭州电子科技大学 计算机学院, 浙江 杭州 31001804,李亮,中国科学院 计算技术研究所, 北京 10019005,肖芒,浙江大学医学院附属邵逸夫医院, 浙江 杭州 31001606,孙垚棋,杭州电子科技大学 自动化学院, 浙江 杭州 31001807,颜成钢,杭州电子科技大学 自动化学院, 浙江 杭州 31001808

关键词:多模态学习;预训练模型;Transformer;视觉语言学习

基金:国家重点研发计划(2020YFB1406604);国家自然科学基金(61931008,62071415,U21B2024)

近年来深度学习在计算机视觉(CV)和自然语言处理(NLP)等单模态领域都取得了十分优异的性能.随着技术的发展,多模态学习的重要性和必要性已经慢慢展现.视觉语言学习作为多模态学习的重要部分,得到国内外研究人员的广泛关注.得益于Transformer框架的发展,越来越多的预训练模型被运用到视觉语言多模态学习上,相关任务在性能上得到了质的飞跃.系统地梳理了当前视觉语言预训练模型相关的工作,首先介绍了预训练模型的相关知识,其次从两种不同的角度分析比较预训练模型结构,讨论了常用的视觉语言预训练技术,详细介绍了5类下游预训练任务,最后介绍了常用的图像和视频预训练任务的数据集,并比较和分析了常用预训练模型在不同任务下不同数据集上的性能.

来源:2023年第5期

《软件学报》期刊编辑部

查看软件学报杂志2023年第5期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员