国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:殷炯,张哲东,高宇涵,杨智文,李亮,肖芒,孙垚棋,颜成钢
单位:殷炯,杭州电子科技大学 计算机学院, 浙江 杭州 31001811,张哲东,杭州电子科技大学 自动化学院, 浙江 杭州 31001802,高宇涵,杭州电子科技大学丽水研究院, 浙江 丽水 323000;杭州电子科技大学 自动化学院, 浙江 杭州 31001803,杨智文,杭州电子科技大学 计算机学院, 浙江 杭州 31001804,李亮,中国科学院 计算技术研究所, 北京 10019005,肖芒,浙江大学医学院附属邵逸夫医院, 浙江 杭州 31001606,孙垚棋,杭州电子科技大学 自动化学院, 浙江 杭州 31001807,颜成钢,杭州电子科技大学 自动化学院, 浙江 杭州 31001808
关键词:多模态学习;预训练模型;Transformer;视觉语言学习
基金:国家重点研发计划(2020YFB1406604);国家自然科学基金(61931008,62071415,U21B2024)
近年来深度学习在计算机视觉(CV)和自然语言处理(NLP)等单模态领域都取得了十分优异的性能.随着技术的发展,多模态学习的重要性和必要性已经慢慢展现.视觉语言学习作为多模态学习的重要部分,得到国内外研究人员的广泛关注.得益于Transformer框架的发展,越来越多的预训练模型被运用到视觉语言多模态学习上,相关任务在性能上得到了质的飞跃.系统地梳理了当前视觉语言预训练模型相关的工作,首先介绍了预训练模型的相关知识,其次从两种不同的角度分析比较预训练模型结构,讨论了常用的视觉语言预训练技术,详细介绍了5类下游预训练任务,最后介绍了常用的图像和视频预训练任务的数据集,并比较和分析了常用预训练模型在不同任务下不同数据集上的性能.
来源:2023年第5期
《软件学报》期刊编辑部