国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:杜鹏飞,李小勇,高雅丽
单位:杜鹏飞,可信分布式计算与服务教育部重点实验室(北京邮电大学), 北京 100876;北京邮电大学 网络空间安全学院, 北京 10087611,李小勇,可信分布式计算与服务教育部重点实验室(北京邮电大学), 北京 100876;北京邮电大学 网络空间安全学院, 北京 10087602,高雅丽,可信分布式计算与服务教育部重点实验室(北京邮电大学), 北京 100876;北京邮电大学 网络空间安全学院, 北京 10087603
关键词:多模态表征学习;表征学习;多模态机器学习;深度学习
基金:国家自然科学基金(U1836215)
我们生活在一个由大量不同模态内容构建而成的多媒体世界中,不同模态信息之间具有高度的相关性和互补性,多模态表征学习的主要目的就是挖掘出不同模态之间的共性和特性,产生出可以表示多模态信息的隐含向量.主要介绍了目前应用较广的视觉语言表征的相应研究工作,包括传统的基于相似性模型的研究方法和目前主流的基于语言模型的预训练的方法.目前比较好的思路和解决方案是将视觉特征语义化,然后与文本特征通过一个强大的特征抽取器产生出表征,其中,Transformer作为主要的特征抽取器被应用表征学习的各类任务中.分别从研究背景、不同研究方法的划分、测评方法、未来发展趋势等几个不同角度进行阐述.
来源:2021年第2期
《软件学报》期刊编辑部