国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:姚暄,高君宇,徐常胜
单位:姚暄,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院大学 人工智能学院, 北京 10019011,高君宇,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院大学 人工智能学院, 北京 10019002,徐常胜,模式识别国家重点实验室(中国科学院 自动化研究所), 北京 100190;中国科学院大学 人工智能学院, 北京 100190;鹏城实验室, 广东 深圳 51805503
关键词:图对比学习;视频问答;图数据增强;预训练
基金:科技创新2030-“新一代人工智能”重大项目(2020AAA0106200);国家自然科学基金(62036012,U21B2044,62102415,62072286,61721004);之江实验室开放课题(2022RC0AB02);CCF-海康威视“斑头雁”基金(20210004)
视频问答作为一种跨模态理解任务,在给定一段视频和与之相关的问题的条件下,需要通过不同模态语义信息之间的交互来产生问题的答案.近年来,由于图神经网络在跨模态信息融合与推理方面强大的能力,其在视频问答任务中取得了显著的进展.但是,大多数现有的图网络方法由于自身固有的过拟合或过平滑、弱鲁棒性和弱泛化性的缺陷使得视频问答模型的性能未能进一步提升.鉴于预训练技术中自监督对比学习方法的有效性和鲁棒性,在视频问答任务中利用图数据增强的思路提出了一种图网络自监督对比学习框架GMC.该框架使用针对节点和边的两种数据增强操作来生成相异子样本,并通过提升原样本与生成子样本图数据预测分布之间的一致性来提高视频问答模型的准确率和鲁棒性.在视频问答公开数据集上通过与现有先进的视频问答模型和不同GMC变体模型的实验对比验证了所提框架的有效性.
来源:2023年第5期
《软件学报》期刊编辑部