软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2025年第9期:提升隐式场景下短语视觉定位的因果建模方法

发布日期:

作者:赵嘉宁,王晶晶,罗佳敏,周国栋

单位:赵嘉宁,苏州大学 计算机科学与技术学院, 江苏 苏州 21500611,王晶晶,苏州大学 计算机科学与技术学院, 江苏 苏州 21500602,罗佳敏,苏州大学 计算机科学与技术学院, 江苏 苏州 21500603,周国栋,苏州大学 计算机科学与技术学院, 江苏 苏州 21500604

关键词:隐式短语-区域对齐关系;因果推理;短语视觉定位

基金:国家自然科学基金(62006166, 62076175, 62076176); 江苏高校优势学科建设工程

短语视觉定位是多模态研究中一个基础且重要的研究任务, 旨在预测细粒度的文本短语与图片区域的对齐关系. 尽管已有的短语视觉定位方法已经取得了不错的进展, 但都忽略了文本中的短语与其对应图片区域的隐式对齐关系(即隐式短语-区域对齐关系), 而预测这种关系可以有效评估模型理解深层多模态语义的能力. 因此, 为了有效建模隐式短语-区域对齐关系, 提出一种隐式增强的因果建模短语视觉定位方法. 该方法使用因果推理中的干预策略来缓解浅层语义所带来的混淆信息. 为评估模型理解深层多模态语义的能力, 标注一个高质量的隐式数据集, 并进行大量实验. 多组对比实验结果表明, 所提方法能够有效建模隐式短语-区域对齐关系. 此外, 在这个隐式数据集上, 所提方法的性能优于一些先进的多模态大语言模型, 这将进一步促进多模态大模型更多的面向隐式场景的研究.

来源:2025年第9期

《软件学报》期刊编辑部

查看软件学报杂志2025年第9期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员