软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2025年第3期:GT-4S: 基于图Transformer的场景草图语义分割

发布日期:

作者:张拯明,郭燕,马翠霞,邓小明,王宏安

单位:张拯明,人机交互北京市重点实验室(中国科学院 软件研究所), 北京 100190;中国科学院大学 计算机科学与技术学院, 北京 10004911,郭燕,人机交互北京市重点实验室(中国科学院 软件研究所), 北京 100190;中国科学院大学 计算机科学与技术学院, 北京 10004902,马翠霞,人机交互北京市重点实验室(中国科学院 软件研究所), 北京 100190;中国科学院大学 计算机科学与技术学院, 北京 10004903,邓小明,人机交互北京市重点实验室(中国科学院 软件研究所), 北京 100190;中国科学院大学 计算机科学与技术学院, 北京 10004904,王宏安,人机交互北京市重点实验室(中国科学院 软件研究所), 北京 100190;中国科学院大学 计算机科学与技术学院, 北京 10004905

关键词:场景草图;语义分割;图;Transformer

基金:国家自然科学基金(62272447); 北京市自然科学基金-海淀原始创新联合基金(L222008)

场景草图由多个前、背景物体组成, 能够直观、概括地表达复杂的语义信息, 在现实生活中有着广泛的实际应用, 逐渐成为计算机视觉和人机交互领域的研究热点之一. 作为场景草图语义理解的基础任务, 场景草图语义分割的相关研究相对较少, 现有的方法多是对自然图像语义分割的方法进行改进, 不能克服草图自身的稀疏性和抽象性等特点. 针对以上问题, 直接从草图笔画入手, 提出一种图Transformer模型结合草图笔画的时空信息来解决自由手绘场景草图语义分割任务. 首先将矢量场景草图构建成图结构, 笔画表示为图的节点, 笔画在时序和空间上的关联表示为图的边. 然后通过边增强的Transformer模块捕获笔画的时空全局上下文信息. 最后将编码后的时空特征进行多分类优化学习. 在SFSD场景草图数据集上的实验结果表明, 所提方法可以利用笔画时空信息对场景草图进行有效的语义分割, 实现优秀的性能.

来源:2025年第3期

《软件学报》期刊编辑部

查看软件学报杂志2025年第3期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员