软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2024年第5期:基于条件语义增强的文本到图像生成

发布日期:

作者:余凯,宾燚,郑自强,杨阳

单位:余凯,电子科技大学 计算机科学与工程学院, 四川 成都 611731;电子科技大学(深圳)高等研究院, 广东 深圳 51811011,宾燚,电子科技大学 计算机科学与工程学院, 四川 成都 61173102,郑自强,电子科技大学 计算机科学与工程学院, 四川 成都 61173103,杨阳,电子科技大学 计算机科学与工程学院, 四川 成都 61173104

关键词:文本到图像生成;条件语义增强;空间-语义融合

基金:国家自然科学基金(62102070,U20B2063,62220106008);四川省科技计划(2023NSFSC1392)

文本到图像生成取得了视觉上的优异效果, 但存在细节表达不足的问题. 于是提出基于条件语义增强的生成对抗模型(conditional semantic augmentation generative adversarial network, CSA-GAN). 所提模型首先将文本进行编码, 使用条件语义增强对其进行处理. 之后, 提取生成器的中间特征进行上采样, 再通过两层CNN生成图像的掩码. 最后将文本编码送入两个感知器处理后和掩码进行融合, 充分融合图像空间特征和文本语义, 以提高细节表达. 为了验证所提模型的生成图像的质量, 在不同的数据集上进行定量分析、定性分析. 使用IS (inception score)、FID (Frechet inception distance)指标对图像清晰度, 多样性和图像的自然真实程度进行定量评估. 定性分析包括可视化生成的图像, 消融实验分析具体模块等. 结果表明: 所提模型均优于近年来同类最优工作. 这充分验证所提出的方法具有更优性能, 同时能够优化图像生成过程中一些主体特征细节的表达.

来源:2024年第5期

《软件学报》期刊编辑部

查看软件学报杂志2024年第5期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员