软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2022年第11期:多尺度拼图重构网络的食品图像识别

发布日期:

作者:刘宇昕,闵巍庆,蒋树强,芮勇

单位:刘宇昕,中国科学院 智能信息处理重点实验室 (中国科学院 计算技术研究所), 北京 100190;中国科学院大学, 北京 10004911,闵巍庆,中国科学院 智能信息处理重点实验室 (中国科学院 计算技术研究所), 北京 100190;中国科学院大学, 北京 10004902,蒋树强,中国科学院 智能信息处理重点实验室 (中国科学院 计算技术研究所), 北京 100190;中国科学院大学, 北京 10004903,芮勇,联想集团, 北京 10008504

关键词:食品图像识别;深度学习;拼图重构;特征金字塔;注意力机制

基金:国家自然科学基金(61972378,U1936203,U19B2040)

近年来,食品图像识别由于在健康饮食管理、无人餐厅等领域的广泛应用而受到了越来越多的关注.不同于其他物体识别任务,食品图像属于细粒度图像,具有较高的类内差异性和类间相似性,而且食品图像没有固定的语义模式和空间布局,这些特点使得食品图像识别更具挑战性.为此,提出了一种用于食品图像识别的多尺度拼图重构网络(multi-scale jigsaw and reconstruction network,MJR-Net).MJR-Net由拼图重构模块、特征金字塔模块和通道注意力模块这3部分组成.拼图重构模块使用破坏重构学习方法将原始图像进行破坏和重构,以提取局部的判别性细节特征;特征金字塔模块可以融合不同尺寸的中层特征,以捕获多尺度的局部判别性特征;通道注意力模块对不同特征通道的重要程度进行建模,以增强判别性的视觉模式,减弱噪声干扰.此外,还使用A-softmax和Focal损失,分别从增大类间差异和修正分类样本的角度优化网络.MJR-Net在ETH Food-101,Vireo Food-172和ISIA Food-500这3个食品数据集上进行实验,分别取得了90.82%,91.37%和64.95%的识别准确率.实验结果表明,与其他食品图像识别方法相比,MJR-Net表现出较大的竞争力,并在Vireo Food-172和ISIA Food-500上取得了最优识别性能.全面的消融实验和可视化分析证明了该方法的有效性.

来源:2022年第11期

《软件学报》期刊编辑部

查看软件学报杂志2022年第11期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员