软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2023年第3期:多模态医疗数据中海量小文件存储优化方法

发布日期:

作者:曾梦,邹北骥,张文生,杨雪冰,朱承璋

单位:曾梦,中南大学 计算机学院, 湖南 长沙 410083;湖南省机器视觉与智慧医疗工程技术研究中心(中南大学), 湖南 长沙 41008311,邹北骥,中南大学 计算机学院, 湖南 长沙 410083;湖南省机器视觉与智慧医疗工程技术研究中心(中南大学), 湖南 长沙 41008302,张文生,中国科学院 自动化研究所, 北京 10019003,杨雪冰,中国科学院 自动化研究所, 北京 10019004,朱承璋,中南大学 文学与新闻传播学院, 湖南 长沙 410083;湖南省机器视觉与智慧医疗工程技术研究中心(中南大学), 湖南 长沙 41008305

关键词:多模态医疗数据;HDFS;HBase;小文件;存储性能优化

基金:科技创新2030——“新一代人工智能”重大项目(2018AAA0102100);湖南省科技计划项目(2017WK2074);湖南省高新技术产业科技创新引领计划(2020GK2021)

Hadoop分布式文件系统(HDFS)通常用于大文件的存储和管理,当进行海量小文件的存储和计算时,会消耗大量的NameNode内存和访问时间,成为制约HDFS性能的一个重要因素.针对多模态医疗数据中海量小文件问题,提出一种基于双层哈希编码和HBase的海量小文件存储优化方法.在小文件合并时,使用可扩展哈希函数构建索引文件存储桶,使索引文件可以根据需要进行动态扩展,实现文件追加功能.在每个存储桶中,使用MWHC哈希函数存储每个文件索引信息在索引文件中的位置,当访问文件时,无须读取所有文件的索引信息,只需读取相应存储桶中的索引信息即可,从而能够在O (1)的时间复杂度内读取文件,提高文件查找效率.为了满足多模态医疗数据的存储需求,使用HBase存储文件索引信息,并设置标识列用于标识不同模态的医疗数据,便于对不同模态数据的存储管理,并提高文件的读取速度.为了进一步优化存储性能,建立了基于LRU的元数据预取机制,并采用LZ4压缩算法对合并文件进行压缩存储.通过对比文件存取性能、NameNode内存使用率,实验结果表明,所提出的算法与原始HDFS、HAR、MapFile、TypeStorage以及HPF小文件合并方法相比,文件读取时间更短,能够提高HDFS在处理多模态医疗数据中海量小文件时的整体性能.

来源:2023年第3期

《软件学报》期刊编辑部

查看软件学报杂志2023年第3期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员