国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:赵东明,邱圆辉,康瑞,宋韶旭,黄向东,王建民
单位:赵东明,清华大学 软件学院, 北京 10008411,邱圆辉,清华大学 软件学院, 北京 10008402,康瑞,清华大学 软件学院, 北京 10008403,宋韶旭,清华大学 软件学院, 北京 100084;大数据系统软件国家工程研究中心(清华大学), 北京 100084;北京信息科学与技术国家研究中心(清华大学), 北京 10008404,黄向东,清华大学 软件学院, 北京 100084;大数据系统软件国家工程研究中心(清华大学), 北京 100084;北京信息科学与技术国家研究中心(清华大学), 北京 10008405,王建民,清华大学 软件学院, 北京 100084;大数据系统软件国家工程研究中心(清华大学), 北京 100084;北京信息科学与技术国家研究中心(清华大学), 北京 10008406
关键词:预聚合;聚合查询;查询重写;物理元数据管理;时间序列数据库
基金:国家自然科学基金(62072265,62021002);国家重点研发计划(2021YFB3300500,2019YFB1705301,2019YFB1707001);北京信息科学与技术国家研究中心青年创新基金(BNR2022RC01011);工信部2020年新兴平台软件项目
时间序列数据在能源、制造、金融、气候等领域有着广泛应用,聚合查询是相关分析场景中常见的查询需求,快速获取海量数据的概要信息,对于提高数据分析工作的效率具有重要意义.通过存储元数据加速聚合查询是一种有效的提升聚合查询执行效率的手段,但现有的时间序列数据库都使用时间窗口切分数据,需要对数据进行实时排序和分区,难以适应物联网场景下高并发、大吞吐量的数据写入特点.因此,提出了一种面向聚合查询的Apache IoTDB物理元数据管理方案.该方案按照数据文件的物理存储特性切分数据,并结合同步计算和异步计算策略,优先保证数据的写入性能.针对时间序列数据中普遍存在的乱序数据,将时间范围重叠的一组文件抽象为乱序文件组并提供元数据,聚合查询会被重写为3个结合物理元数据和原始数据的子查询高效执行.多个数据集上的实验验证了该方案对聚合查询执行效率的提升效果以及不同计算策略对性能的影响.
来源:2023年第3期
《软件学报》期刊编辑部