国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:张安珍,李建中,高宏
单位:张安珍,哈尔滨工业大学 计算机科学与技术学院, 黑龙江 哈尔滨 150001;沈阳航空航天大学 计算机学院, 辽宁 沈阳 11013611,李建中,哈尔滨工业大学 计算机科学与技术学院, 黑龙江 哈尔滨 15000102,高宏,哈尔滨工业大学 计算机科学与技术学院, 黑龙江 哈尔滨 15000103
关键词:不完整数据;近似查询处理;数据修复;结果估计;数据可用性
基金:国家自然科学基金(61702344)
研究了基于符号语义的不完整数据聚集查询处理问题.不完整数据又称为缺失数据,缺失值包括可填充的和不可填充的两种类型.现有的缺失值填充算法不能保证填充后查询结果的准确度,为此,给出了不完整数据聚集查询结果的区间估计.在符号语义中扩展了传统关系数据库模型,提出了一种通用不完整数据库模型.该模型可以处理可填充的和不可填充的两种类型缺失值.在该模型下,提出一种新的不完整数据聚集查询结果语义:可靠结果.可靠结果是真实查询结果的区间估计,可以保证真实查询结果有很大概率在该估计区间范围内.给出了线性时间求解SUM、COUNT和AVG查询可靠结果的方法.真实数据集和合成数据集上的扩展实验验证了所提方法的有效性.
来源:2020年第2期
《软件学报》期刊编辑部