软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2020年第11期:基于不相似性度量优化的密度峰值聚类算法

发布日期:

作者:丁世飞,徐晓,王艳茹

单位:丁世飞,中国矿业大学 计算机科学与技术学院, 江苏 徐州 221116;中国科学院 计算技术研究所 智能信息处理重点实验室, 北京 10019011,徐晓,中国矿业大学 计算机科学与技术学院, 江苏 徐州 22111602,王艳茹,中国矿业大学 计算机科学与技术学院, 江苏 徐州 22111603

关键词:密度峰值聚类;局部密度;决策图;不相似性度量;密度不均匀

基金:国家自然科学基金(61672522,61379101);国家重点基础研究发展计划(973)(2013CB329502)

密度峰值聚类(clustering by fast search and find of density peaks,简称DPC)是一种基于局部密度和相对距离属性快速寻找聚类中心的有效算法.DPC通过决策图寻找密度峰值作为聚类中心,不需要提前指定类簇数,并可以得到任意形状的簇聚类.但局部密度和相对距离的计算都只是简单依赖基于距离度量的相似度矩阵,所以在复杂数据上DPC聚类结果不尽如人意,特别是当数据分布不均匀、数据维度较高时.另外,DPC算法中局部密度的计算没有统一的度量,根据不同的数据集需要选择不同的度量方式.第三,截断距离dc的度量只考虑数据的全局分布,忽略了数据的局部信息,所以dc的改变会影响聚类的结果,尤其是在小样本数据集上.针对这些弊端,提出一种基于不相似性度量优化的密度峰值聚类算法(optimized density peaks clustering algorithm based on dissimilarity measure,简称DDPC),引入基于块的不相似性度量方法计算相似度矩阵,并基于新的相似度矩阵计算样本的K近邻信息,然后基于样本的K近邻信息重新定义局部密度的度量方法.经典数据集的实验结果表明,基于不相似性度量优化的密度峰值聚类算法优于DPC的优化算法FKNN-DPC和DPC-KNN,可以在密度不均匀以及维度较高的数据集上得到满意的结果;同时统一了局部密度的度量方式,避免了传统DPC算法中截断距离dc对聚类结果的影响.

来源:2020年第11期

《软件学报》期刊编辑部

查看软件学报杂志2020年第11期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员