国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:张清华,周靖鹏,代永杨,王国胤
单位:张清华,旅游多源数据感知与决策技术文化和旅游部重点实验室(重庆邮电大学), 重庆 400065;计算智能重庆市重点实验室(重庆邮电大学), 重庆 40006511,周靖鹏,旅游多源数据感知与决策技术文化和旅游部重点实验室(重庆邮电大学), 重庆 400065;计算智能重庆市重点实验室(重庆邮电大学), 重庆 40006502,代永杨,旅游多源数据感知与决策技术文化和旅游部重点实验室(重庆邮电大学), 重庆 400065;计算智能重庆市重点实验室(重庆邮电大学), 重庆 40006503,王国胤,旅游多源数据感知与决策技术文化和旅游部重点实验室(重庆邮电大学), 重庆 400065;计算智能重庆市重点实验室(重庆邮电大学), 重庆 40006504
关键词:聚类分析;密度峰值聚类;代表点;K近邻 (KNN)
基金:国家重点研发计划(2020YFC2003502); 国家自然科学基金(61876201); 重庆市自然科学基金(cstc2019jcyj-cxttX0002, cstc2021ycjh-bgzxm0013); 重庆市教委重点合作项目(HZ2021008)
密度峰值聚类(density peaks clustering, DPC)是一种基于密度的聚类算法, 该算法可以直观地确定类簇数量, 识别任意形状的类簇, 并且自动检测、排除异常点. 然而, DPC仍存在些许不足: 一方面, DPC算法仅考虑全局分布, 在类簇密度差距较大的数据集聚类效果较差; 另一方面, DPC中点的分配策略容易导致“多米诺效应”. 为此, 基于代表点(representative points)与K近邻(K-nearest neighbors, KNN)提出了RKNN-DPC算法. 首先, 构造了K近邻密度, 再引入代表点刻画样本的全局分布, 提出了新的局部密度; 然后, 利用样本的K近邻信息, 提出一种加权的K近邻分配策略以缓解“多米诺效应”; 最后, 在人工数据集和真实数据集上与5种聚类算法进行了对比实验, 实验结果表明, 所提出的RKNN-DPC可以更准确地识别类簇中心并且获得更好的聚类结果.
来源:2023年第12期
《软件学报》期刊编辑部