国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:马福民,宫婷,杨帆,张腾飞
单位:南京财经大学 信息工程学院,南京 210023,,南京财经大学 信息工程学院,南京 210023,,南京财经大学 信息工程学院,南京 210023,,南京邮电大学 自动化学院、人工智能学院,南京 210023,
关键词:聚类;密度峰值;网格;Zipf分布;密度阈值
基金:国家自然科学基金项目(61973151,62073173);江苏省自然科学基金项目(BK20191406);江苏省重点研发计划项目(BE2021001-4);江苏省研究生科研与实践创新计划项目(G-TXW21001);江苏省高校青蓝工程项目.
网格密度峰值聚类在兼顾密度峰值聚类算法可识别任意形状类簇的基础上,通过数据集的网格化简化整体计算量,成为当前备受关注的聚类方法.针对大规模数据,如何进一步区分稠密与稀疏网格,减少网格密度峰值聚类中参与计算的非空网格代表点的数量是解决“网格灾难”的关键.结合以网格密度为变量的概率密度分布呈现出类Zipf分布的特点,提出一种基于Zipf分布的网格密度峰值聚类算法.首先计算所有非空网格的密度并映射为Zipf分布,根据对应的Zipf分布筛选出稠密中心网格和稀疏边缘网格;然后仅对稠密中心网格进行密度峰值聚类,在自适应确定潜在聚类中心的同时减少欧氏距离的计算量,降低算法复杂度;最后通过对稀疏边缘网格的处理,进一步优化类簇边界并提高聚类精度.人工数据集和UCI数据集下的实验结果表明,所提出算法对大规模、类簇交叉数据的聚类具有明显优势,能够在保证聚类精度的同时降低时间复杂度.
来源:2024年第2期
《控制与决策》期刊编辑部