当前位置:问答库>论文摘要

题目:针对混合属性数据的聚类方法研究

关键词:聚类;混合属性;产品质量安全事件

  摘要


    聚类算法在设计之初,考虑到属性间转换的复杂关系,往往只适用于单一属性的数据集。但是随着应用范围的不断扩大,真实数据集中往往含有两种或以上的属性数据。这也造成了对混合属性数据集聚类时,传统算法难以实现在保留属性信息的同时,体现属性在聚类中的作用、区分不同的属性特征。此外,属性数据间的不同组合,也会给相似度或相异度计算增添难度,使聚类效果下降。

    目前,国内外基于混合属性数据集的聚类算法研究取得了一定成果,提出了很多算法改进。但是现有算法仍存部分缺陷,这也是本文的出发点所在。本文以改进混合属性数据集的聚类算法分析效果为研究目标,基于对属性聚类的归纳分析,在理论层面提出聚类算法改进,通过实验验证均取得了较好的效果;在应用层面,通过构建基于Single-Pass的增量聚类模型对网络新闻中产品质量安全事件进行聚类。本文的主要研究工作或创新性成果概括如下:

    (1)提出基于W-k-means的加权聚类算法。在W-k-means的基础上,考虑分类属性数据的特点,选择用分布质心表示其簇中心,并用均值刻画数值属性,以此来解决混合属性簇中心表示问题。此外,提出改进相异度计算方法,使得不同属性对聚类的影响得以有效体现。实验结果表明,改进的W-k-means算法能够有效提高聚类算法对混合属性数据的聚类准确率。

    (2)提出基于K-prototypes的加权模糊聚类算法。针对簇中心表示上常有的属性值信息丢失现象,以及边界数据蔟归属的模糊性。本文先采用模糊聚类的方式定义簇归属上的模糊性。然后,引入共现性原则计算数值及分类属性值对于聚类的影响。最后构建加权模糊K-prototypes聚类算法对数据集进行迭代聚类。实验结果表明,该算法对混合属性数据集的聚类效果良好。

    (3)构建基于Single-Pass算法的产品质量安全事件聚类模型。该模型在进行相似度计算时,引入了时间属性,并考虑新闻标题、元数据及正文间文本相似度,来提高模型对多个相似事件的区分能力。实验结果表明,该聚类模型在性能上有较大提升。