数据预处理和初始化方法对K-均值聚类的影响

摘要：

基于酵母二次迁移实验中表达谱相似的五类基因表达数据,研究了不同相似性度量准则、数据预处理方法及质心初始化方式对K-均值聚类效果的影响.结果表明:若对基因表达数据进行K-均值聚类分析,最好采用能反映数据结构特征的向量对质心进行初始化.若随机初始化质心,则采用取相对表达水平的预处理方式,以欧几里德距离(Euclidean distance)作为相似性测量准则,可以获得最佳的聚类结果;在欧氏距离准则下,标准化处理因可能破坏原始数据的幅度特征,而导致聚类结果变坏.若以Pearson相关系数为相似性准则则不同的数据预处理方式对结果无显著影响.

关键词：基因表达聚类分析 K-均值聚类数据预处理基因芯片

作者: 杨春梅万柏坤丁北生

作者单位: 天津大学精密仪器与光电子工程学院(天津)

会议类型: 国内会议

会议名称: 中国仪器仪表学会第五届青年学术会议

会议地点: 天津

会议语种:中文

页码: 189-192,209

在线出版日期: 2003-08-01（万方平台首次上网日期，不代表论文的发表时间）

会议专题

数据预处理和初始化方法对K-均值聚类的影响