使用 R 语言对健康指标数据进行 K 均值聚类分析

本文介绍如何使用 R 语言对健康指标数据进行 K 均值聚类分析,包括数据导入、预处理、聚类分析和结果展示。我们将使用一个包含年龄、性别、BMI、白细胞计数、红细胞计数、血红蛋白计数和血小板计数等指标的数据集进行演示。

1. 数据导入

data <- read.csv('data.csv') # 将数据从 csv 文件读入

2. 数据预处理

data <- data[, c(3:7)] # 选取需要聚类的变量列
data <- scale(data) # 标准化数据

3. 聚类分析

set.seed(123) # 设置随机种子,保证每次运行结果相同
kmeans_fit <- kmeans(data, centers = 3, nstart = 25) # 进行 k 均值聚类

其中,centers 参数表示聚类中心的数量,nstart 参数表示进行多次随机初始化的次数,选取最优的一次作为最终结果。

4. 结果展示

library(cluster) # 导入 cluster 包,用于绘制聚类结果图
clusplot(data, kmeans_fit$cluster, color = TRUE, shade = TRUE, labels = 2, lines = 0)

结果图如下:

kmeans_result

其中,不同颜色的点表示不同的聚类簇,点的大小表示样本在该变量上的数值大小。

可以看出,该数据集被聚为了 3 个簇,簇之间的差异较大。可以进一步对各个簇进行分析和解释。

使用 R 语言对健康指标数据进行 K 均值聚类分析

原文地址: https://www.cveoy.top/t/topic/owoF 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录