Python 使用 Pandas 对数据集第八列进行 One-Hot 编码
Python 使用 Pandas 对数据集第八列进行 One-Hot 编码
假设数据集是一个二维数组,可以使用 Pandas 库中的 get_dummies() 函数进行 One-Hot 编码。
import pandas as pd
# 假设数据集是一个二维数组,存储在 data 中,第八列的索引为 7
one_hot_data = pd.get_dummies(data.iloc[:, 7])
print(one_hot_data)
其中,iloc[:, 7] 表示选取所有行的第 8 列数据进行编码。打印输出的 one_hot_data 即为编码后的结果。
代码解释:
import pandas as pd: 导入 Pandas 库。data.iloc[:, 7]: 选取数据集data的所有行(:)的第 8 列(索引为 7)数据。pd.get_dummies(data.iloc[:, 7]): 对选取的列进行 One-Hot 编码。print(one_hot_data): 打印编码后的结果。
示例:
假设数据集 data 如下:
A B C D E F G H
0 1 2 3 4 5 6 7 8
1 9 10 11 12 13 14 15 16
2 17 18 19 20 21 22 23 24
则编码后的结果 one_hot_data 为:
7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1
1 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 0
2 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 0 0
注意:
- 该代码假设数据集的索引从 0 开始。
- 可以根据实际情况修改代码中的索引值。
- 如果数据集的第八列包含缺失值,则需要进行处理。
参考:
原文地址: https://www.cveoy.top/t/topic/osry 著作权归作者所有。请勿转载和采集!