Python 使用 Pandas 对数据集第八列进行 One-Hot 编码

假设数据集是一个二维数组,可以使用 Pandas 库中的 get_dummies() 函数进行 One-Hot 编码。

import pandas as pd

# 假设数据集是一个二维数组,存储在 data 中,第八列的索引为 7
one_hot_data = pd.get_dummies(data.iloc[:, 7])

print(one_hot_data)

其中,iloc[:, 7] 表示选取所有行的第 8 列数据进行编码。打印输出的 one_hot_data 即为编码后的结果。

代码解释:

  • import pandas as pd: 导入 Pandas 库。
  • data.iloc[:, 7]: 选取数据集 data 的所有行(:)的第 8 列(索引为 7)数据。
  • pd.get_dummies(data.iloc[:, 7]): 对选取的列进行 One-Hot 编码。
  • print(one_hot_data): 打印编码后的结果。

示例:

假设数据集 data 如下:

   A  B  C  D  E  F  G  H
0  1  2  3  4  5  6  7  8
1  9 10 11 12 13 14 15 16
2 17 18 19 20 21 22 23 24

则编码后的结果 one_hot_data 为:

   7  8  9  10  11  12  13  14  15  16  17  18  19  20  21  22  23  24
0  0  0  0  0  0  0  0  0  0  0  0  0  0  0  0  0  1
1  0  0  0  0  0  0  0  0  0  0  0  0  0  0  0  1  0
2  0  0  0  0  0  0  0  0  0  0  0  0  0  0  1  0  0

注意:

  • 该代码假设数据集的索引从 0 开始。
  • 可以根据实际情况修改代码中的索引值。
  • 如果数据集的第八列包含缺失值,则需要进行处理。

参考:

Python 使用 Pandas 对数据集第八列进行 One-Hot 编码

原文地址: https://www.cveoy.top/t/topic/osry 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录