Python Pandas 数据清洗:去除重复行和缺失值

本文将介绍使用 Python Pandas 库进行数据清洗,包括去除重复行和处理缺失值。

原始代码存在语法错误,以下为修正后的代码:

import pandas as pd
import numpy as np
columns = ['chinese', 'math', 'english']
data = pd.DataFrame([[81.5,76.5,73.5],[71.,68,np.nan],[71.,68,np.nan],[np.nan,np.nan,np.nan],[np.nan,96.5,93.5]], columns=columns)
data_new = data.drop_duplicates().dropna(thresh=2)
print(data_new)

运行结果:

   chinese  math  english
0     81.5  76.5     73.5
1     71.0  68.0      NaN
4      NaN  96.5     93.5

说明:

  • 修正后的代码中,np.nan 代表缺失值,修正了数据格式和缺失值的处理方式。
  • drop_duplicates() 方法用于去除重复行。
  • dropna(thresh=2) 方法用于删除至少有两个缺失值的的行。

最终,我们得到了正确的结果,成功地去除了重复行和缺失值。

总结:

本文介绍了使用 Python Pandas 库进行数据清洗的基本操作,包括去除重复行和处理缺失值。希望本文能够帮助您更好地理解数据清洗的流程和方法。

Python Pandas 数据清洗:去除重复行和缺失值

原文地址: https://www.cveoy.top/t/topic/oxHS 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录