Python Pandas 数据清洗:去除重复行和缺失值
Python Pandas 数据清洗:去除重复行和缺失值
本文将介绍使用 Python Pandas 库进行数据清洗,包括去除重复行和处理缺失值。
原始代码存在语法错误,以下为修正后的代码:
import pandas as pd
import numpy as np
columns = ['chinese', 'math', 'english']
data = pd.DataFrame([[81.5,76.5,73.5],[71.,68,np.nan],[71.,68,np.nan],[np.nan,np.nan,np.nan],[np.nan,96.5,93.5]], columns=columns)
data_new = data.drop_duplicates().dropna(thresh=2)
print(data_new)
运行结果:
chinese math english
0 81.5 76.5 73.5
1 71.0 68.0 NaN
4 NaN 96.5 93.5
说明:
- 修正后的代码中,
np.nan代表缺失值,修正了数据格式和缺失值的处理方式。 drop_duplicates()方法用于去除重复行。dropna(thresh=2)方法用于删除至少有两个缺失值的的行。
最终,我们得到了正确的结果,成功地去除了重复行和缺失值。
总结:
本文介绍了使用 Python Pandas 库进行数据清洗的基本操作,包括去除重复行和处理缺失值。希望本文能够帮助您更好地理解数据清洗的流程和方法。
原文地址: https://www.cveoy.top/t/topic/oxHS 著作权归作者所有。请勿转载和采集!