Pandas 数据清洗:去除缺失值、重复值和异常值
Pandas 数据清洗:去除缺失值、重复值和异常值
本文将介绍使用 Pandas 库进行数据清洗的常用方法,包括如何删除缺失值、重复值以及处理异常值。
1. 读取数据
首先,我们需要使用 pd.read_excel() 函数从 Excel 文件中读取数据,并将其存储在 data 变量中。
import pandas as pd
data = pd.read_excel('E:/pythonProject5/深度学习/新建 XLS 工作表.xls')
2. 打印数据的列名
使用 data.columns 可以打印出数据集中所有列的名称。
print(data.columns)
3. 删除缺失值
使用 dropna() 函数可以删除包含缺失值的行。inplace=True 参数表示直接修改原 DataFrame 对象,而不是返回一个新的 DataFrame 对象。
data.dropna(inplace=True)
4. 删除重复值
使用 drop_duplicates() 函数可以删除重复的行。inplace=True 参数表示直接修改原 DataFrame 对象,而不是返回一个新的 DataFrame 对象。
data.drop_duplicates(inplace=True)
5. 处理异常值
可以使用条件筛选的方法来处理异常值。例如,以下代码只保留涨跌幅在 -10 到 10 之间的数据。
data = data[(data['涨跌幅'] >= -10) & (data['涨跌幅'] <= 10)]
总结
以上代码展示了如何使用 Pandas 库进行数据清洗,包括删除缺失值、重复值以及处理异常值。通过这些方法,我们可以对数据进行预处理,使其更适合后续的分析和建模。
注意: 本文只展示了 Pandas 数据清洗的基本方法,实际应用中可能需要根据具体情况进行更复杂的处理。
原文地址: https://www.cveoy.top/t/topic/f4eH 著作权归作者所有。请勿转载和采集!