Pandas 数据清洗:去除缺失值、重复值和异常值

本文将介绍使用 Pandas 库进行数据清洗的常用方法,包括如何删除缺失值、重复值以及处理异常值。

1. 读取数据

首先,我们需要使用 pd.read_excel() 函数从 Excel 文件中读取数据,并将其存储在 data 变量中。

import pandas as pd

data = pd.read_excel('E:/pythonProject5/深度学习/新建 XLS 工作表.xls')

2. 打印数据的列名

使用 data.columns 可以打印出数据集中所有列的名称。

print(data.columns)

3. 删除缺失值

使用 dropna() 函数可以删除包含缺失值的行。inplace=True 参数表示直接修改原 DataFrame 对象,而不是返回一个新的 DataFrame 对象。

data.dropna(inplace=True)

4. 删除重复值

使用 drop_duplicates() 函数可以删除重复的行。inplace=True 参数表示直接修改原 DataFrame 对象,而不是返回一个新的 DataFrame 对象。

data.drop_duplicates(inplace=True)

5. 处理异常值

可以使用条件筛选的方法来处理异常值。例如,以下代码只保留涨跌幅在 -10 到 10 之间的数据。

data = data[(data['涨跌幅'] >= -10) & (data['涨跌幅'] <= 10)]

总结

以上代码展示了如何使用 Pandas 库进行数据清洗,包括删除缺失值、重复值以及处理异常值。通过这些方法,我们可以对数据进行预处理,使其更适合后续的分析和建模。

注意: 本文只展示了 Pandas 数据清洗的基本方法,实际应用中可能需要根据具体情况进行更复杂的处理。

Pandas 数据清洗:去除缺失值、重复值和异常值

原文地址: https://www.cveoy.top/t/topic/f4eH 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录