Python Pandas高效提取Excel数据:以汽车之家评论为例
Python Pandas高效提取Excel数据:以汽车之家评论为例
本文将介绍如何使用Python Pandas库高效地从Excel文件中提取特定列的数据,并以字典格式存储。我们将以汽车之家秦plus评论数据为例,从'最满意'列开始提取数据。
import pandas as pd
# 读取Excel文件
df = pd.read_excel('C:\Users\86186\Desktop\汽车之家_秦plus_评论.xls')
# 初始化字典列表
sentences = []
# 遍历每一行数据
for index, row in df.iterrows():
sentence_dict = {}
columns = df.columns.tolist()
start_index = columns.index('最满意')
for column in columns[start_index:]:
sentence_dict[column] = [sentence.strip() for sentence in str(row[column]).split(',')]
sentences.append(sentence_dict)
# 打印结果
for sentence_dict in sentences:
print(sentence_dict)
代码解析:
- 导入pandas库:
import pandas as pd - 读取Excel文件: 使用
pd.read_excel()函数读取Excel文件,将文件路径替换为实际路径。 - 初始化字典列表:
sentences = []用于存储提取的数据。 - 遍历数据: 使用
df.iterrows()遍历数据框的每一行。 - 查找'最满意'列索引: 使用
columns.index('最满意')获取'最满意'列的索引。 - 提取数据: 从'最满意'列开始,遍历每一列,使用
str(row[column]).split(',')将每列的数据按照','分割成句子,并使用列表推导式去除句子两端的空格。 - 存储数据: 将提取的句子存储到字典
sentence_dict中,键为列名,值为句子列表。 - 打印结果: 循环打印
sentences列表中的每个字典。
注意事项:
- 确保已安装
pandas和xlrd库:可以使用pip install pandas xlrd安装。 - 将文件路径修改为你的实际路径。
- 可以根据需要修改分隔符,例如使用'。'或';'分割句子。
这段代码可以帮助你快速地从Excel文件中提取特定列的数据,并以字典格式存储,方便后续的分析和处理。
原文地址: https://www.cveoy.top/t/topic/Sio 著作权归作者所有。请勿转载和采集!