Python Pandas高效提取Excel数据:以汽车之家评论为例

本文将介绍如何使用Python Pandas库高效地从Excel文件中提取特定列的数据,并以字典格式存储。我们将以汽车之家秦plus评论数据为例,从'最满意'列开始提取数据。

import pandas as pd

# 读取Excel文件
df = pd.read_excel('C:\Users\86186\Desktop\汽车之家_秦plus_评论.xls')

# 初始化字典列表
sentences = []

# 遍历每一行数据
for index, row in df.iterrows():
    sentence_dict = {}
    columns = df.columns.tolist()
    start_index = columns.index('最满意')
    for column in columns[start_index:]:
        sentence_dict[column] = [sentence.strip() for sentence in str(row[column]).split(',')]
    sentences.append(sentence_dict)

# 打印结果
for sentence_dict in sentences:
    print(sentence_dict)

代码解析:

  1. 导入pandas库: import pandas as pd
  2. 读取Excel文件: 使用pd.read_excel()函数读取Excel文件,将文件路径替换为实际路径。
  3. 初始化字典列表: sentences = [] 用于存储提取的数据。
  4. 遍历数据: 使用df.iterrows()遍历数据框的每一行。
  5. 查找'最满意'列索引: 使用columns.index('最满意')获取'最满意'列的索引。
  6. 提取数据: 从'最满意'列开始,遍历每一列,使用str(row[column]).split(',')将每列的数据按照','分割成句子,并使用列表推导式去除句子两端的空格。
  7. 存储数据: 将提取的句子存储到字典sentence_dict中,键为列名,值为句子列表。
  8. 打印结果: 循环打印sentences列表中的每个字典。

注意事项:

  • 确保已安装pandasxlrd库:可以使用pip install pandas xlrd安装。
  • 将文件路径修改为你的实际路径。
  • 可以根据需要修改分隔符,例如使用'。'或';'分割句子。

这段代码可以帮助你快速地从Excel文件中提取特定列的数据,并以字典格式存储,方便后续的分析和处理。

Python Pandas高效提取Excel数据:以汽车之家评论为例

原文地址: https://www.cveoy.top/t/topic/Sio 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录