使用 Python Pandas 优化 Excel 数据处理,提取包含用户昵称和最满意信息的文本

本文将介绍如何使用 Python Pandas 库优化 Excel 数据处理,并提取包含用户昵称和最满意信息的文本。

代码示例:

import pandas as pd

# 读取Excel文件
df = pd.read_excel('C:\Users\86186\Desktop\汽车之家_秦plus_评论.xls')

# 初始化字典列表
sentences = []

# 遍历每一行数据
for index, row in df.iterrows():
    if pd.notnull(row['用户昵称']) and pd.notnull(row['最满意']):
        sentence_dict = {}
        columns = df.columns.tolist()
        start_index = columns.index('最满意')
        for column in columns[start_index:]:
            sentence_dict[column] = [sentence.strip() for sentence in str(row[column]).split(',')]
        sentences.append(sentence_dict)

# 打印结果
for sentence_dict in sentences:
    print(sentence_dict)

代码解释:

  1. 读取 Excel 文件: 使用 pd.read_excel() 函数读取 Excel 文件,并将其存储在 df 数据框中。
  2. 添加条件判断语句: 在循环遍历每一行数据时,添加 if pd.notnull(row['用户昵称']) and pd.notnull(row['最满意']): 条件判断语句,仅提取包含用户昵称和最满意信息的行。
  3. 创建字典: 对于符合条件的行,创建一个字典 sentence_dict 来存储相关信息。
  4. 提取文本数据: 遍历从 '最满意' 列开始的所有列,将每列的文本数据根据 ',' 符号进行拆分,并去除空格,最后存储到 sentence_dict 中。
  5. 打印结果: 将每个 sentence_dict 打印出来,展示最终结果。

注意:

  • 请确保你已经安装了 pandas 库和 xlrd 库。
  • 将代码中的文件路径修改为你的实际路径。

通过以上代码,我们成功地从 Excel 文件中提取了包含用户昵称和最满意信息的文本数据。你可以根据实际需求对代码进行修改和扩展。

Python Pandas 优化 Excel 数据处理,提取包含用户昵称和最满意信息的文本

原文地址: https://www.cveoy.top/t/topic/Sjr 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录