Python 使用 Openpyxl 拆分 Excel 文件并解决多线程迭代错误
Python 使用 Openpyxl 拆分 Excel 文件并解决多线程迭代错误
本文介绍使用 Python 的 Openpyxl 库拆分 Excel 文件,并解决在多线程操作中遇到的字典大小改变错误,提供高效拆分 Excel 文件的代码示例和错误解决方法。
代码示例
import os
from datetime import datetime
import openpyxl
import threading
def split_excel_file(file_path):
# 打开Excel文件
wb = openpyxl.load_workbook(file_path)
sheet = wb.worksheets[0] # 获取第一个工作表
# 获取第二行所有单元格的内容
row2_values = [cell.value for cell in sheet[2]]
# 获取第一列所有单元格的内容
col1_values = [cell.value for cell in sheet['A']]
# 排除A1单元格
col1_values = col1_values[1:]
# 拆分第一列单元格内容到新的工作表
unique_values = set(col1_values)
threads = [] # 存储线程
for value in unique_values:
count = col1_values.count(value)
new_sheet_name = f'{value} ({count} 人)'
new_sheet = wb.create_sheet(title=new_sheet_name)
# 在新工作表的第一行插入原工作表A1单元格的内容
new_sheet.insert_rows(1)
for col_num, cell in enumerate(sheet[1], 1):
new_sheet.cell(row=1, column=col_num, value=cell.value)
# 添加第二行单元格内容到新工作表
new_sheet.append(row2_values)
# 添加第一列单元格内容到新工作表
def add_rows(sheet, start_row, end_row):
for row_num in range(start_row, end_row):
cell_value = col1_values[row_num - 1]
if cell_value == value:
new_sheet.append([cell.value for cell in sheet[row_num + 1]])
# 分配任务到不同的线程
num_rows = len(col1_values)
num_threads = 2 # 可以根据实际情况调整线程数
rows_per_thread = num_rows // num_threads
for i in range(num_threads):
start_row = i * rows_per_thread + 1
end_row = (i + 1) * rows_per_thread + 1
if i == num_threads - 1:
end_row = num_rows + 1
t = threading.Thread(target=add_rows, args=(sheet, start_row, end_row))
threads.append(t)
t.start()
# 等待所有线程执行完毕
for t in threads:
t.join()
# 删除新工作表中的空行
for row in new_sheet.iter_rows():
if all([cell.value is None for cell in row]):
new_sheet.delete_rows(row[0].row)
# 合并第一行单元格并居中
num_cols = new_sheet.max_column
new_sheet.merge_cells(start_row=1, start_column=1, end_row=1, end_column=num_cols)
new_sheet.cell(row=1, column=1).alignment = openpyxl.styles.Alignment(horizontal='center', vertical='center')
# 删除工作表名字为表头(1)人的工作表
if '表头 (1 人)' in wb.sheetnames:
wb.remove(wb['表头 (1 人)'])
# 保存为新的excel文件
new_file_path = os.path.splitext(file_path)[0] + '_拆分结果.xlsx'
wb.save(new_file_path)
# 获取所有工作表
sheets = wb.sheetnames
# 排除第一个工作表
sheets = sheets[1:]
# 创建拆分结果文件夹
folder_name = '拆分结果'
desktop_path = os.path.join(os.path.expanduser('~'), 'Desktop')
folder_path = os.path.join(desktop_path, folder_name)
if not os.path.exists(folder_path):
os.mkdir(folder_path)
# 复制一份工作表名字列表,避免在迭代时修改字典的大小
sheets_copy = sheets.copy()
# 遍历每个工作表
for sheet_name in sheets_copy:
# 创建新的Excel文件
new_wb = openpyxl.Workbook()
new_sheet = new_wb.active
# 复制工作表内容到新的Excel文件
sheet = wb[sheet_name]
for row in sheet.iter_rows():
for cell in row:
new_sheet[cell.coordinate].value = cell.value
# 保存新的Excel文件
date_str = datetime.now().strftime('%Y-%m-%d')
file_name = f'{sheet_name}-{date_str}.xlsx'
file_path = os.path.join(folder_path, file_name)
new_wb.save(file_path)
# 关闭新的Excel文件
new_wb.close()
# 删除工作表名字为表头(1)人的工作表
if '表头 (1 人)' in wb.sheetnames:
wb.remove(wb['表头 (1 人)'])
# 保存为新的excel文件
new_file_path = os.path.splitext(file_path)[0] + '_拆分结果.xlsx'
wb.save(new_file_path)
# 关闭原Excel文件
wb.close()
if __name__ == '__main__':
file_path = r'C:\Users\Administrator\Desktop\工作簿1.xlsx'
split_excel_file(file_path)
print('拆分完成!!')
错误解决
错误: RuntimeError: dictionary changed size during iteration
原因: 在多线程操作中,多个线程同时访问并修改了同一个字典 wb.sheetnames,导致字典大小在迭代过程中改变,引发错误。
解决方案:
- 在迭代字典之前,创建一个副本:
sheets_copy = sheets.copy() - 迭代副本进行操作:
for sheet_name in sheets_copy:
代码说明
- 获取工作表和数据: 代码首先获取 Excel 文件中的第一个工作表,并获取第二行和第一列的所有单元格内容。
- 创建新工作表: 使用第一列的唯一值创建新的工作表,并将原工作表的第二行和第一行内容添加到新的工作表中。
- 多线程处理: 使用
threading库将第一列单元格内容的添加任务分配到多个线程,提高处理效率。 - 删除空行: 删除新工作表中所有为空的空行。
- 合并单元格: 合并新工作表的第一行单元格,并居中对齐。
- 保存结果: 将拆分后的工作表保存到新的 Excel 文件中。
- 创建结果文件夹: 在桌面上创建一个名为 '拆分结果' 的文件夹,将拆分后的 Excel 文件保存到该文件夹中。
- 复制工作表名字列表: 在迭代工作表名字列表之前,复制一份副本,避免在迭代过程中修改字典的大小。
- 关闭文件: 最后,关闭所有打开的 Excel 文件。
总结
本文介绍了如何使用 Python 的 Openpyxl 库拆分 Excel 文件,并提供了解决多线程操作中遇到的字典大小改变错误的解决方案。通过使用多线程和复制工作表名字列表,可以高效地拆分 Excel 文件,避免错误发生。
原文地址: https://www.cveoy.top/t/topic/owOS 著作权归作者所有。请勿转载和采集!