Python 使用 Openpyxl 拆分 Excel 文件并解决多线程迭代错误

本文介绍使用 Python 的 Openpyxl 库拆分 Excel 文件,并解决在多线程操作中遇到的字典大小改变错误,提供高效拆分 Excel 文件的代码示例和错误解决方法。

代码示例

import os
from datetime import datetime
import openpyxl
import threading

def split_excel_file(file_path):
    # 打开Excel文件
    wb = openpyxl.load_workbook(file_path)
    sheet = wb.worksheets[0] # 获取第一个工作表

    # 获取第二行所有单元格的内容
    row2_values = [cell.value for cell in sheet[2]]

    # 获取第一列所有单元格的内容
    col1_values = [cell.value for cell in sheet['A']]
    # 排除A1单元格
    col1_values = col1_values[1:]

    # 拆分第一列单元格内容到新的工作表
    unique_values = set(col1_values)
    threads = [] # 存储线程
    for value in unique_values:
        count = col1_values.count(value)
        new_sheet_name = f'{value} ({count} 人)'
        new_sheet = wb.create_sheet(title=new_sheet_name)

        # 在新工作表的第一行插入原工作表A1单元格的内容
        new_sheet.insert_rows(1)
        for col_num, cell in enumerate(sheet[1], 1):
            new_sheet.cell(row=1, column=col_num, value=cell.value)

        # 添加第二行单元格内容到新工作表
        new_sheet.append(row2_values)

        # 添加第一列单元格内容到新工作表
        def add_rows(sheet, start_row, end_row):
            for row_num in range(start_row, end_row):
                cell_value = col1_values[row_num - 1]
                if cell_value == value:
                    new_sheet.append([cell.value for cell in sheet[row_num + 1]])

        # 分配任务到不同的线程
        num_rows = len(col1_values)
        num_threads = 2 # 可以根据实际情况调整线程数
        rows_per_thread = num_rows // num_threads
        for i in range(num_threads):
            start_row = i * rows_per_thread + 1
            end_row = (i + 1) * rows_per_thread + 1
            if i == num_threads - 1:
                end_row = num_rows + 1
            t = threading.Thread(target=add_rows, args=(sheet, start_row, end_row))
            threads.append(t)
            t.start()

        # 等待所有线程执行完毕
        for t in threads:
            t.join()

        # 删除新工作表中的空行
        for row in new_sheet.iter_rows():
            if all([cell.value is None for cell in row]):
                new_sheet.delete_rows(row[0].row)

        # 合并第一行单元格并居中
        num_cols = new_sheet.max_column
        new_sheet.merge_cells(start_row=1, start_column=1, end_row=1, end_column=num_cols)
        new_sheet.cell(row=1, column=1).alignment = openpyxl.styles.Alignment(horizontal='center', vertical='center')

    # 删除工作表名字为表头(1)人的工作表
    if '表头 (1 人)' in wb.sheetnames:
        wb.remove(wb['表头 (1 人)'])

    # 保存为新的excel文件
    new_file_path = os.path.splitext(file_path)[0] + '_拆分结果.xlsx'
    wb.save(new_file_path)

    # 获取所有工作表
    sheets = wb.sheetnames
    # 排除第一个工作表
    sheets = sheets[1:]

    # 创建拆分结果文件夹
    folder_name = '拆分结果'
    desktop_path = os.path.join(os.path.expanduser('~'), 'Desktop')
    folder_path = os.path.join(desktop_path, folder_name)
    if not os.path.exists(folder_path):
        os.mkdir(folder_path)

    # 复制一份工作表名字列表,避免在迭代时修改字典的大小
    sheets_copy = sheets.copy()

    # 遍历每个工作表
    for sheet_name in sheets_copy:
        # 创建新的Excel文件
        new_wb = openpyxl.Workbook()
        new_sheet = new_wb.active

        # 复制工作表内容到新的Excel文件
        sheet = wb[sheet_name]
        for row in sheet.iter_rows():
            for cell in row:
                new_sheet[cell.coordinate].value = cell.value

        # 保存新的Excel文件
        date_str = datetime.now().strftime('%Y-%m-%d')
        file_name = f'{sheet_name}-{date_str}.xlsx'
        file_path = os.path.join(folder_path, file_name)
        new_wb.save(file_path)

        # 关闭新的Excel文件
        new_wb.close()

    # 删除工作表名字为表头(1)人的工作表
    if '表头 (1 人)' in wb.sheetnames:
        wb.remove(wb['表头 (1 人)'])

    # 保存为新的excel文件
    new_file_path = os.path.splitext(file_path)[0] + '_拆分结果.xlsx'
    wb.save(new_file_path)

    # 关闭原Excel文件
    wb.close()

if __name__ == '__main__':
    file_path = r'C:\Users\Administrator\Desktop\工作簿1.xlsx'
    split_excel_file(file_path)
    print('拆分完成!!')

错误解决

错误: RuntimeError: dictionary changed size during iteration

原因: 在多线程操作中,多个线程同时访问并修改了同一个字典 wb.sheetnames,导致字典大小在迭代过程中改变,引发错误。

解决方案:

  1. 在迭代字典之前,创建一个副本:sheets_copy = sheets.copy()
  2. 迭代副本进行操作:for sheet_name in sheets_copy:

代码说明

  1. 获取工作表和数据: 代码首先获取 Excel 文件中的第一个工作表,并获取第二行和第一列的所有单元格内容。
  2. 创建新工作表: 使用第一列的唯一值创建新的工作表,并将原工作表的第二行和第一行内容添加到新的工作表中。
  3. 多线程处理: 使用 threading 库将第一列单元格内容的添加任务分配到多个线程,提高处理效率。
  4. 删除空行: 删除新工作表中所有为空的空行。
  5. 合并单元格: 合并新工作表的第一行单元格,并居中对齐。
  6. 保存结果: 将拆分后的工作表保存到新的 Excel 文件中。
  7. 创建结果文件夹: 在桌面上创建一个名为 '拆分结果' 的文件夹,将拆分后的 Excel 文件保存到该文件夹中。
  8. 复制工作表名字列表: 在迭代工作表名字列表之前,复制一份副本,避免在迭代过程中修改字典的大小。
  9. 关闭文件: 最后,关闭所有打开的 Excel 文件。

总结

本文介绍了如何使用 Python 的 Openpyxl 库拆分 Excel 文件,并提供了解决多线程操作中遇到的字典大小改变错误的解决方案。通过使用多线程和复制工作表名字列表,可以高效地拆分 Excel 文件,避免错误发生。

Python 使用 Openpyxl 拆分 Excel 文件并解决多线程迭代错误

原文地址: https://www.cveoy.top/t/topic/owOS 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录