Python实现CSV数据处理:模糊匹配与数据提取

本教程将演示如何使用Python的Pandas库对CSV格式数据进行处理,实现以下功能:

  1. 模糊匹配疾病关键词: 判断'字段A'是否包含'冠状动脉粥样硬化性心脏病'、'心绞痛'、'心肌梗死'或'缺血性心肌病',若包含则输出1,否则输出0,并将结果存储在新字段'A1'中。2. 模糊匹配吸烟: 判断'字段B'是否包含'吸烟',若包含则输出1,否则输出0,并将结果存储在新字段'B1'中。3. 提取年龄: 从'字段C'中提取患者年龄信息,并将结果存储在新字段'C1'中。

最终输出包含所有原字段以及新生成的'A1'、'B1'、'C1'字段的数据表。

代码实现:pythonimport pandas as pd

读取csv文件data = pd.read_csv('your_file.csv')

模糊匹配字段A的值是否包含指定关键词data['A1'] = data['字段A'].str.contains('冠状动脉粥样硬化性心脏病|心绞痛|心肌梗死|缺血性心肌病').astype(int)

模糊匹配字段B的值是否包含指定关键词data['B1'] = data['字段B'].str.contains('吸烟').astype(int)

提取患者年龄data['C1'] = data['字段C'].str.extract('(\d+)').astype(float)

输出所有字段output_columns = ['字段111', '字段A', '字段B', '字段C', '字段D', 'A1', 'B1', 'C1']output_data = data[output_columns]print(output_data)

使用方法:

  1. 将代码中的'your_file.csv'替换为你的数据表文件名。2. 确保数据表文件与代码文件在同一目录下。3. 运行代码,处理后的数据表将打印在控制台中。

代码解析:

  • 使用pandas.read_csv()函数读取CSV文件到DataFrame中。* 使用str.contains()函数进行模糊匹配,并使用astype(int)将布尔值转换为0和1。* 使用str.extract()函数结合正则表达式提取年龄信息,并使用astype(float)将提取的字符串转换为浮点数。

希望本教程能帮助你使用Python进行CSV数据处理!

Python实现CSV数据处理:模糊匹配与数据提取

原文地址: https://www.cveoy.top/t/topic/cUKL 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录