Python代码:判断并提取关键词,排除重复关键词

本代码使用Python pandas库,从CSV文件中读取数据,根据特定条件判断并提取关键词,同时排除重复关键词,最后将结果添加到新的列并保存到新的CSV文件中。

代码示例:

import pandas as pd

# 读取文档数据
df = pd.read_csv('文档数据.csv')

# 将所有文档的第五列中的数据作为关键词库
keyword_list = df.iloc[:, 4].tolist()

# 遍历每一行判断条件并添加新列数据
new_keywords = []
for index, row in df.iterrows():
    if row[9] == 1:
        text = row[8]
        existing_keyword = row[4]
        keywords = [keyword for keyword in keyword_list if keyword != existing_keyword and keyword in text]
        if len(keywords) > 0:
            new_keywords.append(','.join(keywords))
        else:
            new_keywords.append('no')
    else:
        new_keywords.append('')

# 将新列数据添加到DataFrame中
df['New Keywords'] = new_keywords

# 将结果保存到新的CSV文件中
df.to_csv('结果数据.csv', index=False)

代码说明:

  1. 使用pandas库读取CSV文件。
  2. 将所有文档的第五列数据作为关键词库。
  3. 遍历每一行,判断第十列是否为1。
  4. 如果第十列为1,则判断第九列文本是否包含关键词,并将排除重复关键词的关键词添加至新列。
  5. 如果第九列文本不包含关键词或包含重复关键词,则在新列中写入'no'。
  6. 将新列添加到DataFrame中并保存到新的CSV文件中。

注意:

  • 替换代码中的文档数据.csv为你的实际数据文件名。
  • 将结果保存到结果数据.csv文件中。

应用场景:

该代码可用于分析文本数据,提取关键信息,并根据特定条件进行筛选。例如,可以用于识别包含特定关键词的文档,并提取相关信息。


原文地址: https://www.cveoy.top/t/topic/pkFb 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录