Python代码:判断并提取关键词,排除重复关键词
Python代码:判断并提取关键词,排除重复关键词
本代码使用Python pandas库,从CSV文件中读取数据,根据特定条件判断并提取关键词,同时排除重复关键词,最后将结果添加到新的列并保存到新的CSV文件中。
代码示例:
import pandas as pd
# 读取文档数据
df = pd.read_csv('文档数据.csv')
# 将所有文档的第五列中的数据作为关键词库
keyword_list = df.iloc[:, 4].tolist()
# 遍历每一行判断条件并添加新列数据
new_keywords = []
for index, row in df.iterrows():
if row[9] == 1:
text = row[8]
existing_keyword = row[4]
keywords = [keyword for keyword in keyword_list if keyword != existing_keyword and keyword in text]
if len(keywords) > 0:
new_keywords.append(','.join(keywords))
else:
new_keywords.append('no')
else:
new_keywords.append('')
# 将新列数据添加到DataFrame中
df['New Keywords'] = new_keywords
# 将结果保存到新的CSV文件中
df.to_csv('结果数据.csv', index=False)
代码说明:
- 使用
pandas库读取CSV文件。 - 将所有文档的第五列数据作为关键词库。
- 遍历每一行,判断第十列是否为1。
- 如果第十列为1,则判断第九列文本是否包含关键词,并将排除重复关键词的关键词添加至新列。
- 如果第九列文本不包含关键词或包含重复关键词,则在新列中写入'no'。
- 将新列添加到DataFrame中并保存到新的CSV文件中。
注意:
- 替换代码中的
文档数据.csv为你的实际数据文件名。 - 将结果保存到
结果数据.csv文件中。
应用场景:
该代码可用于分析文本数据,提取关键信息,并根据特定条件进行筛选。例如,可以用于识别包含特定关键词的文档,并提取相关信息。
原文地址: https://www.cveoy.top/t/topic/pkFb 著作权归作者所有。请勿转载和采集!