撰写python代码读取excel中第一列内容通过读取url下载出pdf文件并输出csv文件输出url和对应的相对路径
下面是一个示例代码,可以实现读取Excel中第一列URL,并通过下载PDF文件,同时输出CSV文件。
import pandas as pd
import requests
from urllib.parse import urlparse
import os
import csv
def download_pdf(url, output_dir):
response = requests.get(url)
if response.status_code == 200:
filename = os.path.basename(urlparse(url).path)
filepath = os.path.join(output_dir, filename)
with open(filepath, 'wb') as f:
f.write(response.content)
return filepath
else:
return None
def main():
excel_file = 'input.xlsx'
output_dir = 'pdfs'
csv_file = 'output.csv'
# 读取Excel文件中第一列URL
df = pd.read_excel(excel_file)
urls = df.iloc[:, 0].tolist()
# 下载PDF文件并输出CSV文件
with open(csv_file, 'w', newline='') as f:
writer = csv.writer(f)
writer.writerow(['URL', 'PDF Path'])
for url in urls:
pdf_path = download_pdf(url, output_dir)
writer.writerow([url, pdf_path])
if __name__ == '__main__':
main()
请注意,你需要将input.xlsx替换为你的Excel文件路径,将pdfs替换为你想要保存PDF文件的目录路径,将output.csv替换为你想要保存CSV文件的路径
原文地址: https://www.cveoy.top/t/topic/iCmp 著作权归作者所有。请勿转载和采集!