撰写python代码读取excel中第一列内容通过读取url下载pdf文件至本地并输出csv文件输出url和对应的相对路径
以下是一个示例代码,可以读取Excel中第一列的URL,并下载PDF文件到本地,并将URL和对应的相对路径输出到CSV文件中。
import os
import csv
import requests
import pandas as pd
# 读取Excel文件中第一列的URL
df = pd.read_excel('data.xlsx', usecols=[0])
urls = df.iloc[:, 0]
# 创建保存PDF文件的文件夹
if not os.path.exists('pdf_files'):
os.makedirs('pdf_files')
# 下载PDF文件并保存到本地
csv_data = []
for url in urls:
file_name = url.split('/')[-1]
file_path = os.path.join('pdf_files', file_name)
try:
response = requests.get(url)
with open(file_path, 'wb') as file:
file.write(response.content)
csv_data.append([url, file_path])
except:
csv_data.append([url, '下载失败'])
# 将URL和对应的相对路径输出到CSV文件
with open('output.csv', 'w', newline='') as file:
writer = csv.writer(file)
writer.writerow(['URL', '相对路径'])
writer.writerows(csv_data)
请将Excel文件保存为data.xlsx,并确保要下载的PDF文件的URL在第一列中。下载的PDF文件将保存在pdf_files文件夹中,并将URL和对应的相对路径输出到output.csv文件中
原文地址: https://www.cveoy.top/t/topic/iCmE 著作权归作者所有。请勿转载和采集!