下面是一个示例代码,可以实现读取Excel中第一列URL,并通过下载PDF文件,同时输出CSV文件。

import pandas as pd
import requests
from urllib.parse import urlparse
import os
import csv

def download_pdf(url, output_dir):
    response = requests.get(url)
    if response.status_code == 200:
        filename = os.path.basename(urlparse(url).path)
        filepath = os.path.join(output_dir, filename)
        with open(filepath, 'wb') as f:
            f.write(response.content)
        return filepath
    else:
        return None

def main():
    excel_file = 'input.xlsx'
    output_dir = 'pdfs'
    csv_file = 'output.csv'
    
    # 读取Excel文件中第一列URL
    df = pd.read_excel(excel_file)
    urls = df.iloc[:, 0].tolist()
    
    # 下载PDF文件并输出CSV文件
    with open(csv_file, 'w', newline='') as f:
        writer = csv.writer(f)
        writer.writerow(['URL', 'PDF Path'])
        for url in urls:
            pdf_path = download_pdf(url, output_dir)
            writer.writerow([url, pdf_path])

if __name__ == '__main__':
    main()

请注意,你需要将input.xlsx替换为你的Excel文件路径,将pdfs替换为你想要保存PDF文件的目录路径,将output.csv替换为你想要保存CSV文件的路径

撰写python代码读取excel中第一列内容通过读取url下载出pdf文件并输出csv文件输出url和对应的相对路径

原文地址: https://www.cveoy.top/t/topic/iCmp 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录