Python爬虫实战:使用Requests和BeautifulSoup提取网页课程名称

本教程将演示如何使用Python的Requests和BeautifulSoup库从网页中提取课程名称。

步骤一:获取网页内容

首先,我们需要使用Requests库获取目标网页的HTML内容。

import requests

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/109.0.0.0 Safari/537.36',
    'Cookie': '_ga=GA1.2.45674092.1683170582; HWWAFSESTIME=1687836388593; HWWAFSESID=dbab314e216cc292511; session=V2-6-29f84801-9276-4f29-aacc-9400003c1637.NTU2Nzc4.1687922802740.xMOPUTJLIZEJ5ylx6K6_6zIjCj8'
}

response = requests.get('https://lms.ouchn.cn/user/courses', headers=headers)

步骤二:解析HTML内容

接下来,使用BeautifulSoup库解析HTML内容,以便我们可以方便地查找和提取所需的信息。

from bs4 import BeautifulSoup

soup = BeautifulSoup(response.text, 'html.parser')

步骤三:提取课程名称

我们想要提取所有<span class="course-name">标签中的课程名称,可以使用find_all方法。

course_names = soup.find_all('span', {'class': 'course-name'})

for course_name in course_names:
    print(course_name.find('a').text.strip())

完整代码

import requests
from bs4 import BeautifulSoup

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/109.0.0.0 Safari/537.36',
    'Cookie': '_ga=GA1.2.45674092.1683170582; HWWAFSESTIME=1687836388593; HWWAFSESID=dbab314e216cc292511; session=V2-6-29f84801-9276-4f29-aacc-9400003c1637.NTU2Nzc4.1687922802740.xMOPUTJLIZEJ5ylx6K6_6zIjCj8'
}

response = requests.get('https://lms.ouchn.cn/user/courses', headers=headers)
soup = BeautifulSoup(response.text, 'html.parser')
course_names = soup.find_all('span', {'class': 'course-name'})

for course_name in course_names:
    print(course_name.find('a').text.strip())

注意:

  • 此代码仅供学习参考,请勿用于任何非法目的。
  • 实际应用中,可能需要根据网页结构进行调整。
  • 请注意网站的 robots.txt 文件,尊重网站的爬取规则。
Python爬虫实战:使用Requests和BeautifulSoup提取网页课程名称

原文地址: https://www.cveoy.top/t/topic/oYWK 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录