Python爬虫实战:获取网页内容并解析标题

本教程将带你一步步使用Python爬虫技术获取网页内容并解析标题。我们将以'http://renwen.sanyau.edu.cn/?article/14263.html'为例,演示如何使用requests和lxml库进行网页抓取和解析。

1. 导入相关库

首先,我们需要导入requests库用于发送HTTP请求,以及lxml库用于解析HTML内容。

import requests
from lxml import etree

2. 获取网页内容

将目标网页的URL赋值给变量url,并使用requests.get()方法发送GET请求,将响应内容赋值给变量res。

url = 'http://renwen.sanyau.edu.cn/?article/14263.html'
res = requests.get(url)

3. 查看服务器状态码

通过res.status_code属性可以查看服务器返回的状态码,并使用print()语句输出。

print(res.status_code)

4. 查看服务器返回的编码

通过res.encoding属性可以查看服务器返回的编码,并使用print()语句输出。

print(res.encoding)

5. 使用XPath解析网页

使用etree.HTML()方法将响应内容解析为HTML对象,并使用XPath表达式定位到新闻标题所在的元素,最后将标题内容赋值给变量newtitle并使用print()语句输出。

html = etree.HTML(res.text)
newtitle = html.xpath('//div[@class='newsTitle']/h1/text()')[0]
print(newtitle)

输出结果:

200
utf-8
人文与传播学院学子在2023年(16届)中国大学生计算机设计大赛省赛中荣获佳绩

通过以上步骤,我们成功地从目标网页中获取了新闻标题。你可以根据自己的需求调整XPath表达式,以提取其他网页元素的内容。


原文地址: https://www.cveoy.top/t/topic/owoO 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录