Python爬虫实战:获取网页内容并解析标题
Python爬虫实战:获取网页内容并解析标题
本教程将带你一步步使用Python爬虫技术获取网页内容并解析标题。我们将以'http://renwen.sanyau.edu.cn/?article/14263.html'为例,演示如何使用requests和lxml库进行网页抓取和解析。
1. 导入相关库
首先,我们需要导入requests库用于发送HTTP请求,以及lxml库用于解析HTML内容。
import requests
from lxml import etree
2. 获取网页内容
将目标网页的URL赋值给变量url,并使用requests.get()方法发送GET请求,将响应内容赋值给变量res。
url = 'http://renwen.sanyau.edu.cn/?article/14263.html'
res = requests.get(url)
3. 查看服务器状态码
通过res.status_code属性可以查看服务器返回的状态码,并使用print()语句输出。
print(res.status_code)
4. 查看服务器返回的编码
通过res.encoding属性可以查看服务器返回的编码,并使用print()语句输出。
print(res.encoding)
5. 使用XPath解析网页
使用etree.HTML()方法将响应内容解析为HTML对象,并使用XPath表达式定位到新闻标题所在的元素,最后将标题内容赋值给变量newtitle并使用print()语句输出。
html = etree.HTML(res.text)
newtitle = html.xpath('//div[@class='newsTitle']/h1/text()')[0]
print(newtitle)
输出结果:
200
utf-8
人文与传播学院学子在2023年(16届)中国大学生计算机设计大赛省赛中荣获佳绩
通过以上步骤,我们成功地从目标网页中获取了新闻标题。你可以根据自己的需求调整XPath表达式,以提取其他网页元素的内容。
原文地址: https://www.cveoy.top/t/topic/owoO 著作权归作者所有。请勿转载和采集!