Python爬取豆瓣影评代码示例
Python爬取豆瓣影评代码示例
本文提供一段 Python 代码示例,展示如何使用 lxml 库爬取豆瓣电影最佳影评内容。代码简单易懂,可供初学者学习参考。
# -*- coding: utf-8 -*-
import urllib2
from lxml import etree
# 豆瓣影评url
url = 'https://movie.douban.com/review/best/?start=0'
# 请求url
request = urllib2.Request(url)
response = urllib2.urlopen(request)
# 解析html
html = etree.HTML(response.read())
# 获取影评
comments = html.xpath('//div[@class='main review-item']/div[2]/h2/a/text()')
print comments
代码说明:
- 导入必要的库:
urllib2用于发送 HTTP 请求,lxml用于解析 HTML 内容。 - 定义豆瓣影评的 URL,这里以最佳影评页面为例。
- 使用
urllib2.Request和urllib2.urlopen发送请求并获取网页内容。 - 使用
etree.HTML解析 HTML 内容。 - 使用 XPath 表达式
//div[@class='main review-item']/div[2]/h2/a/text()获取所有影评的标题。 - 打印获取到的影评标题列表。
注意:
- 本代码仅供学习参考,请勿用于商业目的或违反豆瓣网站的规定。
- 代码中使用了
urllib2库,在 Python 3 中已改为urllib.request。 - 实际爬取过程中,可能需要根据豆瓣网站的更新情况调整代码。
扩展:
- 可以使用
requests库代替urllib2,代码更加简洁。 - 可以使用 BeautifulSoup 库代替
lxml解析 HTML。 - 可以根据需要获取其他影评信息,例如评论内容、评分等。
更多学习资料:
原文地址: https://www.cveoy.top/t/topic/lkuL 著作权归作者所有。请勿转载和采集!