Python爬取豆瓣影评代码示例

本文提供一段 Python 代码示例,展示如何使用 lxml 库爬取豆瓣电影最佳影评内容。代码简单易懂,可供初学者学习参考。

# -*- coding: utf-8 -*-

import urllib2
from lxml import etree

# 豆瓣影评url
url = 'https://movie.douban.com/review/best/?start=0'

# 请求url
request = urllib2.Request(url)
response = urllib2.urlopen(request)

# 解析html
html = etree.HTML(response.read())

# 获取影评
comments = html.xpath('//div[@class='main review-item']/div[2]/h2/a/text()')
print comments

代码说明:

  1. 导入必要的库:urllib2 用于发送 HTTP 请求,lxml 用于解析 HTML 内容。
  2. 定义豆瓣影评的 URL,这里以最佳影评页面为例。
  3. 使用 urllib2.Request 和 urllib2.urlopen 发送请求并获取网页内容。
  4. 使用 etree.HTML 解析 HTML 内容。
  5. 使用 XPath 表达式 //div[@class='main review-item']/div[2]/h2/a/text() 获取所有影评的标题。
  6. 打印获取到的影评标题列表。

注意:

  • 本代码仅供学习参考,请勿用于商业目的或违反豆瓣网站的规定。
  • 代码中使用了 urllib2 库,在 Python 3 中已改为 urllib.request。
  • 实际爬取过程中,可能需要根据豆瓣网站的更新情况调整代码。

扩展:

  • 可以使用 requests 库代替 urllib2,代码更加简洁。
  • 可以使用 BeautifulSoup 库代替 lxml 解析 HTML。
  • 可以根据需要获取其他影评信息,例如评论内容、评分等。

更多学习资料:

Python爬取豆瓣影评代码示例

原文地址: https://www.cveoy.top/t/topic/lkuL 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录