以下是一个简单的爬虫源码示例,用于爬取豆瓣电影Top250的电影名称和评分:

import requests
from bs4 import BeautifulSoup

def get_movie_info(url):
    response = requests.get(url)
    soup = BeautifulSoup(response.text, 'html.parser')
    movie_list = soup.find_all('div', class_='hd')

    for movie in movie_list:
        title = movie.a.span.text
        rating = movie.parent.find('span', class_='rating_num').text
        print(f'电影名称:{title},评分:{rating}')

def main():
    for i in range(10):
        url = f'https://movie.douban.com/top250?start={i*25}'
        get_movie_info(url)

if __name__ == '__main__':
    main()

这个爬虫程序使用了requests库发送网络请求,使用BeautifulSoup库对HTML进行解析和定位元素,然后提取电影名称和评分进行打印输出。循环爬取豆瓣电影Top250的每一页,每页包含25部电影,共爬取10页。


原文地址: https://www.cveoy.top/t/topic/ieGR 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录