爬虫基础、链接组成部分、动态静态数据、网络请求库、保存下载文件、英雄联盟案例、目录操作bs4数据定位解析提取库、站长之家图片素材、b站视频下载案例、movipy音视频编辑模块。根据上述学习的内容写1个另外的爬虫源码
以下是一个简单的爬虫源码示例,用于爬取豆瓣电影Top250的电影名称和评分:
import requests
from bs4 import BeautifulSoup
def get_movie_info(url):
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
movie_list = soup.find_all('div', class_='hd')
for movie in movie_list:
title = movie.a.span.text
rating = movie.parent.find('span', class_='rating_num').text
print(f'电影名称:{title},评分:{rating}')
def main():
for i in range(10):
url = f'https://movie.douban.com/top250?start={i*25}'
get_movie_info(url)
if __name__ == '__main__':
main()
这个爬虫程序使用了requests库发送网络请求,使用BeautifulSoup库对HTML进行解析和定位元素,然后提取电影名称和评分进行打印输出。循环爬取豆瓣电影Top250的每一页,每页包含25部电影,共爬取10页。
原文地址: https://www.cveoy.top/t/topic/ieGR 著作权归作者所有。请勿转载和采集!