在这次实训中,老师给我们讲解了Python爬虫的基础知识,并通过使用requests库和BeautifulSoup库实现了一个下载英雄联盟英雄皮肤图片的爬虫。

在使用BeautifulSoup库时,我们可以通过三种方式来定位和提取标签内容。第一种方式是使用标签名称直接定位,例如soup.title可以获取到页面的title标签。第二种方式是使用find()方法,可以通过标签名称和属性来过滤标签,例如soup.find('div', attrs={'class':'title'})可以获取到class为'title'的div标签。第三种方式是使用find_all()方法,可以获取到所有匹配到的标签,返回的是一个序列。通过这些方法,我们可以方便地定位和提取页面中的标签和内容。

在实现下载图片的爬虫时,我们使用了requests库发送请求获取页面源码,并使用BeautifulSoup库解析页面。通过分析页面的结构,我们找到了包含所有图片的div标签,并进一步提取了所有的img标签。通过遍历img标签,我们获取到了图片的alt属性和图片链接,并使用requests库下载图片保存到本地。

除了下载图片,我们还学习了如何下载视频。通过分析视频页面的结构,我们找到了包含视频链接的script标签,并通过对script内容的处理,提取到了视频的链接。然后使用requests库下载视频和音频文件,并通过moviepy库将视频和音频合并成一个完整的视频文件。

通过这次实训,我对Python爬虫的基础知识有了更深入的了解,掌握了使用requests库发送请求和使用BeautifulSoup库解析页面的方法。同时,我也学会了如何定位和提取页面中的标签和内容,以及如何下载图片和视频文件。这些知识和技能对于我进一步学习和应用爬虫相关的内容具有重要的基础作用。

老师教了我python爬虫基础开始他给大家普及了一些网络常识后面他用了requets库做了一个下载英雄联盟的英雄皮肤图片的爬虫bs4 beautifulsoup4 在html中定位标签、提取文本、提取属性的python库 from bs4 import BeautifulSoupimport requests# bs4 使用 必须要传递页面的源代码# 响应对象text# html

原文地址: http://www.cveoy.top/t/topic/ibWi 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录