Python爬虫程序示例:提取网页链接
以下是一个简单的爬虫程序示例:
import requests
from bs4 import BeautifulSoup
def crawl(url):
# 发送HTTP GET请求
response = requests.get(url)
# 解析HTML内容
soup = BeautifulSoup(response.text, 'html.parser')
# 提取需要的信息
# 例如提取所有的链接
links = soup.find_all('a')
for link in links:
print(link.get('href'))
# 调用爬虫函数
crawl('http://example.com')
这个爬虫程序使用了Python的requests库来发送HTTP请求,并使用BeautifulSoup库来解析HTML内容。在crawl函数中,我们发送一个GET请求并获取到响应,然后使用BeautifulSoup解析HTML内容,并提取出所有的链接。
请注意,爬取网站的过程可能涉及到一些法律和道德问题。在编写爬虫程序之前,请确保你了解相关法律法规,并确保你的爬虫程序是合法的。此外,为了避免对网站造成过大的负担,还应该尊重网站的robots.txt文件,并设置适当的爬取速率。
原文地址: https://www.cveoy.top/t/topic/pafg 著作权归作者所有。请勿转载和采集!