以下是一个使用 Scrapy 框架编写的简单爬虫代码示例:\n\npython\nimport scrapy\n\nclass MySpider(scrapy.Spider):\n name = 'example'\n start_urls = ['http://example.com']\n\n def parse(self, response):\n # 处理网页内容\n # 这里可以使用 XPath 或 CSS 选择器提取所需的数据\n title = response.xpath('//title/text()').extract_first()\n yield {'title': title}\n \n # 如果需要爬取更多页面,可以继续发送请求\n yield scrapy.Request(url='http://example.com/next_page', callback=self.parse_next_page)\n \n def parse_next_page(self, response):\n # 处理下一页的内容\n pass\n\n# 运行爬虫\nfrom scrapy.crawler import CrawlerProcess\n\nprocess = CrawlerProcess()\nprocess.crawl(MySpider)\nprocess.start()\n\n\n在上面的例子中,我们定义了一个名为 MySpider 的爬虫类,继承自 Scrapy 的 Spider 类。我们指定了爬虫的名称为 example,并设置了起始 URL 为 http://example.com。\n\n在 parse 方法中,我们处理了页面的响应,使用 XPath 选择器提取了页面标题,并通过 yield 关键字将结果返回。如果需要爬取更多页面,可以使用 scrapy.Request 发送新的请求,并指定回调函数。\n\n最后,我们使用 CrawlerProcess 创建并运行爬虫。


原文地址: https://www.cveoy.top/t/topic/pvMP 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录