# 导入selenium和lxml库\nfrom selenium import webdriver\nfrom selenium.webdriver.common.keys import Keys\nimport time\nimport random\nfrom lxml import etree\n\n# 设置小说搜索关键词\nkeyword = "开挂闯异界"\n\n# 创建浏览器对象\ndriver = webdriver.Chrome()\n\n# 打开笔趣阁小说网首页\ndriver.get("https://www.bige3.cc/")\n\n# 输入搜索关键词并点击搜索按钮\nsearch_input = driver.find_element_by_xpath("/html/body/div[4]/div[1]/div[2]/form/input[1]")\nsearch_input.send_keys(keyword)\n# 按回车键进行搜索\nsearch_input.send_keys(Keys.ENTER)\ntime.sleep(3)\n\n# 依次点击小说标题打开小说\nelements = driver.find_elements_by_xpath("/html/body/div[5]/div/div/div/div/div[2]/h4/a")\nfor i in range(len(elements)):\n # 在这里执行你想要的操作,例如获取元素文本、点击元素等\n elements = driver.find_elements_by_xpath("/html/body/div[5]/div/div/div/div/div[2]/h4/a")\n element = elements[i]\n print(element.text) # 打印元素文本\n # 生成随机的点击延迟时间\n delay = random.uniform(3, 5)\n time.sleep(delay)\n element.click() # 点击元素\n\n # 切换到新打开的窗口\n driver.switch_to.window(driver.window_handles[-1])\n time.sleep(3)\n\n # 获取每章的标题及其内容\n chapters = driver.find_elements_by_xpath("//[@class='listmain']/dl/dd/a")\n for chapter in chapters:\n chapter_title = chapter.text.replace('、', '') # 获取章节标题\n chapter_url = chapter.get_attribute("href") # 获取章节链接\n # 打开章节链接\n driver.get(chapter_url)\n time.sleep(3)\n # 获取章节内容\n chapter_content = driver.find_element_by_xpath("//[@id='chaptercontent']")\n html = chapter_content.get_attribute("innerHTML")\n # 使用lxml解析章节内容\n tree = etree.HTML(html)\n content = tree.xpath("string(.)") # 获取章节内容的文本形式\n\n print(chapter_title)\n print(content)\n\n # 后退到小说目录页面\n driver.back()\n time.sleep(3)\n \n # 后退到搜索结果页面\n driver.back()\n time.sleep(3)\n \n# 关闭浏览器\ndriver.quit()

Python爬虫实战:使用Selenium和lxml库抓取笔趣阁小说内容

原文地址: https://www.cveoy.top/t/topic/qw9I 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录