要使用Python爬取当前页的表格信息,可以使用XPath来定位和提取表格中的数据。下面是一个示例代码:

import requests
from lxml import etree

url = "http://xxcx.yjj.beijing.gov.cn/eportal/ui?pageId=723867"

# 发送GET请求获取页面内容
response = requests.get(url)
html = response.content

# 使用lxml解析HTML
tree = etree.HTML(html)

# 使用XPath定位表格
table = tree.xpath("//table[@id='report']")[0]

# 获取表格的所有行
rows = table.xpath(".//tr")

# 遍历每一行,提取数据
for row in rows:
    # 获取行中的所有单元格
    cells = row.xpath(".//td")
    
    # 遍历每个单元格,提取文本内容
    for cell in cells:
        # 输出单元格的文本内容
        print(cell.text)

该示例中,我们首先使用requests库发送GET请求获取页面内容,然后使用lxml库进行HTML解析。接下来,使用XPath定位到目标表格,并遍历表格的每一行,再遍历每一行中的单元格,提取并输出文本内容。

请注意,你需要安装requests和lxml库,可以使用以下命令进行安装:

pip install requests lxml
``
httpxxcxyjjbeijinggovcneportaluipageId=723867怎么爬取当前页的表格内的信息 用python xpath

原文地址: https://www.cveoy.top/t/topic/icq8 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录