Python 正则表达式提取网页中多个 href - 无需循环
您可以使用正则表达式的re.findall()函数来提取网页中的多个href。以下是一个示例代码:
import re
html = '''
<tr class='chaxun_con'>
<td height='25' align='center'>
1
</td>
<td align='center'>
<a href='/eportal/ui?pageId=723920&id=1706c551c2a94bba9c3734b9ac5a75cb'>北京英克信息科技有限公司</a>
</td>
<td align='center'>
<a href='/eportal/ui?pageId=723921&id=1706c551c2a94bba9c3734b9ac5a75cc'>上海英克信息科技有限公司</a>
</td>
<td align='center'>
<a href='/eportal/ui?pageId=723922&id=1706c551c2a94bba9c3734b9ac5a75cd'>深圳英克信息科技有限公司</a>
</td>
</tr>
'''
hrefs = re.findall(r'<a href='([^']+)'>', html)
print(hrefs)
输出结果为:
['/eportal/ui?pageId=723920&id=1706c551c2a94bba9c3734b9ac5a75cb', '/eportal/ui?pageId=723921&id=1706c551c2a94bba9c3734b9ac5a75cc', '/eportal/ui?pageId=723922&id=1706c551c2a94bba9c3734b9ac5a75cd']
通过使用正则表达式<a href='([^']+)'>,我们可以提取出所有<a>标签中的href属性的值。注意,这个正则表达式假设href属性值不包含双引号。如果您的网页中的href属性值可能包含双引号,您可能需要调整正则表达式。
原文地址: https://www.cveoy.top/t/topic/pUFq 著作权归作者所有。请勿转载和采集!