python解析库的使用--XPath-电子发烧友网

XPath(XML Path Language)是一门在XML文档中查找信息的语言。

XPath 可用来在XML文档中对元素和属性进行遍历。

XPath 是 W3C XSLT 标准的主要元素，并且 XQuery 和 XPointer 都构建于 XPath 表达之上。

官方网址：http://lxml.de 官方文档：http://lxml.de/api/index.html

注：XQuery 是用于 XML 数据查询的语言（类似SQL查询数据库中的数据）

注：XPointer 由统一资源定位地址（URL）中#号之后的描述组成，类似于HTML中的锚点链接

python中如何安装使用XPath:

①: 安装 lxml 库。

②: from lxml import etree

③: Selector = etree.HTML(网页源代码)

④: Selector.xpath(xpath选取规则)

1. 准备工作：

要使用XPath首先要先安装lxml库：

pip install lxml

2. XPath选取节点规则

表达式	描述
nodename	选取此节点的所有子节点。
/	从当前节点选取直接子节点
//	从匹配选择的当前节点选择所有子孙节点，而不考虑它们的位置
.	选取当前节点。
..	选取当前节点的父节点。
@	选取属性。

XPath 运算符

运算符	描述	实例	返回值
¦	计算两个节点集	//book ¦ //cd	返回所有拥有 book 和 cd 元素的节点集
+	加法	6 + 4	10
-	减法	6 - 4	2
*	乘法	6 * 4	24
div	除法	8 div 4	2
=	等于	price=9.80	如果 price 是 9.80，则返回 true。、\n 如果 price 是 9.90，则返回 false。
!=	不等于	price!=9.80	如果 price 是 9.90，则返回 true。\n 如果 price 是 9.80，则返回 false。
<	小于	price<9.80	如果 price 是 9.00，则返回 true。\n 如果 price 是 9.90，则返回 false。
<=	小于或等于	price<=9.80	如果 price 是 9.00，则返回 true。\n 如果 price 是 9.90，则返回 false。
>	大于	price>9.80	如果 price 是 9.90，则返回 true。\n如果 price 是 9.80，则返回 false。
>=	大于或等于	price>=9.80	如果 price 是 9.90，则返回 true。\n如果 price 是 9.70，则返回 false。
or	或	price=9.80 or price=9.70	如果 price 是 9.80，则返回 true。\n如果 price 是 9.50，则返回 false。
and	与	price>9.00 and price<9.90	如果 price 是 9.80，则返回 true。\n如果 price 是 8.50，则返回 false。
mod	计算除法的余数	5 mod 2	1

3. 解析案例：

首先创建一个html文件：my.html 用于测试XPath的解析效果

`我的常用链接`

使用XPath解析说明

# 导入模块
from lxml import etree

# 读取html文件信息（在真实代码中是爬取的网页信息）
f = open("./my.html",'r',encoding="utf-8")
content = f.read()
f.close()

# 解析HTML文档，返回根节点对象
html = etree.HTML(content)
#print(html)  # 

# 获取网页中所有标签并遍历输出标签名
result = html.xpath("//*")
for t in result:
    print(t.tag,end=" ")
#[html head title body h3 ul li a li a ... ... td]
print()

# 获取节点
result = html.xpath("//li") # 获取所有li节点
result = html.xpath("//li/a") # 获取所有li节点下的所有直接a子节点
result = html.xpath("//ul//a") # 效果同上（ul下所有子孙节点）
result = html.xpath("//a/..") #获取所有a节点的父节点
print(result)

# 获取属性和文本内容
result = html.xpath("//li/a/@href") #获取所有li下所有直接子a节点的href属性值
result = html.xpath("//li/a/text()") #获取所有li下所有直接子a节点内的文本内容
print(result) #['百度', '京东', '搜狐', '新浪', '淘宝']

result = html.xpath("//li/a[@class]/text()") #获取所有li下所有直接含有class属性子a节点内的文本内容
print(result) #['百度', '搜狐', '新浪']

#获取所有li下所有直接含有class属性值为aa的子a节点内的文本内容
result = html.xpath("//li/a[@class='aa']/text()") 
print(result) #['搜狐', '新浪']

#获取class属性值中含有shop的li节点下所有直接a子节点内的文本内容
result = html.xpath("//li[contains(@class,'shop')]/a/text()") 
print(result) #['搜狐', '新浪']


# 按序选择
result = html.xpath("//li[1]/a/text()") # 获取每组li中的第一个li节点里面的a的文本
result = html.xpath("//li[last()]/a/text()") # 获取每组li中最后一个li节点里面的a的文本
result = html.xpath("//li[position()<3]/a/text()") # 获取每组li中前两个li节点里面的a的文本
result = html.xpath("//li[last()-2]/a/text()") # 获取每组li中倒数第三个li节点里面的a的文本
print(result) 

print("--"*30)
# 节点轴选择
result = html.xpath("//li[1]/ancestor::*") # 获取li的所有祖先节点
result = html.xpath("//li[1]/ancestor::ul") # 获取li的所有祖先中的ul节点
result = html.xpath("//li[1]/a/attribute::*") # 获取li中a节点的所有属性值
result = html.xpath("//li/child::a[@href='http://www.sohu.com']") #获取li子节点中属性href值的a节点
result = html.xpath("//body/descendant::a") # 获取body中的所有子孙节点a
print(result) 

result = html.xpath("//li[3]") #获取li中的第三个节点    
result = html.xpath("//li[3]/following::li") #获取第三个li节点之后所有li节点
result = html.xpath("//li[3]/following-sibling::*") #获取第三个li节点之后所有同级li节点
for v in result:
    print(v.find("a").text)

解析案例

# 导入模块
from lxml import etree

# 读取html文件信息（在真实代码中是爬取的网页信息）
f = open("./my.html",'r')
content = f.read()
f.close()

# 解析HTML文档，返回根节点对象
html = etree.HTML(content)

# 1. 获取id属性为hid的h3节点中的文本内容
print(html.xpath("//h3[@id='hid']/text()")) #['我的常用链接']


# 2. 获取li中所有超级链接a的信息
result = html.xpath("//li/a")
for t in result:
    # 通过xapth()二次解析结果
    #print(t.xpath("text()")[0], ':', t.xpath("@href")[0])

    # 效果同上，使用节点对象属性方法解析
    print(t.text, ':', t.get("href"))

'''
#结果:
百度 : http://www.baidu.com
京东 : http://www.jd.com
搜狐 : http://www.sohu.com
新浪 : http://www.sina.com
淘宝 : http://www.taobao.com
'''

'''
HTML元素的属性：
    tag：元素标签名
    text：标签中间的文本
HTML元素的方法：
    find()    查找一个匹配的元素
    findall() 查找所有匹配的元素    
    get(key, default=None) 获取指定属性值
    items（）获取元素属性，作为序列返回
    keys（）获取属性名称列表
    value（）将元素属性值作为字符串序列
'''


审核编辑：汤梓红

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

信息

信息

+关注

关注
0

文章
405

浏览量
35521
数据

数据

+关注

关注
8

文章
6899

浏览量
88844
python

python

+关注

关注
56

文章
4782

浏览量
84468

使用Python进行串口通信的案例

当然！以下是一个使用Python进行串口通信的简单示例。这个示例展示了如何配置串口、发送数据以及接收数据。我们将使用 pyserial 库，这是一个非常流行的用于串口通信的Python库

发表于 11-22 09:11 •86次阅读

如何使用Python构建LSTM神经网络模型

构建一个LSTM（长短期记忆）神经网络模型是一个涉及多个步骤的过程。以下是使用Python和Keras库构建LSTM模型的指南。 1. 安装必要的库首先，确保你已经安装了Python

发表于 11-13 10:10 •168次阅读

Python库解析：通过库实现代理请求与数据抓取

在Python中，有多个库可以帮助你实现代理请求和数据抓取。这些库提供了丰富的功能和灵活的API，使得你可以轻松地发送HTTP请求、处理响应、解析HTML/XML/JSON数据，以及进

发表于 10-24 07:54 •141次阅读

陀螺仪LSM6DSOW开发(5)----MotionFX库解析空间坐标

本文将探讨如何使用MotionFX库解析空间坐标。MotionFX库是一种用于传感器融合的强大工具，可以将加速度计、陀螺仪和磁力计的数据融合在一起，实现精确的姿态和位置估计。本文将介绍如何初始化

发表于 08-15 18:13 •1551次阅读

pytorch和python的关系是什么

在当今的人工智能领域，Python已经成为了最受欢迎的编程语言之一。Python的易学易用、丰富的库和框架以及强大的社区支持，使其成为了数据科学、机器学习和深度学习等领域的首选语言。而在深度学习领域

发表于 08-01 15:27 •1733次阅读

Python建模算法与应用

上成为理想的脚本语言，特别适用于快速的应用程序开发。本文将详细介绍Python在建模算法中的应用，包括常见的建模算法、Python在建模中的优势、常用库以及实际案例。

发表于 07-24 10:41 •465次阅读

opencv-python和opencv一样吗

不一样。OpenCV（Open Source Computer Vision Library）是一个开源的计算机视觉和机器学习软件库，它提供了大量的图像和视频处理功能。OpenCV-Python

发表于 07-16 10:38 •1003次阅读

深度学习常用的Python库

深度学习作为人工智能的一个重要分支，通过模拟人类大脑中的神经网络来解决复杂问题。Python作为一种流行的编程语言，凭借其简洁的语法和丰富的库支持，成为了深度学习研究和应用的首选工具。本文将深入探讨

发表于 07-03 16:04 •575次阅读

ESP32下如何加自定义Python库？

我看官方有提供Micropython的bin文件，但我想根据自己外设扩充一下Python库，这个应该从哪里入手？之前做过RTT系统的python库扩充，RTT有提供Micropyth

发表于 06-18 06:27

python解析netflow数据到csv的流程详解

本文主要讲解了linux下通过tcpdump抓取netflow数据包，并将其导入到wireshark进行解析，然后通过wireshark导出数据为json文件，再通过python脚本将其解析为csv文件以便做数据分析。

发表于 05-01 11:18 •633次阅读

python 学习：在内网中 python库-numpy 安装方法，升级pip3版本的指令

指令格式如下：先下载numpy库到C盘具体位置手动安装指令如下： pip install c:\\\\users\\\\sesa738142

发表于 04-22 17:18

ArkTS语言基础类库-解析

多线程并发，支持Worker线程和宿主线程之间进行通信，开发者需要主动创建和关闭Worker线程。提供常见的[容器类库增、删、改、查]的能力。提供XML、URL、URI构造和解析的能力。 XML

发表于 02-20 16:44

phpy：PHP与Python互调用库

phpy 是识沃团队最新推出的开源项目，目标是为 PHP 引入 Python 生态，来弥补 PHP 生态的空缺和不足。phpy 使得 PHP 可以调用所有 Python 的包。包括当下非常流行

发表于 12-12 10:43 •984次阅读

1000+常用Python库一览

lxml，快速，易用、灵活的HTML和XML处理库，功能超强，在遇到有缺陷、不规范的xml时，Python自带的xml处理器可能无法解析。报错时，程序会尝试再用lxml的修复模式解析。

发表于 11-30 17:00 •1096次阅读

python第三方库有哪些

Python 作为一门功能强大的编程语言，拥有丰富的第三方库，几乎覆盖了各个领域的应用。下面是一些常见且广泛应用的 Python 第三方库的总结，希望能为您提供帮助。 NumPy（Nu

发表于 11-29 14:31 •2097次阅读

搜索历史

python解析库的使用--XPath

1. 准备工作：

2. XPath选取节点规则

3. 解析案例：

`我的常用链接`

评论

使用Python进行串口通信的案例

如何使用Python构建LSTM神经网络模型

Python库解析：通过库实现代理请求与数据抓取

陀螺仪LSM6DSOW开发(5)----MotionFX库解析空间坐标

pytorch和python的关系是什么

Python建模算法与应用

opencv-python和opencv一样吗

深度学习常用的Python库

ESP32下如何加自定义Python库？

python解析netflow数据到csv的流程详解

python 学习：在内网中 python库-numpy 安装方法，升级pip3版本的指令

ArkTS语言基础类库-解析

phpy：PHP与Python互调用库

1000+常用Python库一览

python第三方库有哪些