`
369128396
  • 浏览: 85219 次
  • 性别: Icon_minigender_2
  • 来自: 北京
社区版块
存档分类
最新评论

XPath简介(转载)

阅读更多
XPath 简介Previous Page Next Page
XPath 是一门在 XML 文档中查找信息的语言。XPath 用于在 XML 文档中通过元素和属性进行导航。
在学习之前应该具备的知识:
在您继续学习之前,应该对下面的知识有基本的了解:

HTML / XHTML
XML / XML 命名空间
如果您希望首先学习这些项目,请在我们的 首页 访问这些教程。
什么是 XPath?
XPath 使用路径表达式在 XML 文档中进行导航
XPath 包含一个标准函数库
XPath 是 XSLT 中的主要元素
XPath 是一个 W3C 标准
XPath 路径表达式
XPath 使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和我们在常规的电脑文件系统中看到的表达式非常相似。
XPath 标准函数
XPath 含有超过 100 个内建的函数。这些函数用于字符串值、数值,日期和时间比较、节点和 QName 处理、序列处理、逻辑值等等。
XPath 在 XSLT 中使用
XPath 是 XSLT 标准中的主要元素。如果没有 XPath 方面的知识,您就无法创建 XSLT 文档。

您可以在我们的《XSLT 教程》中阅读更多的内容。

XQuery 和 XPointer 均构建于 XPath 表达式之上。XQuery 1.0 和 XPath 2.0 共享相同的数据模型,并支持相同的函数和运算符。

您可以在我们的《XQuery 教程》中阅读更多有关 XQuery 的知识。





XPath 语法
Previous Page Next Page XPath 使用路径表达式来选取 XML 文档中的节点或节点集。节点是通过沿着路径 (path) 或者步 (steps) 来选取的。
XML 实例文档
我们将在下面的例子中使用这个 XML 文档。

<?xml version="1.0" encoding="ISO-8859-1"?>

<bookstore>

<book>
  <title lang="eng">Harry Potter</title>
  <price>29.99</price>
</book>

<book>
  <title lang="eng">Learning XML</title>
  <price>39.95</price>
</book>

</bookstore>选取节点
XPath 使用路径表达式在 XML 文档中选取节点。节点是通过沿着路径或者 step 来选取的。

下面列出了最有用的路径表达式:
表达式 描述
nodename 选取此节点的所有子节点
/ 从根节点选取
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置
. 选取当前节点
.. 选取当前节点的父节点
@ 选取属性

实例
在下面的表格中,我们已列出了一些路径表达式以及表达式的结果:

路径表达式 结果
bookstore 选取 bookstore 元素的所有子节点
/bookstore 选取根元素 bookstore

注释:假如路径起始于正斜杠( / ),则此路径始终代表到某元素的绝对路径!

bookstore/book 选取所有属于 bookstore 的子元素的 book 元素。
//book 选取所有 book 子元素,而不管它们在文档中的位置。
bookstore//book 选择所有属于 bookstore 元素的后代的 book 元素,而不管它们位于 bookstore 之下的什么位置。
//@lang 选取所有名为 lang 的属性。
谓语(Predicates)
谓语用来查找某个特定的节点或者包含某个指定的值的节点。

谓语被嵌在方括号中。

实例
在下面的表格中,我们列出了带有谓语的一些路径表达式,以及表达式的结果:

路径表达式 结果
/bookstore/book[1] 选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()] 选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1] 选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()<3] 选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang] 选取所有拥有名为 lang 的属性的 title 元素。
//title[@lang='eng'] 选取所有 title 元素,且这些元素拥有值为 eng 的 lang 属性。
/bookstore/book[price>35.00] 选取所有 bookstore 元素的 book 元素,且其中的 price 元素的值须大于 35.00。
/bookstore/book[price>35.00]/title 选取所有 bookstore 元素中的 book 元素的 title 元素,且其中的 price 元素的值须大于 35.00。
选取未知节点
XPath 通配符可用来选取未知的 XML 元素。

通配符 描述
* 匹配任何元素节点
@* 匹配任何属性节点
node() 匹配任何类型的节点

实例
在下面的表格中,我们列出了一些路径表达式,以及这些表达式的结果:

路径表达式 结果
/bookstore/* 选取 bookstore 元素的所有子节点
//* 选取文档中的所有元素
//title[@*] 选取所有带有属性的 title 元素。
选取若干路径
通过在路径表达式中使用“|”运算符,您可以选取若干个路径。

实例
在下面的表格中,我们列出了一些路径表达式,以及这些表达式的结果:

路径表达式 结果
//book/title | //book/price 选取所有 book 元素的 title 和 price 元素。
//title | //price 选取所有文档中的 title 和 price 元素。
/bookstore/book/title | //price 选取所有属于 bookstore 元素的 book 元素的 title 元素,以及文档中所有的 price 元素。
分享到:
评论

相关推荐

    [转载]Selenium2.0之WebDriver学习总结(2).docx

    WebDriver 支持浏览器原生的 XPath 功能,如 `driver.findElement(By.xpath("xpathExpression"))`。XPath 可以实现更复杂的定位,但需要注意不同浏览器可能有不同的实现方式。 在实际测试中,选择合适的定位方法至...

    css定位符注意事项header.py

    xpath定位注意事项,header注意事项,为了解决已解决AttributeError: 'set' object has no attribute 'items' 2019-03-20 15:54:31 Blossoming 阅读数 1325 收藏 更多 分类专栏: python3 爬虫 版权声明:本文为...

    【RPA之家转载AA视频教程】14.Configuration .rar

    在这个由RPA之家转载的AA(Automation Anywhere)视频教程中,我们将深入探讨如何在Automation Anywhere A2019版本中处理配置文件,并特别关注如何从XML配置文件中读取节点,以提升自动化效率。 首先,我们要理解...

    [转载] JAXB中Java对象和XML之间的转换

    9. **使用XPath**: JAXB还允许通过XPath表达式选择XML中的特定部分进行操作,这在处理复杂XML文档时非常有用。 总之,JAXB是一个强大的工具,它为Java开发者提供了一种简洁且高效的方式来处理XML数据,使得Java对象...

    【RPA之家转载视频教程2】UiPath Studio中的数据抓取——使用UiPath将结果从网站复制到记事本.rar

    【RPA之家】提供的【RPA之家转载视频教程2】主要介绍了UiPath Studio中的数据抓取技术,通过这个教程,我们可以深入理解如何利用RPA工具高效地自动化处理网络上的信息。RPA,即机器人流程自动化,是一种先进的技术,...

    My Book 与 WebSpider 相关的源文件.zip

    书中首先详细介绍了环境配置过程和爬虫基础知识然后讨论了urllib、requests等请求库,Beautiful Soup、XPath、pyquery等解析库以及文本和流派数据库的存储方法接下来通过多个案例介绍了如何进行Ajax数据爬取,如何...

    毕业设计基于Python豆瓣网站数据爬取与可视化实现项目源码.zip

    例如,使用CSS选择器或XPath表达式定位元素,然后提取文本内容。 4. **数据清洗**:爬取的数据通常包含噪声,如HTML标签、特殊字符等,需要使用Python的字符串操作方法、正则表达式等工具进行清洗,确保数据质量。...

    自己正在使用的关关采集规则 20201024

    飞卢小说网是一个可能存在大量原创和转载小说的平台,用户可能想抓取这些内容进行数据分析、个人阅读存档或是其他用途。 数据采集规则通常包括URL模板、请求头设置、解析逻辑(XPath或CSS选择器)、数据提取路径等...

    TinyXML2.5.2中文文档

    #### 一、TinyXML 简介 - **TinyXML 定义**:TinyXML 是一款简单、轻量级且易于集成到其他程序中的 C++ XML 解析器。其主要功能在于解析 XML 文档并构建一个可读、可修改及可保存的文档对象模型(DOM)。 - **DOM ...

    【Python爬虫:Scrapy】 之 PyCharm 搭建Scrapy环境+创建Scrapy项目 实例

    type = scrapy.Field() # 文章类型(原创/转载/翻译) url = scrapy.Field() # 文章链接 date = scrapy.Field() # 文章发布日期 read_num = scrapy.Field() # 文章阅读量 ``` 2. 在`ScrapyDemo/spiders`目录下...

    JAVA WEB 开发详解:XML+XSLT+SERVLET+JSP 深入剖析与实例应用.part2

    同时,转载时不要移除本申明。如产生任何纠纷,均与本博客所有人、发表该文献之人无任何关系。谢谢合作 本书共分4部分,从xml、servlet、jsp和应用的角度向读者展示了java web开发中各种技术的应用,循序渐进地...

    JAVA WEB 开发详解:XML+XSLT+SERVLET+JSP 深入剖析与实例应用.part5

    同时,转载时不要移除本申明。如产生任何纠纷,均与本博客所有人、发表该文献之人无任何关系。谢谢合作 本书共分4部分,从xml、servlet、jsp和应用的角度向读者展示了java web开发中各种技术的应用,循序渐进地...

    JAVA WEB 开发详解:XML+XSLT+SERVLET+JSP 深入剖析与实例应用.part4

    同时,转载时不要移除本申明。如产生任何纠纷,均与本博客所有人、发表该文献之人无任何关系。谢谢合作 本书共分4部分,从xml、servlet、jsp和应用的角度向读者展示了java web开发中各种技术的应用,循序渐进地...

    JAVA WEB 开发详解:XML+XSLT+SERVLET+JSP 深入剖析与实例应用.part3

    同时,转载时不要移除本申明。如产生任何纠纷,均与本博客所有人、发表该文献之人无任何关系。谢谢合作 本书共分4部分,从xml、servlet、jsp和应用的角度向读者展示了java web开发中各种技术的应用,循序渐进地...

Global site tag (gtag.js) - Google Analytics