Datehoer的博客
我本将心向明月,奈何明月照沟渠
Datehoer的博客

当前位置:主页 > 日常学习 > xpath定位的学习

xpath定位的学习

浏览: 作者:Datehoer 发布日期:2020-12-19 16:43:54 来源: 原创
今天在写爬虫的时候发现还是用xpath好用的多啊,所以记录一下自己关于xpath的学习。
简单说明一下原因,主页目录里的链接为中文汉字,而通过爬虫获取的链接为一串英文+符号%af%1%e%ee%b8d%e6%6%ea5e5%b9d%88%e6%5%ba%类似于这样,而我想要获取的内容则是每个链接内的文本文字,而它的xpath则类似于//*[@id="post-56013"]/div/div/p[3] 这个,前面的post-xxxxxx是文本的id,这个是根据前面链接的xpath获取的,而id的规律并没有找到我感觉应该是部分随机部分有规律,但是懒得找了。
所以才要学习一下其余的定位方法。
简单说说关于xpath的介绍

  • XPath 使用路径表达式在 XML 文档中进行导航
  • XPath 包含一个标准函数库
  • XPath 是 XSLT 中的主要元素
  • XPath 是一个 W3C 标准
其实我们学习python爬虫用到xpath的时候也就是是定位元素使用,而xpath之所以好用是因为它表示元素位置的方法很简单,类似于电脑中的文件路径,很方便使用。

XPath 使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和我们在常规的电脑文件系统中看到的表达式非常相似。

类似于JavaScript中的dom,xpath也是把元素当作一个一个的节点使用。在 xpath 中,有七种类型节点,分别是元素、属性、文本、命名空间、处理指令、注释以及文档(根)节点。之所以说是根,其实可以看一篇关于html名词解释的文章,以及后面的浅谈html dom
而且其实说白了,xpath就是为html服务的,所以其实许多叫法之类的都跟html类似。
比如说关于元素关系的称呼。
<?xml version="1.0" encoding="UTF-8"?>
<bookstore>
  <book>
    <title lang="en">Harry Potter</title>
    <author>J K. Rowling</author>
    <year>2005</year>
    <price>29.99</price>
  </book>
</bookstore>

举个例子,bookstore就是文档节点,而title,author等就是元素节点,然后lang=en则是属性节点。而他们的关系也如同JavaScript一样成为父子兄弟节点。
而我们通过xpath选取节点的方式其实也有许多种。

nodename 选取此节点的所有子节点。
/ 从根节点选取。
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置。
. 选取当前节点。
.. 选取当前节点的父节点。
@ 选取属性。

这个是最常见的几种方法了,其中//应该是大多数时候复制xpath时出现的,但是正如上面所说,你每篇文章的id可能不同,所以//匹配的话,可能就要考虑到id了,比如说我前面的那个,但是id获取有点难度,所以还是直接从根节点选取比较方便,因为众所周知,发布文章的话一般模板都是同一个的,所以文章文字在什么位置差不多应该是一成不变的,只要知道了一个,其余的页面的xpath定位也就清楚了。

<?xml version="1.0" encoding="UTF-8"?>
<bookstore>
<book>
<title lang="eng">Harry Potter</title>
<price>29.99</price>
</book>
<book>
<title lang="eng">Learning XML</title>
<price>39.95</price>
</book>
</bookstore>
简单的举一个小例子,我们要获取上面的元素的位置,该如何获取呢?

路径表达式 结果
bookstore 选取 bookstore 元素的所有子节点。
/bookstore

选取根元素 bookstore。

注释:假如路径起始于正斜杠( / ),则此路径始终代表到某元素的绝对路径!

bookstore/book 选取属于 bookstore 的子元素的所有 book 元素。
//book 选取所有 book 子元素,而不管它们在文档中的位置。
bookstore//book 选择属于 bookstore 元素的后代的所有 book 元素,而不管它们位于 bookstore 之下的什么位置。
//@lang 选取名为 lang 的所有属性。

不过其实当时刚看到这里的时候以为我行了,没想到获取到的只是一小段内容,仔细一看发现原来这个人的文章并没有自己单独占一个div里,而是和广告一起储存在一个div里,既然如此的话,那么其实就需要更深一步的学习了。
这里就要简单说一下谓语,这个是用来查找某个特定节点或包含某个指定的值的节点时来使用的方法。它被镶嵌在中括号内[],简单的看一下如何使用谓语获取值吧。


路径表达式 结果
/bookstore/book[1] 选取属于 bookstore 子元素的第一个 book 元素。
/bookstore/book[last()] 选取属于 bookstore 子元素的最后一个 book 元素。
/bookstore/book[last()-1] 选取属于 bookstore 子元素的倒数第二个 book 元素。
/bookstore/book[position()<3] 选取最前面的两个属于 bookstore 元素的子元素的 book 元素。
//title[@lang] 选取所有拥有名为 lang 的属性的 title 元素。
//title[@lang='eng'] 选取所有 title 元素,且这些元素拥有值为 eng 的 lang 属性。
/bookstore/book[price>35.00] 选取 bookstore 元素的所有 book 元素,且其中的 price 元素的值须大于 35.00。
/bookstore/book[price>35.00]//title 选取 bookstore 元素中的 book 元素的所有 title 元素,且其中的 price 元素的值须大于 35.00。

然后其实有的时候我们不想挨个查找,所以就有了匹配未知值的方法。

通配符 描述
* 匹配任何元素节点。
@* 匹配任何属性节点。
node() 匹配任何类型的节点。

路径表达式 结果
/bookstore/* 选取 bookstore 元素的所有子元素。
//* 选取文档中的所有元素。
//title[@*] 选取所有带有属性的 title 元素。

如果你想偷个懒,比如说我div内的p和h标签的内容我都想要,但是又懒得写两条xpath,那么就需要用到下面选取若干路径的方法了。

路径表达式 结果
//book/title | //book/price 选取 book 元素的所有 title 和 price 元素。
//title | //price 选取文档中的所有 title 和 price 元素。
/bookstore/book/title | //price 选取属于 bookstore 元素的 book 元素的所有 title 元素,以及文档中所有的 price 元素。

然后其实不光有这种通过路径获取元素位置的方法,还有一些相对简单的方法,这里是利用到前面所说的父子关系,同辈关系等等。

轴名称 结果
ancestor 选取当前节点的所有先辈(父、祖父等)。
ancestor-or-self 选取当前节点的所有先辈(父、祖父等)以及当前节点本身。
attribute 选取当前节点的所有属性。
child 选取当前节点的所有子元素。
descendant 选取当前节点的所有后代元素(子、孙等)。
descendant-or-self 选取当前节点的所有后代元素(子、孙等)以及当前节点本身。
following 选取文档中当前节点的结束标签之后的所有节点。
following-sibling 选取当前节点之后的所有兄弟节点
namespace 选取当前节点的所有命名空间节点。
parent 选取当前节点的父节点。
preceding 选取文档中当前节点的开始标签之前的所有节点。
preceding-sibling 选取当前节点之前的所有同级节点。
self 选取当前节点。

其实不光获取元素,xpath还能实现一些简单的运算。简单来看一下关于xpath的运算符吧。

运算符 描述 实例 返回值
| 计算两个节点集 //book | //cd 返回所有拥有 book 和 cd 元素的节点集
+ 加法 6 + 4 10
- 减法 6 - 4 2
* 乘法 6 * 4 24
div 除法 8 div 4 2
= 等于 price=9.80

如果 price 是 9.80,则返回 true。

如果 price 是 9.90,则返回 false。

!= 不等于 price!=9.80

如果 price 是 9.90,则返回 true。

如果 price 是 9.80,则返回 false。

< 小于 price<9.80

如果 price 是 9.00,则返回 true。

如果 price 是 9.90,则返回 false。

<= 小于或等于 price<=9.80

如果 price 是 9.00,则返回 true。

如果 price 是 9.90,则返回 false。

> 大于 price>9.80

如果 price 是 9.90,则返回 true。

如果 price 是 9.80,则返回 false。

>= 大于或等于 price>=9.80

如果 price 是 9.90,则返回 true。

如果 price 是 9.70,则返回 false。

or price=9.80 or price=9.70

如果 price 是 9.80,则返回 true。

如果 price 是 9.50,则返回 false。

and price>9.00 and price<9.90

如果 price 是 9.80,则返回 true。

如果 price 是 8.50,则返回 false。

mod 计算除法的余数 5 mod 2 1


然后其实差不多也就是上面的方法了,其实如果像我一样不想用//的方法,那么其实通过/body层级关系(其实应该是从/html开始算的)来查找的话,还是有难度的,毕竟有的网页的关系非常复杂。
这里简单介绍一种方法,就是我们先把body内的所有文字复制出来,然后将他们粘贴到一个文本里,之后将里面没有用的标签全部删除掉。
简单说一下
<body>
<div></div>
<div></div>
<div></div>
<div></div>
<div><p></p></div>
</body>
我们要获取最后一个div里的p标签,我们可以把前面已经有结束标签的标签全部删除掉,最后应该类似于这样:
<body>
<div><p></p></div>
</body>
之所以敢这么删除是因为其他的div都已经结束了,然后还跟我们要获取的内容没关系,所以可以删除掉。当然实际上页面比较复杂,还是要找一下适合自己的方法。
如果有什么不懂的可以在评论区留言,我会在看到的第一时间进行回复的。



12.19-18:48  补充

我觉得我确实有点沙雕了。。。。。
其实获取路径的话可以用copy full xpath这样就能获取到绝对路径了。
//*[@id="post-55998"]/div/div/p[5]
/html/body/div[1]/div/div[1]/main/article/div/div/p[6]
所以说其实还是要不断学习的这样子其实就能发现自己的不足了,不过没想到我居然这么快就发现问题了,很不错。

然后其实还有一个问题出现,就是其实根应该是html而不是body,前面想错了,因为其实如果要是算根的话,真正的根应该是html。



版权:本文由Datehoer原创,著作权归作者所有。商业转载请联系作者获得授权,非商业转载请保留以上作者信息和原文链接本文链接:https://zjzdmc.top/rcxx/94.html。

文章推荐

热门标签

返回顶部
下面为相关推荐
说点什么吧
  • 全部评论(0
    还没有评论,快来抢沙发吧!