0

0

使用 xpath 解析 html 的解析器:Jsoupxpath_html/css_WEB-ITnose

php中文网

php中文网

发布时间:2016-06-21 09:04:54

|

1832人浏览过

|

来源于php中文网

原创

JsoupXpath 是一款纯Java开发的使用xpath解析html的解析器,xpath语法分析与执行完全独立,html的DOM树生成借助Jsoup,故命名为JsoupXpath.为了在java里也享受xpath的强大与方便但又苦于找不到一款足够强大的xpath解析器,故开发了JsoupXpath。JsoupXpath的实现逻辑清晰,扩展方便,支持几乎全部常用的xpath语法.
http://www.cnblogs.com/ 为例"//a/@href";"//div[@id='paging_block']/div/a[text()='Next >']/@href";"//div[@id='paging_block']/div/a[text()*='Next']/@href";"//h1/text()";"//h1/allText()";"//h1//text()";"//div/a";"//div[@id='post_list']/div[position()<3]/div/h3/allText()";"//div[@id='post_list']/div[first()]/div/h3/allText()";"//div[@id='post_list']/div[1]/div/h3/allText()";"//div[@id='post_list']/div[last()]/div/h3/allText()";//查找评论大于1000的条目(当然只是为了演示复杂xpath了,谓语中可以各种嵌套,这样才能测试的更全面嘛)"//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";//轴支持"//div[@id='post_list']/div[self::div/div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()|//div[@id='post_list']/div[1]/div/h3/allText()";

在这里暂不列出框架间的对比了,但我相信,你们用了会发现JsoupXpath就是目前市面上最强大的的Xpath解析器。

快速开始

如果不方便使用maven,可以直接使用lib下的依赖包跑起来试试,如方便可直接使用如下dependency(已经上传至中央maven库,最新版本0.1.1):

   cn.wanghaomiao   JsoupXpath   0.1.1

依赖配置好后,就可以使用如下例子进行体验了!

String xpath="//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";String doc = "...";JXDocument jxDocument = new JXDocument(doc);List rs = jxDocument.sel(xpath);for (Object o:rs){    if (o instanceof Element){            int index = ((Element) o).siblingIndex();            System.out.println(index);    }    System.out.println(o.toString());}   

其他可以参考 cn.wanghaomiao.example包下的例子

立即学习前端免费学习笔记(深入)”;

语法

支持标准xpath语法(支持谓语嵌套),支持全部常用函数,支持全部常用轴,去掉了一些标准里面华而不实的函数和轴,下面会具体介绍。语法可以参考http://www.w3school.com.cn/xpath/index.asp

关于使用Xpath的一些注意事项

非常不建议直接粘贴Firefox或chrome里生成的Xpath,这些浏览器在渲染页面会根据标准自动补全一些标签,如table标签会自动加上tbody标签,这样生成的Xpath路径显然不是最通用的,所以很可能就取不到值。所以,要使用Xpath并感受Xpath的强大以及他所带来便捷与优雅最好就是学习下Xpath的标准语法,这样应对各种问题才能游刃有余,享受Xpath的真正威力!

函数

  • text() 提取节点的自有文本

  • node() 提取所有节点

  • position() 返回当前节点所处在同胞中的位置

  • last() 返回同级节点中的最后那个节点

  • first() 返回同级节点中的第一个节点

解析器扩展函数

  • allText()提取节点下全部文本,取代类似 //div/h3//text()这种递归取文本用法

  • html()获取全部节点的内部的html

  • outerHtml()获取全部节点的 包含节点本身在内的全部html

  • num()抽取节点自有文本中全部数字,如果知道节点的自有文本(即非子代节点所包含的文本)中只存在一个数字,如阅读数,评论数,价格等那么直接可以直接提取此数字出来。如果有多个数字将提取第一个匹配的连续数字。

其他说明

  • contains(arga,argb)这个函数暂时不支持,因为JsoupXpath拥有强大的运算符支持,完全可以取代它!如,可以用*=取代contains() 例://div[text()*='next']

  • self 节点自身

  • parent 父节点

  • child 直接子节点

  • ancestor 全部祖先节点 父亲,爷爷 , 爷爷的父亲...

  • ancestor-or-self全部祖先节点和自身节点

    造梦阁AI
    造梦阁AI

    AI小说推文一键成片,你的故事值得被看见

    下载
  • descendant 全部子代节点 儿子,孙子,孙子的儿子...

  • descendant-or-self 全部子代节点和自身

  • preceding-sibling 节点前面的全部同胞节点

  • following-sibling 节点后面的全部同胞节点

轴实用扩展

  • preceding-sibling-one 前一个同胞节点(扩展)

  • following-sibling-one 返回下一个同胞节点(扩展) 语法

  • sibling 全部同胞(扩展)

操作符

这些操作符可谓足够强大,满足几乎你所有的需求。

  • 返回两个节点集的并集

  • a+b 加 返回数值结果

  • a-b 减 返回数值结果

  • a=b 判断是否相等返回Boolean

  • a!=b 不等于 返回Boolean

  • a>b 大于 返回Boolean

  • a>=b 大于等于 返回Boolean

  • a

  • a

操作符扩展

  • a^=b 字符串a是否以字符串b开头 a startwith b 返回Boolean

  • a*=b a是否包含b, a contains b 返回Boolean

  • a$=b a是否以b结尾 a endwith b 返回Boolean

  • a~=b a的内容是否符合 正则表达式b 返回Boolean

其他说明

基本这些足够了,其他鸡肋的暂时不支持,如有特殊需求请联系我。项目地址:GitHub/Jsoupxpath

项目主页:http://www.open-open.com/lib/view/home/1445699703570

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Golang gRPC 服务开发与Protobuf实战
Golang gRPC 服务开发与Protobuf实战

本专题系统讲解 Golang 在 gRPC 服务开发中的完整实践,涵盖 Protobuf 定义与代码生成、gRPC 服务端与客户端实现、流式 RPC(Unary/Server/Client/Bidirectional)、错误处理、拦截器、中间件以及与 HTTP/REST 的对接方案。通过实际案例,帮助学习者掌握 使用 Go 构建高性能、强类型、可扩展的 RPC 服务体系,适用于微服务与内部系统通信场景。

6

2026.01.15

公务员递补名单公布时间 公务员递补要求
公务员递补名单公布时间 公务员递补要求

公务员递补名单公布时间不固定,通常在面试前,由招录单位(如国家知识产权局、海关等)发布,依据是原入围考生放弃资格,会按笔试成绩从高到低递补,递补考生需按公告要求限时确认并提交材料,及时参加面试/体检等后续环节。要求核心是按招录单位公告及时响应、提交材料(确认书、资格复审材料)并准时参加面试。

37

2026.01.15

公务员调剂条件 2026调剂公告时间
公务员调剂条件 2026调剂公告时间

(一)符合拟调剂职位所要求的资格条件。 (二)公共科目笔试成绩同时达到拟调剂职位和原报考职位的合格分数线,且考试类别相同。 拟调剂职位设置了专业科目笔试条件的,专业科目笔试成绩还须同时达到合格分数线,且考试类别相同。 (三)未进入原报考职位面试人员名单。

51

2026.01.15

国考成绩查询入口 国考分数公布时间2026
国考成绩查询入口 国考分数公布时间2026

笔试成绩查询入口已开通,考生可登录国家公务员局中央机关及其直属机构2026年度考试录用公务员专题网站http://bm.scs.gov.cn/pp/gkweb/core/web/ui/business/examResult/written_result.html,查询笔试成绩和合格分数线,点击“笔试成绩查询”按钮,凭借身份证及准考证进行查询。

8

2026.01.15

Java 桌面应用开发(JavaFX 实战)
Java 桌面应用开发(JavaFX 实战)

本专题系统讲解 Java 在桌面应用开发领域的实战应用,重点围绕 JavaFX 框架,涵盖界面布局、控件使用、事件处理、FXML、样式美化(CSS)、多线程与UI响应优化,以及桌面应用的打包与发布。通过完整示例项目,帮助学习者掌握 使用 Java 构建现代化、跨平台桌面应用程序的核心能力。

65

2026.01.14

php与html混编教程大全
php与html混编教程大全

本专题整合了php和html混编相关教程,阅读专题下面的文章了解更多详细内容。

36

2026.01.13

PHP 高性能
PHP 高性能

本专题整合了PHP高性能相关教程大全,阅读专题下面的文章了解更多详细内容。

75

2026.01.13

MySQL数据库报错常见问题及解决方法大全
MySQL数据库报错常见问题及解决方法大全

本专题整合了MySQL数据库报错常见问题及解决方法,阅读专题下面的文章了解更多详细内容。

20

2026.01.13

PHP 文件上传
PHP 文件上传

本专题整合了PHP实现文件上传相关教程,阅读专题下面的文章了解更多详细内容。

33

2026.01.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
【web前端】Node.js快速入门
【web前端】Node.js快速入门

共16课时 | 2万人学习

Go语言实战之 GraphQL
Go语言实战之 GraphQL

共10课时 | 0.8万人学习

微信小程序开发之API篇
微信小程序开发之API篇

共15课时 | 1.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号