0

0

怎么用XPath选取所有叶子节点

畫卷琴夢

畫卷琴夢

发布时间:2026-02-10 05:09:16

|

543人浏览过

|

来源于php中文网

原创

XPath中选取叶子元素节点的表达式是//[not()],即匹配所有不包含子元素的元素节点,如text、等,但不匹配含子标签的元素或纯文本节点。

怎么用xpath选取所有叶子节点

XPath 本身没有直接叫“叶子节点”的内置谓词,但我们可以用逻辑来定义:叶子节点是指没有子元素的元素节点(即不包含 这样的子标签),但可以有文本内容。注意:文本节点、注释、处理指令等不算“叶子元素”,通常大家说的“叶子节点”在 HTML/XML 场景下指的是没有子元素的元素节点

所以,选取所有“叶子元素节点”的 XPath 表达式是:

//*[not(*)]

✅ 解释:

  • //:从整个文档任意位置匹配
  • *:匹配任意元素节点
  • not(*):该元素没有子元素(即没有 类型的子节点)
  • 组合起来就是:所有不包含任何子元素的元素节点

⚠️ 注意这几点

  • //*[not(*)] 不会匹配纯文本节点(如
    hello
    中的 "hello"),它只选元素节点(
    本身),前提是这个
    里面没有其他标签。
  • 它会匹配像 text
    怎么用XPath选取所有叶子节点 这类无子元素的元素。
  • 不会匹配

    xxx

    中的
    ,因为
    有子元素


    ✅ 常见变体与用途

    • 只选有文本内容的叶子元素(排除空标签)

      LobeHub
      LobeHub

      LobeChat brings you the best user experience of ChatGPT, OLLaMA, Gemini, Claude

      下载
      //*[not(*) and normalize-space(text())]

      → 排除

        
      这种看似有 text() 但实际为空的情况。

    • 选所有叶子元素,且要求至少有一个非空白文本子节点

      //*[not(*) and text()[normalize-space()]]
    • 在 Selenium / Scrapy / lxml 中使用示例(Python)

      from lxml import html
      tree = html.fromstring(html_content)
      leaf_elements = tree.xpath('//*[not(*)]')
      for el in leaf_elements:
          print(el.tag, el.text_content().strip())

    ❌ 容易误解的写法(别用)

    • //*[not(node())] —— 错!node() 包含文本、注释、元素等,很多元素有文本子节点,结果几乎不匹配。
    • //text()[not(parent::*)] —— 没意义,text() 节点必有父元素。
    • //*[count(*) = 0] —— 等价于 not(*),可以但略啰嗦,性能稍差。

    基本上就这些。核心记住:叶子元素 = 元素节点 + 没有子元素//*[not(*)] 是最简洁准确的写法。

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

779

2023.11.10

counta和count的区别
counta和count的区别

Count函数用于计算指定范围内数字的个数,而CountA函数用于计算指定范围内非空单元格的个数。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

198

2023.11.20

pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1922

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

2100

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

1112

2024.11.28

点击input框没有光标怎么办
点击input框没有光标怎么办

点击input框没有光标的解决办法:1、确认输入框焦点;2、清除浏览器缓存;3、更新浏览器;4、使用JavaScript;5、检查硬件设备;6、检查输入框属性;7、调试JavaScript代码;8、检查页面其他元素;9、考虑浏览器兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

192

2023.11.24

包子漫画网页版入口与全集阅读指南_正版免费漫画快速访问方法
包子漫画网页版入口与全集阅读指南_正版免费漫画快速访问方法

本专题汇总了包子漫画官网和网页版入口,提供最新章节抢先看方法、正版免费阅读指南,以及稳定访问方式,帮助用户快速直达包子漫画页面,无广告畅享全集漫画内容。

18

2026.02.10

MC.JS网页版快速畅玩指南_MC.JS官网在线入口及免安装体验方法
MC.JS网页版快速畅玩指南_MC.JS官网在线入口及免安装体验方法

本专题汇总了MC.JS官网入口和网页版快速畅玩方法,提供免安装访问、不同版本(1.8.8、1.12.8)在线体验指南,以及正版网页端操作说明,帮助玩家轻松进入MC.JS世界,实现即时畅玩与高效体验。

14

2026.02.10

谷歌邮箱网页版登录与注册全指南_Gmail账号快速访问与安全操作教程
谷歌邮箱网页版登录与注册全指南_Gmail账号快速访问与安全操作教程

本专题汇总了谷歌邮箱网页版的最新登录入口和注册方法,详细提供官方账号快速访问方式、网页版操作教程及安全登录技巧,帮助用户轻松管理Gmail邮箱账户,实现高效、安全的邮箱使用体验。

7

2026.02.10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

相关下载

更多

精品课程

更多
相关推荐
/
热门推荐
/
最新课程

最新文章

更多
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号