0

0

使用 Selenium 高效提取网页表格中的多行文本数据

霞舞

霞舞

发布时间:2026-03-05 12:43:02

|

692人浏览过

|

来源于php中文网

原创

使用 Selenium 高效提取网页表格中的多行文本数据

本文讲解如何用 selenium 正确遍历动态表格中的所有目标元素(如比赛对阵名称),避免因错误索引、重复点击和页面跳转导致的数据遗漏,推荐采用 find_elements + 直接解析的简洁可靠方案。

本文讲解如何用 selenium 正确遍历动态表格中的所有目标元素(如比赛对阵名称),避免因错误索引、重复点击和页面跳转导致的数据遗漏,推荐采用 find_elements + 直接解析的简洁可靠方案。

在使用 Selenium 自动化抓取网页结构化数据时,一个常见误区是:为获取表格中每行的文本内容,先计算行数、再拼接 XPath、逐个点击跳转页面、返回后再重复操作——这不仅效率低下,还极易因页面重载、元素失效或索引错位(如原文中误用 number_of_pages_to_enter 替代循环变量 i)导致只提取到单条数据。

更专业、健壮的做法是:定位到所有目标元素集合,一次性获取并解析。以目标网站 https://www.tippmix.hu/sportfogadas#?q=nba&page=1 为例,其 NBA 赛程列表位于

的 中,每场比赛标题链接位于
内的 标签中,且完整信息(如 "Cleveland - Dallas")已直接嵌入该链接的可见文本内(含换行符分隔),无需跳转详情页。

以下是优化后的标准实现:

AOXO_CMS建站系统企业通用版1.0
AOXO_CMS建站系统企业通用版1.0

一个功能强大、性能卓越的企业建站系统。使用静态网页技术大大减轻了服务器负担、加快网页的显示速度、提高搜索引擎推广效果。本系统的特点自定义模块多样化、速度快、占用服务器资源小、扩展性强,能方便快捷地建立您的企业展示平台。简便高效的管理操作从用户使用的角度考虑,对功能的操作方便性进行了设计改造。使用户管理的工作量减小。网站互动数据可导出Word文档,邮件同步发送功能可将互动信息推送到指定邮箱,加快企业

下载
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url = 'https://www.tippmix.hu/sportfogadas#?q=nba&page=1'
driver = webdriver.Chrome()
driver.maximize_window()
driver.get(url)

# 显式等待:确保所有比赛链接完全加载并可见
wait = WebDriverWait(driver, 10)
game_links = wait.until(
    EC.visibility_of_all_elements_located((By.XPATH, "//tbody/tr/td[@class='title']/a"))
)

cimek = []
for link in game_links:
    # 每个链接文本形如 "Kosárlabda, NBA\nCleveland - Dallas\n02.27. 18:00"
    lines = link.text.strip().split("\n")
    if len(lines) >= 2:
        opponent_pair = lines[1].strip()  # 取第二行:对阵双方
        cimek.append(opponent_pair)
        print(opponent_pair)

driver.quit()

关键改进点说明:

  • 避免手动索引与 XPath 拼接:原逻辑中 for i in range(...) 却始终使用 number_of_pages_to_enter,导致循环体实际只处理最后一行;改用 find_elements 直接获取全部匹配元素,天然规避索引越界与逻辑错乱。
  • 消除不必要的页面跳转:button.click() → browser.back() 不仅慢,还易触发反爬机制或状态丢失;而目标文本已在当前页 DOM 中,直接 .text 即可。
  • 增强健壮性:使用 visibility_of_all_elements_located 替代 presence_of_element_located,确保元素不仅存在,而且可见、可交互;配合 WebDriverWait 防止因加载延迟导致 NoSuchElementException。
  • 安全解析文本:对 .text 结果做 strip() 和 split("\n") 防御性处理,避免空行或格式异常引发 IndexError。

⚠️ 注意事项:

  • 若页面使用前端路由(如本例中的 #?q=nba&page=1),需确认 Selenium 加载后 JavaScript 已完成渲染;必要时可添加 time.sleep(1) 或监听特定元素出现。
  • //tbody/tr/td[@class='title']/a 是相对稳定的选择器,但若网站改版,建议优先使用语义化属性(如 data-testid)或 CSS 选择器(如 table tbody td.title a)提升可维护性。
  • 生产环境中应加入异常捕获(如 try/except StaleElementReferenceException),并在循环内对每个 link 做 .is_displayed() 校验。

综上,Selenium 数据提取的核心原则是:尽可能减少 DOM 状态变更(如点击、跳转),优先利用静态结构批量定位,辅以显式等待与防御性解析。这不仅能提升脚本稳定性与执行速度,也大幅降低后期维护成本。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
class在c语言中的意思
class在c语言中的意思

在C语言中,"class" 是一个关键字,用于定义一个类。想了解更多class的相关内容,可以阅读本专题下面的文章。

788

2024.01.03

python中class的含义
python中class的含义

本专题整合了python中class的相关内容,阅读专题下面的文章了解更多详细内容。

25

2025.12.06

DOM是什么意思
DOM是什么意思

dom的英文全称是documentobjectmodel,表示文件对象模型,是w3c组织推荐的处理可扩展置标语言的标准编程接口;dom是html文档的内存中对象表示,它提供了使用javascript与网页交互的方式。想了解更多的相关内容,可以阅读本专题下面的文章。

4183

2024.08.14

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2822

2024.08.16

PHP 命令行脚本与自动化任务开发
PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境(CLI)下的开发与应用,内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理,以及与 Linux 定时任务(Cron)的结合使用。通过实战示例,帮助开发者掌握使用 PHP 构建 自动化脚本、批处理工具与后台任务程序 的能力。

63

2025.12.13

Rust内存安全机制与所有权模型深度实践
Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开,深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例,分析内存安全保障原理与零成本抽象优势,并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学,掌握在高性能与安全性并重场景中的工程实践能力。

2

2026.03.05

PHP高性能API设计与Laravel服务架构实践
PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开,重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景,深入分析性能瓶颈定位与优化思路,帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

58

2026.03.04

AI安装教程大全
AI安装教程大全

2026最全AI工具安装教程专题:包含各版本AI绘图、AI视频、智能办公软件的本地化部署手册。全篇零基础友好,附带最新模型下载地址、一键安装脚本及常见报错修复方案。每日更新,收藏这一篇就够了,让AI安装不再报错!

31

2026.03.04

Swift iOS架构设计与MVVM模式实战
Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践,系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例,帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

59

2026.03.03

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号