使用 Selenium 高效提取网页表格中的多行文本数据

霞舞

发布时间：2026-03-05 12:43:02

692人浏览过

来源于php中文网

原创

使用 Selenium 高效提取网页表格中的多行文本数据

本文讲解如何用 selenium 正确遍历动态表格中的所有目标元素（如比赛对阵名称），避免因错误索引、重复点击和页面跳转导致的数据遗漏，推荐采用 find_elements + 直接解析的简洁可靠方案。

本文讲解如何用 selenium 正确遍历动态表格中的所有目标元素（如比赛对阵名称），避免因错误索引、重复点击和页面跳转导致的数据遗漏，推荐采用 find_elements + 直接解析的简洁可靠方案。

在使用 Selenium 自动化抓取网页结构化数据时，一个常见误区是：为获取表格中每行的文本内容，先计算行数、再拼接 XPath、逐个点击跳转页面、返回后再重复操作——这不仅效率低下，还极易因页面重载、元素失效或索引错位（如原文中误用 number_of_pages_to_enter 替代循环变量 i）导致只提取到单条数据。

更专业、健壮的做法是：定位到所有目标元素集合，一次性获取并解析。以目标网站 https://www.tippmix.hu/sportfogadas#?q=nba&page=1 为例，其 NBA 赛程列表位于

的中，每场比赛标题链接位于

内的标签中，且完整信息（如 "Cleveland - Dallas"）已直接嵌入该链接的可见文本内（含换行符分隔），无需跳转详情页。

以下是优化后的标准实现：

AOXO_CMS建站系统企业通用版1.0

一个功能强大、性能卓越的企业建站系统。使用静态网页技术大大减轻了服务器负担、加快网页的显示速度、提高搜索引擎推广效果。本系统的特点自定义模块多样化、速度快、占用服务器资源小、扩展性强，能方便快捷地建立您的企业展示平台。简便高效的管理操作从用户使用的角度考虑，对功能的操作方便性进行了设计改造。使用户管理的工作量减小。网站互动数据可导出Word文档，邮件同步发送功能可将互动信息推送到指定邮箱，加快企业

下载

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url = 'https://www.tippmix.hu/sportfogadas#?q=nba&page=1'
driver = webdriver.Chrome()
driver.maximize_window()
driver.get(url)

# 显式等待：确保所有比赛链接完全加载并可见
wait = WebDriverWait(driver, 10)
game_links = wait.until(
    EC.visibility_of_all_elements_located((By.XPATH, "//tbody/tr/td[@class='title']/a"))
)

cimek = []
for link in game_links:
    # 每个链接文本形如 "Kosárlabda, NBA\nCleveland - Dallas\n02.27. 18:00"
    lines = link.text.strip().split("\n")
    if len(lines) >= 2:
        opponent_pair = lines[1].strip()  # 取第二行：对阵双方
        cimek.append(opponent_pair)
        print(opponent_pair)

driver.quit()

✅ 关键改进点说明：

✅ 避免手动索引与 XPath 拼接：原逻辑中 for i in range(...) 却始终使用 number_of_pages_to_enter，导致循环体实际只处理最后一行；改用 find_elements 直接获取全部匹配元素，天然规避索引越界与逻辑错乱。
✅ 消除不必要的页面跳转：button.click() → browser.back() 不仅慢，还易触发反爬机制或状态丢失；而目标文本已在当前页 DOM 中，直接 .text 即可。
✅ 增强健壮性：使用 visibility_of_all_elements_located 替代 presence_of_element_located，确保元素不仅存在，而且可见、可交互；配合 WebDriverWait 防止因加载延迟导致 NoSuchElementException。
✅ 安全解析文本：对 .text 结果做 strip() 和 split("\n") 防御性处理，避免空行或格式异常引发 IndexError。

⚠️ 注意事项：

若页面使用前端路由（如本例中的 #?q=nba&page=1），需确认 Selenium 加载后 JavaScript 已完成渲染；必要时可添加 time.sleep(1) 或监听特定元素出现。
//tbody/tr/td[@class='title']/a 是相对稳定的选择器，但若网站改版，建议优先使用语义化属性（如 data-testid）或 CSS 选择器（如 table tbody td.title a）提升可维护性。
生产环境中应加入异常捕获（如 try/except StaleElementReferenceException），并在循环内对每个 link 做 .is_displayed() 校验。

综上，Selenium 数据提取的核心原则是：尽可能减少 DOM 状态变更（如点击、跳转），优先利用静态结构批量定位，辅以显式等待与防御性解析。这不仅能提升脚本稳定性与执行速度，也大幅降低后期维护成本。

相关标签:

for try 循环 class dom 选择器 table tbody td tr https 自动化

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：如何用 Pydantic 灵活建模动态根级字段的 JSON 数据下一篇：Python pdb 调试完整指南

作者最新文章

Java中将float数组高效转为逗号分隔字符串的多种方法

2026-03-03 13:21

Chart.js 饼图图例不显示的解决方案

2026-03-03 13:27

评分相同外媒称《生化危机9》含金量不如《光与影》

2026-03-03 13:30

如何在 Go 应用中高效缓存 MySQL 查询结果（尤其是多表关联场景）

2026-03-03 13:36

Go语言实现Scheme解释器的核心机制解析

2026-03-03 13:43

统一 JSON 键名大小写：使用反射与递归实现全小写转换

2026-03-03 13:52

如何正确收集并结构化保存餐厅营业时间表数据

2026-03-03 13:52

锁定年度！《生化危机9》制作人暗示TGA：年底再见

2026-03-03 13:53

如何在Pandas中批量查找并统一替换含特定子串的字符串值

2026-03-03 14:15

抖音发布作品仅一人可见对方知道吗？设置仅一人可见,对方能看到吗

2026-03-03 14:33

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI编程开发 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

class在c语言中的意思

在C语言中，"class" 是一个关键字，用于定义一个类。想了解更多class的相关内容，可以阅读本专题下面的文章。

788

2024.01.03

python中class的含义

本专题整合了python中class的相关内容，阅读专题下面的文章了解更多详细内容。

2025.12.06

DOM是什么意思

dom的英文全称是documentobjectmodel，表示文件对象模型，是w3c组织推荐的处理可扩展置标语言的标准编程接口；dom是html文档的内存中对象表示，它提供了使用javascript与网页交互的方式。想了解更多的相关内容，可以阅读本专题下面的文章。

4183

2024.08.14

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2822

2024.08.16

PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境（CLI）下的开发与应用，内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理，以及与 Linux 定时任务（Cron）的结合使用。通过实战示例，帮助开发者掌握使用 PHP 构建自动化脚本、批处理工具与后台任务程序的能力。

2025.12.13

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

2026.03.04