使用Beautiful Soup正确提取网页文本：进阶教程

DDD

发布时间：2025-10-04 19:12:18

227人浏览过

来源于php中文网

原创

使用beautiful soup正确提取网页文本：进阶教程

本文旨在帮助开发者解决在使用Beautiful Soup库提取网页文本时遇到的常见问题，特别是当目标文本位于<script>标签内或动态加载时。我们将通过实际案例，深入探讨如何利用正则表达式和JSON解析，结合Beautiful Soup，高效、准确地提取所需信息。

在使用Beautiful Soup进行网页抓取时，有时会遇到无法直接提取所需文本的情况，这通常是因为：

文本位于<script>标签内： 一些网站会将数据嵌入到JavaScript代码中，例如存储在全局变量或JSON对象中。
文本是动态加载的： 部分网站使用JavaScript在客户端动态生成内容，这些内容可能在初始HTML中不存在。

针对以上情况，我们需要采取一些额外的步骤来提取目标文本。

1. 分析网页结构

首先，我们需要仔细分析网页的HTML源代码，确定目标文本的存储方式。常见的存储方式包括：

直接嵌入在HTML标签中 (例如 <p>, <div>)
存储在<script>标签内的JavaScript变量中
通过AJAX请求动态加载

2. 提取<script>标签中的数据

如果目标文本存储在<script>标签内，我们可以使用正则表达式来提取相关数据。以下是一个示例，演示如何提取存储在window.__INITIAL_STATE__变量中的JSON数据：

无限画

千库网旗下AI绘画创作平台

下载

import re
import json

import requests
from bs4 import BeautifulSoup

URL = "https://habr.com/ru/hubs/gamedev/articles/"  # 目标网站URL

page = requests.get(URL).text
# 使用正则表达式匹配 window.__INITIAL_STATE__ 变量
data = re.search(r"window\.__INITIAL_STATE__=(.*}});", page).group(1)

# 将提取的字符串转换为JSON对象
data = json.loads(data)

# 遍历文章列表，提取标题和描述
for a in sorted(
    data["articlesList"]["articlesList"].values(),
    key=lambda k: k["timePublished"],
    reverse=True,
):
    print(a["titleHtml"])
    print(BeautifulSoup(a["leadData"]["textHtml"], "html.parser").text)

    # 只提取第一篇文章
    break

代码解释：

re.search(r"window\.__INITIAL_STATE__=(.*}});", page).group(1)：使用正则表达式查找以window.__INITIAL_STATE__=开头，以}}结尾的字符串，并提取括号内的内容。
json.loads(data)：将提取的JSON字符串转换为Python字典。
BeautifulSoup(a["leadData"]["textHtml"], "html.parser").text：使用Beautiful Soup解析HTML字符串，并提取文本内容。

3. 处理动态加载的内容

对于通过AJAX请求动态加载的内容，我们需要模拟AJAX请求，获取返回的数据。可以使用requests库发送GET或POST请求，然后解析返回的JSON或HTML数据。

4. 注意事项

网页结构变化： 网站的HTML结构可能会发生变化，导致代码失效。因此，需要定期检查和更新代码。
反爬虫机制： 一些网站会采取反爬虫措施，例如限制访问频率或使用验证码。我们需要遵守网站的robots.txt协议，并采取适当的措施来避免被屏蔽。例如，可以设置User-Agent，添加请求头，或者使用代理IP。
数据清洗： 提取的数据可能包含HTML标签、特殊字符或其他不需要的信息。我们需要对数据进行清洗，以获得干净、可用的数据。

总结

使用Beautiful Soup提取网页文本，需要根据网页的实际结构和数据存储方式，选择合适的方法。对于存储在<script>标签内或动态加载的数据，可以使用正则表达式、JSON解析和AJAX请求等技术来提取目标文本。同时，需要注意网页结构变化、反爬虫机制和数据清洗等问题。通过掌握这些技巧，可以更加高效、准确地从网页中提取所需信息。

Flutter 页面中动态显示的输入框自动化点击与文本输入教程

如何阻止表单提交导致的页面跳转（Route 变更）

Flask Fetch 响应解析错误：正确提取 JSON 数据并安全渲染到页面

如何从网页中安全提取并解析嵌入的 JavaScript JSON 数据

如何从网页脚本中安全提取并解析嵌入的 JSON 数据

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Pandas DataFrame中基于条件提取与赋值字符串的策略与陷阱解析下一篇：理解 NumPy np.insert 的正确使用：避免替换而非插入的陷阱

作者最新文章

荣耀手机返回键功能图标在哪调

2026-03-11 14:06

Capcom《识质存在》体验版和愿望单双双突破200万

2026-03-11 14:11

使用通道接收操作作为 if 条件的实践指南

2026-03-11 14:11

如何正确处理 OkHttp 拦截器中的 Response 关闭问题

2026-03-11 14:13

如何在 Laravel 中准确获取上传文件的 MIME 类型

2026-03-11 14:14

JavaScript 无法阻止 XSS：前端输入校验的误区与正确防御策略

2026-03-11 14:15

如何正确调用 Bing Maps 路由 API 获取驾车距离矩阵

2026-03-11 14:15

今日水印相机如何设置手动确认

2026-03-11 14:15

如何将页脚精准定位至右侧容器底部并实现全设备响应式布局

2026-03-11 14:15

怎么取消vscode搜索结果数量限制

2026-03-11 14:18

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章，帮助大家解决问题。

457

2023.08.07

json是什么

JSON是一种轻量级的数据交换格式，具有简洁、易读、跨平台和语言的特点，JSON数据是通过键值对的方式进行组织，其中键是字符串，值可以是字符串、数值、布尔值、数组、对象或者null，在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容，供大家免费下载体验。

549

2023.08.23

jquery怎么操作json

操作的方法有：1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”；3、“$.each(obj, callback)”；4、“$.ajax()”。更多jquery怎么操作json的详细内容，可以访问本专题下面的文章。

337

2023.10.13

go语言处理json数据方法

本专题整合了go语言中处理json数据方法，阅读专题下面的文章了解更多详细内容。

2025.09.10

ajax教程

php中文网为大家带来ajax教程合集，Ajax是一种用于创建快速动态网页的技术。通过在后台与服务器进行少量数据交换，Ajax可以使网页实现异步更新。这意味着可以在不重新加载整个网页的情况下，对网页的某部分进行更新。php中文网还为大家带来ajax的相关下载资源、相关课程以及相关文章等内容，供大家免费下载使用。

166

2023.06.14