0

0

Python网页爬虫入门教程_BeautifulSoup与requests解析

冷漠man

冷漠man

发布时间:2025-12-30 21:17:19

|

268人浏览过

|

来源于php中文网

原创

requests与beautifulsoup是python爬虫最基础实用的组合,用于获取并解析静态网页;需安装beautifulsoup4和lxml,用r.content避免编码问题,再用soup.find/find_all提取内容。

python网页爬虫入门教程_beautifulsoup与requests解析

requests 获取网页内容,再用 BeautifulSoup 解析 HTML,是 Python 爬虫最基础也最实用的组合。它轻量、易学、够用,适合绝大多数静态页面抓取任务。

安装依赖很简单

打开终端或命令行,依次运行:

  • pip install requests
  • pip install beautifulsoup4

注意:不要装 bs4(这是旧名),要装 beautifulsoup4;如果提示缺少解析器,可额外安装 lxml(速度快)或 html.parser(Python 内置,无需安装)。

requests 获取网页源码

requests 负责“下载”,就像你在浏览器里按 F12 看到的原始 HTML。关键点有三个:

立即学习Python免费学习笔记(深入)”;

Favird No-Code Tools
Favird No-Code Tools

无代码工具的聚合器

下载
  • requests.get(url) 发起请求,返回一个 Response 对象
  • 检查 r.status_code 是否为 200,确认请求成功
  • r.text 拿到字符串形式的 HTML,或 r.content(推荐用于含中文的页面,避免编码乱码)

示例:

r = requests.get('https://httpbin.org/html')
if r.status_code == 200:
    html = r.content  # 更稳妥地处理编码

BeautifulSoup 解析 HTML 结构

BS4 把 HTML 字符串变成可遍历、可搜索的对象树。核心操作包括:

  • 创建解析对象:soup = BeautifulSoup(html, 'lxml')'html.parser'
  • 找单个标签:soup.find('h1')soup.h1
  • 找所有匹配项:soup.find_all('a'),支持按 class、id、属性过滤,如 soup.find_all('div', class_='post-title')
  • 提取文本:tag.get_text()tag.text(推荐前者,更健壮)
  • 提取属性:tag['href'],但需先用 if tag.has_attr('href'): 判断,避免 KeyError

实战小例子:抓取标题和链接

以一个简单博客列表页为例:

import requests
from bs4 import BeautifulSoup
<p>url = '<a href="https://www.php.cn/link/5fa81016250471111dfca121ae9cdc14">https://www.php.cn/link/5fa81016250471111dfca121ae9cdc14</a>'
r = requests.get(url)
soup = BeautifulSoup(r.content, 'lxml')</p><p>for article in soup.find_all('article'):
title = article.find('h2')
link = article.find('a')
if title and link and link.has_attr('href'):
print(title.get_text().strip(), '→', link['href'])

这段代码会逐个定位每篇文章区块,安全提取标题与链接,跳过缺失字段的情况。

不复杂但容易忽略细节:加 headers 模拟浏览器、控制请求频率、处理编码、检查元素是否存在——这些才是让爬虫稳定跑起来的关键。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

pip安装使用方法
pip安装使用方法

安装步骤:1、确保Python已经正确安装在您的计算机上;2、下载“get-pip.py”脚本;3、按下Win + R键,然后输入cmd并按下Enter键来打开命令行窗口;4、在命令行窗口中,使用cd命令切换到“get-pip.py”所在的目录;5、执行安装命令;6、验证安装结果即可。大家可以访问本专题下的文章,了解pip安装使用方法的更多内容。

373

2023.10.09

更新pip版本
更新pip版本

更新pip版本方法有使用pip自身更新、使用操作系统自带的包管理工具、使用python包管理工具、手动安装最新版本。想了解更多相关的内容,请阅读专题下面的文章。

430

2024.12.20

pip设置清华源
pip设置清华源

设置方法:1、打开终端或命令提示符窗口;2、运行“touch ~/.pip/pip.conf”命令创建一个名为pip的配置文件;3、打开pip.conf文件,然后添加“[global];index-url = https://pypi.tuna.tsinghua.edu.cn/simple”内容,这将把pip的镜像源设置为清华大学的镜像源;4、保存并关闭文件即可。

793

2024.12.23

python升级pip
python升级pip

本专题整合了python升级pip相关教程,阅读下面的文章了解更多详细内容。

369

2025.07.23

if什么意思
if什么意思

if的意思是“如果”的条件。它是一个用于引导条件语句的关键词,用于根据特定条件的真假情况来执行不同的代码块。本专题提供if什么意思的相关文章,供大家免费阅读。

839

2023.08.22

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

678

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

219

2023.09.04

Golang 测试体系与代码质量保障:工程级可靠性建设
Golang 测试体系与代码质量保障:工程级可靠性建设

Go语言测试体系与代码质量保障聚焦于构建工程级可靠性系统。本专题深入解析Go的测试工具链(如go test)、单元测试、集成测试及端到端测试实践,结合代码覆盖率分析、静态代码扫描(如go vet)和动态分析工具,建立全链路质量监控机制。通过自动化测试框架、持续集成(CI)流水线配置及代码审查规范,实现测试用例管理、缺陷追踪与质量门禁控制,确保代码健壮性与可维护性,为高可靠性工程系统提供质量保障。

48

2026.02.28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 4.7万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号