Python爬虫如何抓取政府公开数据_Python爬虫获取政府网站开放数据的实战教程

蓮花仙者

发布时间：2025-11-15 10:43:02

602人浏览过

来源于php中文网

原创

首先确认目标网站数据合法性并遵守robots协议，接着分析网页结构定位所需信息；使用Python的requests和BeautifulSoup库发送请求并解析HTML，提取标题、日期、链接等字段；通过设置请求头、延时和异常处理避免反爬；最后将多页数据保存为CSV文件，实现合规高效的数据采集。

python爬虫如何抓取政府公开数据_python爬虫获取政府网站开放数据的实战教程

政府网站上有很多公开数据，比如政策文件、项目招标、企业注册信息等，这些数据对研究、分析和商业决策很有价值。用Python爬虫抓取这些数据，既合法又有实际意义，前提是遵守网站的robots协议和使用规范。下面是一个实战教程，带你一步步实现如何用Python获取政府网站的开放数据。

确认目标网站与数据合法性

在动手写代码前，先明确你要抓取的是哪个政府网站，例如“国家企业信用信息公示系统”或“中国政府采购网”。查看网站根目录下的robots.txt文件（如：http://xxx.gov.cn/robots.txt），确认是否允许爬虫访问相关页面。

同时注意：

不抓取需要登录或权限认证的数据
避免高频请求，设置合理延时（如time.sleep(1~3)）
尊重版权，仅用于个人学习或合规用途

分析网页结构并定位数据

以“中国政府采购网”为例，假设你想抓取某类采购公告的标题、发布时间和链接。

立即学习“Python免费学习笔记（深入）”；

打开目标列表页，右键“检查”元素，找到包含公告信息的HTML结构。通常这类数据在<table>或<code><ul>/<li> </ul>中，每条记录有共同的class或标签。

示例结构可能如下：

<ul class="notice-list">
  <li>
    <a href="/view/123">某设备采购项目</a>
    <span class="date">2024-05-01</span>
  </li>
</ul>

你可以用BeautifulSoup或lxml解析HTML，提取所需字段。

编写爬虫代码示例

以下是一个简单的Python爬虫脚本，使用requests和BeautifulSoup抓取列表页数据：

听脑AI

听脑AI语音，一款专注于音视频内容的工作学习助手，为用户提供便捷的音视频内容记录、整理与分析功能。

下载

import requests
from bs4 import BeautifulSoup
import time
import csv
<p>url = "<a href="https://www.php.cn/link/3664940859edd8b28137801625a24524">https://www.php.cn/link/3664940859edd8b28137801625a24524</a>"</p><p>headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"
}</p><p>def scrape_page(url):
try:
response = requests.get(url, headers=headers, timeout=10)
response.raise_for_status()
response.encoding = 'utf-8'
soup = BeautifulSoup(response.text, 'html.parser')</p><pre class="brush:php;toolbar:false;">    items = soup.select('.notice-list li')
    data = []
    for item in items:
        link_tag = item.find('a')
        title = link_tag.get_text(strip=True)
        href = link_tag['href']
        full_url = f"http://www.ccgp.gov.cn{href}" if href.startswith('/') else href
        date_tag = item.find('span', class_='date')
        date = date_tag.get_text(strip=True) if date_tag else '未知'

        data.append([title, date, full_url])
    return data
except Exception as e:
    print(f"抓取失败：{e}")
    return []

抓取一页测试

results = scrape_page(url)

保存为CSV

with open('government_data.csv', 'w', encoding='utf-8-sig', newline='') as f: writer = csv.writer(f) writer.writerow(['标题', '发布日期', '链接']) writer.writerows(results)

print("数据已保存到 government_data.csv")

处理分页与反爬策略

政府网站常有分页，可通过观察URL变化模拟翻页，例如：

http://xxx.gov.cn/page/1
http://xxx.gov.cn/page/2

在代码中加入循环即可遍历多页。

如果遇到反爬（如验证码、IP限制）：

添加随机延迟：time.sleep(random.uniform(1, 3))
使用代理IP池（需谨慎选择合规服务）
模拟浏览器行为（可考虑Selenium，但效率较低）

基本上就这些。只要目标网站没有动态加载且未设强反爬，用requests + BeautifulSoup就能搞定大部分政府公开数据抓取任务。关键是耐心分析结构，控制请求频率，确保合规操作。

Django怎么安装_pip安装Django与创建第一个Project

Python并查集怎么写_Disjoint Set路径压缩与连通性判断

Python怎么跨平台迁移_Windows到Linux项目环境同步技巧

Python无根权限怎么装库_使用--user参数安装到用户目录

如何健壮处理用户输入中的空白字符与非法内容

相关标签:

python html go windows 浏览器 csv ai win beautifulsoup print 循环 class ul table li http

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：NumPy教程：高效矢量化处理2D数组，根据分隔符清零指定区域下一篇：Python Turtle模块：绘制垂直居中椭圆教程

作者最新文章

破解内存涨价困局AMD 锐龙7800 X3D+D5单通道24GB内存

2026-03-13 14:58

QQ邮箱怎么修改密码_QQ邮箱密码修改方法【安全教程】

2026-03-13 15:07

蚂蚁新村今日答案最新3.13 蚂蚁新村3月13日答题正确答案

2026-03-13 15:23

芯联生态智合共赢｜2026 AMD EPYC 行业生态峰会・上海站教育专场圆满举办

2026-03-13 15:37

QClaw怎么查快递物流状态_QClaw联网搜索插件与技能调用【解答】

2026-03-13 15:37

卡利亚颠倒像完全获取攻略解锁艾尔登法环最神奇空间奥秘

2026-03-13 15:58

QClaw安装包从哪里下载_QClaw官网下载渠道与系统版本选择【指南】

2026-03-13 16:09

PHP数组怎么避免下标越界isset预检查操作指南【技巧】

2026-03-13 16:13

潇湘书院怎么开启阅读提醒_潇湘书院更新章节推送设置

2026-03-13 16:17

《失落星船：马拉松》发布！华硕RTX50系显卡全力护航

2026-03-13 16:22

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据，或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

python中print函数的用法

python中print函数的语法是“print(value1, value2, ..., sep=' ', end=' ', file=sys.stdout, flush=False)”。本专题为大家提供print相关的文章、下载、课程内容，供大家免费下载体验。

193

2023.09.27

python print用法与作用

本专题整合了python print的用法、作用、函数功能相关内容，阅读专题下面的文章了解更多详细教程。

2026.02.03

class在c语言中的意思

在C语言中，"class" 是一个关键字，用于定义一个类。想了解更多class的相关内容，可以阅读本专题下面的文章。

911

2024.01.03

python中class的含义

本专题整合了python中class的相关内容，阅读专题下面的文章了解更多详细内容。

2025.12.06

class在c语言中的意思

在C语言中，"class" 是一个关键字，用于定义一个类。想了解更多class的相关内容，可以阅读本专题下面的文章。

911

2024.01.03

python中class的含义

本专题整合了python中class的相关内容，阅读专题下面的文章了解更多详细内容。

2025.12.06

li是什么元素

li是HTML标记语言中的一个元素，用于创建列表。li代表列表项，它是ul或ol的子元素，li标签的作用是定义列表中的每个项目。本专题为大家li元素相关的各种文章、以及下载和课程。

438

2023.08.03

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

热门下载

网站特效

网站源码

网站素材

前端模板