0

0

Python爬虫如何抓取政府公开数据_Python爬虫获取政府网站开放数据的实战教程

蓮花仙者

蓮花仙者

发布时间:2025-11-15 10:43:02

|

602人浏览过

|

来源于php中文网

原创

首先确认目标网站数据合法性并遵守robots协议,接着分析网页结构定位所需信息;使用Python的requests和BeautifulSoup库发送请求并解析HTML,提取标题、日期、链接等字段;通过设置请求头、延时和异常处理避免反爬;最后将多页数据保存为CSV文件,实现合规高效的数据采集。

python爬虫如何抓取政府公开数据_python爬虫获取政府网站开放数据的实战教程

政府网站上有很多公开数据,比如政策文件、项目招标、企业注册信息等,这些数据对研究、分析和商业决策很有价值。用Python爬虫抓取这些数据,既合法又有实际意义,前提是遵守网站的robots协议和使用规范。下面是一个实战教程,带你一步步实现如何用Python获取政府网站的开放数据。

确认目标网站与数据合法性

在动手写代码前,先明确你要抓取的是哪个政府网站,例如“国家企业信用信息公示系统”或“中国政府采购网”。查看网站根目录下的robots.txt文件(如:http://xxx.gov.cn/robots.txt),确认是否允许爬虫访问相关页面。

同时注意:

  • 不抓取需要登录或权限认证的数据
  • 避免高频请求,设置合理延时(如time.sleep(1~3))
  • 尊重版权,仅用于个人学习或合规用途

分析网页结构并定位数据

以“中国政府采购网”为例,假设你想抓取某类采购公告的标题、发布时间和链接。

立即学习Python免费学习笔记(深入)”;

打开目标列表页,右键“检查”元素,找到包含公告信息的HTML结构。通常这类数据在<table>或<code><ul>/<li> </ul>中,每条记录有共同的class或标签。

示例结构可能如下:

<ul class="notice-list">
  <li>
    <a href="/view/123">某设备采购项目</a>
    <span class="date">2024-05-01</span>
  </li>
</ul>

你可以用BeautifulSouplxml解析HTML,提取所需字段。

编写爬虫代码示例

以下是一个简单的Python爬虫脚本,使用requestsBeautifulSoup抓取列表页数据:

听脑AI
听脑AI

听脑AI语音,一款专注于音视频内容的工作学习助手,为用户提供便捷的音视频内容记录、整理与分析功能。

下载
import requests
from bs4 import BeautifulSoup
import time
import csv
<p>url = "<a href="https://www.php.cn/link/3664940859edd8b28137801625a24524">https://www.php.cn/link/3664940859edd8b28137801625a24524</a>"</p><p>headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"
}</p><p>def scrape_page(url):
try:
response = requests.get(url, headers=headers, timeout=10)
response.raise_for_status()
response.encoding = 'utf-8'
soup = BeautifulSoup(response.text, 'html.parser')</p><pre class="brush:php;toolbar:false;">    items = soup.select('.notice-list li')
    data = []
    for item in items:
        link_tag = item.find('a')
        title = link_tag.get_text(strip=True)
        href = link_tag['href']
        full_url = f"http://www.ccgp.gov.cn{href}" if href.startswith('/') else href
        date_tag = item.find('span', class_='date')
        date = date_tag.get_text(strip=True) if date_tag else '未知'

        data.append([title, date, full_url])
    return data
except Exception as e:
    print(f"抓取失败:{e}")
    return []

抓取一页测试

results = scrape_page(url)

保存为CSV

with open('government_data.csv', 'w', encoding='utf-8-sig', newline='') as f: writer = csv.writer(f) writer.writerow(['标题', '发布日期', '链接']) writer.writerows(results)

print("数据已保存到 government_data.csv")

处理分页与反爬策略

政府网站常有分页,可通过观察URL变化模拟翻页,例如:

http://xxx.gov.cn/page/1
http://xxx.gov.cn/page/2

在代码中加入循环即可遍历多页。

如果遇到反爬(如验证码、IP限制):

  • 添加随机延迟:time.sleep(random.uniform(1, 3))
  • 使用代理IP池(需谨慎选择合规服务)
  • 模拟浏览器行为(可考虑Selenium,但效率较低)

基本上就这些。只要目标网站没有动态加载且未设强反爬,用requests + BeautifulSoup就能搞定大部分政府公开数据抓取任务。关键是耐心分析结构,控制请求频率,确保合规操作。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

python中print函数的用法
python中print函数的用法

python中print函数的语法是“print(value1, value2, ..., sep=' ', end=' ', file=sys.stdout, flush=False)”。本专题为大家提供print相关的文章、下载、课程内容,供大家免费下载体验。

193

2023.09.27

python print用法与作用
python print用法与作用

本专题整合了python print的用法、作用、函数功能相关内容,阅读专题下面的文章了解更多详细教程。

19

2026.02.03

class在c语言中的意思
class在c语言中的意思

在C语言中,"class" 是一个关键字,用于定义一个类。想了解更多class的相关内容,可以阅读本专题下面的文章。

911

2024.01.03

python中class的含义
python中class的含义

本专题整合了python中class的相关内容,阅读专题下面的文章了解更多详细内容。

32

2025.12.06

class在c语言中的意思
class在c语言中的意思

在C语言中,"class" 是一个关键字,用于定义一个类。想了解更多class的相关内容,可以阅读本专题下面的文章。

911

2024.01.03

python中class的含义
python中class的含义

本专题整合了python中class的相关内容,阅读专题下面的文章了解更多详细内容。

32

2025.12.06

li是什么元素
li是什么元素

li是HTML标记语言中的一个元素,用于创建列表。li代表列表项,它是ul或ol的子元素,li标签的作用是定义列表中的每个项目。本专题为大家li元素相关的各种文章、以及下载和课程。

438

2023.08.03

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

49

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号