博客爬取系统

php中文网

发布时间：2016-08-08 09:30:25

1267人浏览过

来源于php中文网

原创

引言

　　周末没事干，无聊，使用php做了个博客抓取系统，我经常访问的是cnblogs，当然从博客园（看看我还是很喜欢博客园的）开始入手了，我的抓取比较简易，获取网页内容，然后通过正则匹配，获取到想要的东西，然后保存数据库，当然了，在实际过程中会遇到一些问题。做这个之前已经想好了，要做成可扩充的，以后要是哪天想添加csdn、51cto、新浪博客这些内容了可以很容易的扩展。

那些东西可以抓取？

　　首先要说些，这个是个简易的抓取，不是所有网页中看到的东西都可以抓取，有些东西是抓取不到的，就像下面这些

　　其中圈红的阅读次数、评论次数、推荐次数、反对次数、评论……，这些是通过js调用ajax动态获取的，所以是获取不到的，其实就一句话，你打开一个网页，然后右键点击查看源代码，在源代码中直接看不到的，这种简易抓取可能就有问题，要抓取那些ajax填充的内容，要想想其他办法，之前看见过一篇文章，有人先通过浏览器加载完网页，然后对整个dom就行筛选（那篇文章也说了，这样效率很低），当然了，拼接这些js请求也是可以的，估计会比较麻烦。

爬取的思路

　　首先说下爬取深度depth

比如从链接a开始爬，如果depth是1，获取玩当前链接的内容就完事，如果depth是2的话，就从a链接的内容中再去按指定的规则匹配链接，对匹配到的链接也做depth为1的处理，以此类推，depth是获取链接的深度、层级。这样爬虫才可以”爬动起来“。

　　当然了，用一个链接去爬特定的内容，这个爬到的东西是很有限的，或者有可能还没爬起来就死掉了（往后的层级没有匹配到内容），所以在爬取的时候可以设置多个起始链接。当然了，在爬取的时候很可能会遇到很多重复的链接，所以还得给抓取到的链接做记号，防止重复获取相同的内容，造成冗余。有几个变量来缓存这些信息，格式如下

第一，就是一个hash数组，键值是url的md5值，状态是0，维护一个不重复的url数组，形如下面的形式

<span>Array</span><span>
(
    [bc790cda87745fa78a2ebeffd8b48145] </span>=> 0<span>
    [9868e03f81179419d5b74b5ee709cdc2] </span>=> 0<span>
    [4a9506d20915a511a561be80986544be] </span>=> 0<span>
    [818bcdd76aaa0d41ca88491812559585] </span>=> 0<span>
    [9433c3f38fca129e46372282f1569757] </span>=> 0<span>
    [f005698a0706284d4308f7b9cf2a9d35] </span>=> 0<span>
    [e463afcf13948f0a36bf68b30d2e9091] </span>=> 0<span>
    [23ce4775bd2ce9c75379890e84fadd8e] </span>=> 0
    ......<span>
)</span>

第二个就是要获取的url数组，这个地方还可以优化，我是将所有的链接链接全部获取到数组中，再去循环数组获取内容，就等于是说，所有最大深度减1的内容都获取了两次，这里可以直接在获取下一级内容的时候顺便把内容获取了，然后上面的数组中状态修改为1（已经获取），这样可以提高效率。先看看保存链接的数组内容：
Array
(
 [0] => Array
 (
 [0] => http://zzk.cnblogs.com/s?t=b&w=php&p=1
 )
 [1] => Array
 (
 [0] => http://www.cnblogs.com/baochuan/archive/2012/03/12/2391135.html
 [1] => http://www.cnblogs.com/ohmygirl/p/internal-variable-1.html
 [2] => http://www.cnblogs.com/zuoxiaolong/p/java1.html
 ......
 )

 [2] => Array
 (
 [0] => http://www.cnblogs.com/ohmygirl/category/623392.html
 [1] => http://www.cnblogs.com/ohmygirl/category/619019.html
 [2] => http://www.cnblogs.com/ohmygirl/category/619020.html
 ......
 )

)
最后将所有的链接拼为一个数组返回，让程序循环获取连接中的内容。就像上面的获取层级是2，0级的链内容接获取过了，仅仅用来获取1级中的链接，1级中的所有链接内容也获取过了，仅仅用来保存2级中的链接，等到真正获取内容的时候又会对上面的内容进行一次获取，而且上面的hash数组中的状态都没有用到。。。（有待优化）。

　　还有一个获取文章的正则，通过分析博客园中的文章内容，发现文章标题、正文部分基本都可以很规则的获取到

标题，标题html代码的形式都是下图的那种格式，可以很轻松的用下面的正则匹配到
#<a\s*?id=\"cb_post_title_url\"[^>]*?>(.*?)<\/a>#is

正文，正文部分是可以通过正则表达式的高级特性平衡组很容易获取到的，但弄了半天发现php好像对平衡组支持的不是很好，所以放弃额平衡组，在html源码中发现通过下面的正则也可以很容易匹配到文章正文的内容，每篇文章基本都有下图中的内容
#(<div\s*?id=\"cnblogs_post_body\"[^>]*?>.*)<div\s*id=\"blog_post_info_block\">#is

开始：

结束：

　　博客的发布时间也是可以获取到的，但有些文章在获取发布时间的时候可能会找不到，这个就不列在这里了，有了这些东西就可以爬取内容了。

无限画

千库网旗下AI绘画创作平台

下载

开始爬取

　　开始爬取内容了，最初我设置的爬取深度是2级，初始页面是博客园首页，发现爬取不了多少内容，后来发现博客园首页有个页码导航

　　就试图拼接成页码格式http://www.cnblogs.com/#p2，循环200次，以每页为起始页面，深度为2去抓取。但我高兴的太早了，开了几个进程跑了好久程序，抓了几十万条，后来发现完全在重复，都是从第一页中抓取的，因为博客园首页点击导航的时候（除了第一页），都是ajax请求获取到的。。。。看来博客园还是考虑到这个问题，因为大多数人都是只打开首页，不会去点击后面的内容（我可能偶尔会去点击下一页），所以为了在防止初级抓取者去抓取和性能发面做权衡，将第一页设置为静态网页的方式，缓存有效期是几分钟（或者是根据跟新频率，当更新多少篇的时候去更新缓存，或者两者的结合），这也是为什么有时候发布的文章，过一会儿才会显示出来的原因（我猜的^_^）。

　　难道不能一次性抓取很多内容吗？后来我发现这个地方使用的全部是静态网页

从找找看这个地方获取到的内容都是静态的，包括最下面的导航链接中的所有页面都是静态的，而且，这个搜索右边还有筛选条件，可以更好的提高抓取的质量。好了有了这个入口，就可以获取到好多高质量的文章了，下面是循环抓取100页的代码

<span>for</span>(<span>$i</span>=1;<span>$i</span><=100;<span>$i</span>++<span>){
            </span><span>echo</span> "PAGE{<span>$i</span>}*************************[begin]***************************\r"<span>;
            </span><span>$spidercnblogs</span> = <span>new</span> C\Spidercnblogs("http://zzk.cnblogs.com/s?t=b&w=php&p={$i}"<span>);
            </span><span>$urls</span> = <span>$spidercnblogs</span>-><span>spiderUrls();
            </span><span>die</span><span>();
            </span><span>foreach</span> (<span>$urls</span> <span>as</span> <span>$key</span> => <span>$value</span><span>) {
                </span><span>$cnblogs</span>->grap(<span>$value</span><span>);
                </span><span>$cnblogs</span>-><span>save();
            }
        }</span>

　　至此，就可以去抓去自己喜欢的东西了，抓取速度不是很快，我在一台普通pc上面开了10个进程，抓了好几个小时，才获取到了40多万条数据，好了看看抓取到的内容稍微优化之后的显示效果，这里面加上了博客园的基础css代码，可以看出效果和

抓取到的内容稍作修改：

原始内容

　再看下文件目录结构，也是用上篇的自制目录生成工具生成的：

+myBlogs-master
    +controller
        |_Blog.php
        |_Blogcnblogs.php
        |_Spider.php
        |_Spidercnblogs.php
    +core
        |_Autoload.php
    +interface
        |_Blog.php
    +lib
        |_Mysql.php
    +model
        |_Blog.php
    |_App.php

　效果还是很不错的，这里再猜下推酷这种专门爬取的网站的工作方式，一个常驻进程，隔一段时间去获取一次内容（比如说首页），如果有新鲜的内容入库，没有的话放弃这次获取的内容，等待下次获取，当时间很小的时候就可以一篇不漏的抓取的”新鲜“的内容。

这是github地址：

github——myBlogs

　　本文版权归作者iforever(luluyrt@163.com)所有，未经作者本人同意禁止任何形式的转载，转载文章之后必须在文章页面明显位置给出作者和原文连接，否则保留追究法律责任的权利。

以上就介绍了博客爬取系统，包括了方面的内容，希望对PHP教程有兴趣的朋友有所帮助。

php中nbsp是什么意思

如何从PHP中调用Python文件？

我们如何使用使用mysql_fetch_assoc()函数的PHP脚本来显示MySQL表中的所有记录？

ini_set()在PHP中的作用是什么？

在PHP中的readlink()函数

相关专题

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

178

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

102

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

227

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

532

2026.03.04