0

0

高效抓取 JavaScript 网站

心靈之曲

心靈之曲

发布时间:2024-11-11 13:48:02

|

559人浏览过

|

来源于dev.to

转载

高效抓取 javascript 网站

使用 javascript 进行网络爬行的可能性

静态网站:axios 和 cheerio
让我们逐步了解如何使用 javascript 抓取静态电子商务网站。在此示例中,我们将使用两个流行的库:用于 http 请求的 axios 和用于解析 html 的 cheerio。

*1。安装依赖项 *
使用 npm 安装 axios 和 cheerio:

npm 安装 axios cheerio

*2。创建脚本 *
创建一个 javascript 文件,例如b. scrapeecommerce.js 并在代码编辑器中打开它。

*3。导入模块*
将 axios 和 cheerio 导入到您的脚本中:

const axios = require('axios');

const cheerio = require('cheerio');

*4。定义目标 url *
选择您要访问的电子商务网站。在此示例中,我们使用假设的 url http://example-ecommerce.com。将其替换为所需的 url:

const url = 'http://example-ecommerce.com';

*5。获取 html 内容 *
使用axios向目标url发送get请求,获取html内容:

axios.get(url)

.then(响应=> {

const html = response.data;

// 现在可以解析 html 内容

})

.catch(错误=> {

console.error('获取页面时出错:', error);

});

*6。解析 html 并提取数据 *
使用 cheerio 解析 html 代码并提取您想要的信息,例如产品名称和价格:

axios.get(url)

.then(响应=> {

const html = response.data;

const $ = cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  

})

.catch(错误=> {

console.error('获取页面时出错:', error);

});

*要点*

  • axios.get(url):发送 get 请求并返回承诺。
  • .then(response => { … }):如果请求成功,则html内容在response.data中。
  • cheerio.load(html):将 html 内容加载到 cheerio 中,以进行类似 jquery 的 dom 操作。
  • $('.product').each((index, element) => { … }):迭代所有 .product 元素。
  • $(element).find('.product-name').text().trim():提取产品名称。
  • $(element).find('.product-price').text().trim():提取产品的价格。
  • products.push({ name,price }):将产品信息添加到产品数组中。
  • console.log(products):输出提取的信息。

*完整示例脚本:*
const axios = require('axios');

const cheerio = require('cheerio');

const url = 'http://example-ecommerce.com';

axios.get(url)

.then(响应=> {

const html = response.data;

const $ = cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  

})

.catch(错误=> {

console.error('获取页面时出错:', error);

});

*着陆页自定义:*

  • 选择器:.product、.product-name 和 .product-price 选择器必须适应目标页面的实际 html 结构。
  • 其他数据:有关其他信息(例如产品图片、链接、描述),请检查相应的 html 结构。

使用 javascript 抓取网站的网页抓取工具

如果您最近需要 python、ruby 或其他编程语言进行网页抓取,octoparse 是一个出色的工具,特别是对于支持 javascript 的网站。

歌者PPT
歌者PPT

歌者PPT,AI 写 PPT 永久免费

下载

立即学习Java免费学习笔记(深入)”;

举个具体的例子:如果你有一个目标网站,想要开始抓取,你首先应该检查该网站是否被阻止js抓取。不同的网站使用不同的保护方法,您可能需要一些时间和令人沮丧的尝试才能意识到问题,特别是如果抓取没有产生预期的结果。然而,使用网络抓取工具,数据提取过程会顺利进行。

许多网络抓取工具可以让您免去编写爬虫的麻烦。 octoparse 在抓取大量 javascript 页面方面特别高效,可以从 99% 的网页中提取数据,包括使用 ajax 的网页。它还提供验证码解决服务。 octoparse 可免费使用,并提供自动发现功能和 100 多个易于使用的模板,可实现高效的数据提取。新用户还可以享受 14 天的试用期。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
jquery插件有哪些
jquery插件有哪些

jquery插件有jQuery UI、jQuery Validate、jQuery DataTables、jQuery Slick、jQuery LazyLoad、jQuery Countdown、jQuery Lightbox、jQuery FullCalendar、jQuery Chosen和jQuery EasyUI等。本专题为大家提供jquery插件相关的文章、下载、课程内容,供大家免费下载体验。

156

2023.09.12

jquery怎么操作json
jquery怎么操作json

操作的方法有:1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”;3、“$.each(obj, callback)”;4、“$.ajax()”。更多jquery怎么操作json的详细内容,可以访问本专题下面的文章。

337

2023.10.13

jquery删除元素的方法
jquery删除元素的方法

jquery可以通过.remove() 方法、 .detach() 方法、.empty() 方法、.unwrap() 方法、.replaceWith() 方法、.html('') 方法和.hide() 方法来删除元素。更多关于jquery相关的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

406

2023.11.10

jQuery hover()方法的使用
jQuery hover()方法的使用

hover()是jQuery中一个常用的方法,它用于绑定两个事件处理函数,这两个函数将在鼠标指针进入和离开匹配的元素时执行。想了解更多hover()的相关内容,可以阅读本专题下面的文章。

515

2023.12.04

jquery实现分页方法
jquery实现分页方法

在jQuery中实现分页可以使用插件或者自定义实现。想了解更多jquery分页的相关内容,可以阅读本专题下面的文章。

312

2023.12.06

jquery中隐藏元素是什么
jquery中隐藏元素是什么

jquery中隐藏元素是非常重要的一个概念,在使用jquery隐藏元素之前,需要先了解css样式中关于元素隐藏的属性,比如display、visibility、opacity等属性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

128

2024.02.23

jquery中什么是高亮显示
jquery中什么是高亮显示

jquery中高亮显示是指对页面搜索关键词时进行高亮显示,其实现办法:1、先获取要高亮显示的行,获取搜索的内容,再遍历整行内容,最后添加高亮颜色;2、使用“jquery highlight”高亮插件。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

183

2024.02.23

jQuery 正则表达式相关教程
jQuery 正则表达式相关教程

本专题整合了jQuery正则表达式相关教程大全,阅读专题下面的文章了解更多详细内容。

51

2026.01.13

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

26

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号