0

0

使用Jsoup嵌套div ID列出特定范围的元素

心靈之曲

心靈之曲

发布时间:2025-08-03 18:26:15

|

980人浏览过

|

来源于php中文网

原创

使用jsoup嵌套div id列出特定范围的元素

本文档旨在指导开发者如何使用Jsoup库从HTML页面中提取特定菜单组下的食谱数据。我们将详细介绍如何通过查找包含目标菜单标题的卡片,并利用其data-target属性来定位和提取相应的row recipe_container div元素。通过本文的学习,你将能够有效地从复杂的HTML结构中提取所需的信息。

使用Jsoup提取特定菜单组的食谱数据

在Web数据抓取中,经常会遇到需要从复杂的HTML结构中提取特定信息的情况。本教程将以提取特定菜单组的食谱数据为例,介绍如何使用Jsoup库实现这一目标。

目标: 从包含多个菜单组的HTML页面中,提取指定菜单组(例如 "Freshen's")下的所有食谱数据。

HTML结构:

假设HTML结构如下:

每个菜单组都包含在一个card元素中,其标题位于card-header中,而食谱数据则位于card-body下的row recipe_container div元素中。

Jsoup代码示例:

知识画家
知识画家

AI交互知识生成引擎,一句话生成知识视频、动画和应用

下载

以下Java代码演示了如何使用Jsoup提取特定菜单组的食谱数据:

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.IOException;

public class JsoupExample {

    public static void main(String[] args) throws IOException {
        String pageUrl = "your_page_url_here"; // 替换为你的页面URL
        String inputMenuHeading = "Freshen's";

        // 1. 连接到页面并获取Document对象
        Document doc = Jsoup.connect(pageUrl).get();

        // 2. 查找包含目标菜单标题的card-header元素,并获取其data-target属性值
        String targetId = doc.select("[class=card-header][id*=menu_group_heading]")
                .stream()
                .filter(e -> e.html().contains(inputMenuHeading))
                .findFirst()
                .map(e -> e.select("a").attr("data-target"))
                .orElse(null);

        if (targetId != null) {
            // 3. 使用data-target属性值作为ID选择器,找到对应的card-body元素,并提取其中的row recipe_container元素
            Elements recipeContainers = doc.select(String.format("%s .row.recipe_container", targetId));

            // 4. 打印或处理提取到的食谱数据
            System.out.println("Recipe data for " + inputMenuHeading + ":");
            for (Element recipeContainer : recipeContainers) {
                System.out.println(recipeContainer.html()); // 打印每个recipe_container的内容
                // 或者进行其他处理,例如提取特定字段
            }
        } else {
            System.out.println("Menu heading '" + inputMenuHeading + "' not found.");
        }
    }
}

代码解释:

  1. 连接到页面并获取Document对象: 使用Jsoup.connect(pageUrl).get()连接到目标页面,并将HTML内容解析为Document对象。
  2. 查找包含目标菜单标题的card-header元素: 使用doc.select("[class=card-header][id*=menu_group_heading]")选择所有class为card-header并且id包含menu_group_heading的元素。 然后使用stream().filter(e -> e.html().contains(inputMenuHeading))过滤出包含目标菜单标题的元素。 findFirst().map(e -> e.select("a").attr("data-target"))获取第一个匹配元素的 a 标签的 data-target 属性值。 orElse(null) 如果没有找到匹配的元素,则返回 null。
  3. 提取食谱数据: 使用doc.select(String.format("%s .row.recipe_container", targetId))选择id为targetId的元素下的所有class同时包含row和recipe_container的元素。
  4. 打印或处理提取到的食谱数据: 遍历提取到的recipeContainers,并打印或进行其他处理。

注意事项:

  • 替换your_page_url_here为实际的页面URL。
  • 确保Jsoup库已添加到你的项目中。
  • 如果目标页面结构发生变化,可能需要调整选择器。
  • 在实际应用中,应该添加适当的异常处理机制,以处理网络连接错误或页面解析错误。
  • orElse(null) 确保在没有找到匹配的菜单标题时,程序不会抛出NoSuchElementException异常。

总结:

通过本教程,你学习了如何使用Jsoup库从复杂的HTML结构中提取特定菜单组的食谱数据。 这种方法可以应用于各种Web数据抓取场景,只需要根据实际的HTML结构调整选择器即可。 记住,理解HTML结构是成功提取数据的关键。 此外,在实际应用中,需要考虑异常处理、页面结构变化等因素,以确保程序的健壮性和可靠性。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

463

2023.08.02

c语言中null和NULL的区别
c语言中null和NULL的区别

c语言中null和NULL的区别是:null是C语言中的一个宏定义,通常用来表示一个空指针,可以用于初始化指针变量,或者在条件语句中判断指针是否为空;NULL是C语言中的一个预定义常量,通常用来表示一个空值,用于表示一个空的指针、空的指针数组或者空的结构体指针。

237

2023.09.22

java中null的用法
java中null的用法

在Java中,null表示一个引用类型的变量不指向任何对象。可以将null赋值给任何引用类型的变量,包括类、接口、数组、字符串等。想了解更多null的相关内容,可以阅读本专题下面的文章。

458

2024.03.01

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

804

2023.07.31

python中的format是什么意思
python中的format是什么意思

python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

435

2024.06.27

class在c语言中的意思
class在c语言中的意思

在C语言中,"class" 是一个关键字,用于定义一个类。想了解更多class的相关内容,可以阅读本专题下面的文章。

469

2024.01.03

python中class的含义
python中class的含义

本专题整合了python中class的相关内容,阅读专题下面的文章了解更多详细内容。

15

2025.12.06

golang map内存释放
golang map内存释放

本专题整合了golang map内存相关教程,阅读专题下面的文章了解更多相关内容。

75

2025.09.05

C++ 设计模式与软件架构
C++ 设计模式与软件架构

本专题深入讲解 C++ 中的常见设计模式与架构优化,包括单例模式、工厂模式、观察者模式、策略模式、命令模式等,结合实际案例展示如何在 C++ 项目中应用这些模式提升代码可维护性与扩展性。通过案例分析,帮助开发者掌握 如何运用设计模式构建高质量的软件架构,提升系统的灵活性与可扩展性。

8

2026.01.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
10分钟--Midjourney创作自己的漫画
10分钟--Midjourney创作自己的漫画

共1课时 | 0.1万人学习

Midjourney 关键词系列整合
Midjourney 关键词系列整合

共13课时 | 0.9万人学习

AI绘画教程
AI绘画教程

共2课时 | 0.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号