0

0

C# 如何从一个大的xml流中分块读取数据

煙雲

煙雲

发布时间:2025-10-31 12:01:08

|

347人浏览过

|

来源于php中文网

原创

使用XmlReader流式读取大XML文件可避免内存溢出,通过ReadSubtree()逐个处理Order节点,结合XmlSerializer反序列化为对象,实现高效低耗的数据提取与处理。

c# 如何从一个大的xml流中分块读取数据

在处理大型 XML 文件时,直接加载整个文档到内存中会导致性能问题甚至内存溢出。C# 提供了 XmlReader 类,支持以流式方式高效读取大 XML 文件,无需一次性加载全部内容。通过分块读取特定节点,可以有效控制内存使用。

使用 XmlReader 流式读取 XML 数据块

XmlReader 采用只进、只读的方式解析 XML,非常适合处理大文件。你可以按需提取某个父节点下的数据块,逐个处理。

示例:从一个包含多个 Order 节点的大 XML 文件中分块读取

假设 XML 结构如下:


  
    Apple
    10
  
  
    Banana
    5
  
  ...

使用以下代码逐个读取每个 Order 节点:

using (var reader = XmlReader.Create("large.xml"))
{
    while (reader.Read())
    {
        if (reader.IsStartElement("Order"))
        {
            // 读取当前节点的完整子树
            using (var subtree = reader.ReadSubtree())
            {
                var orderDoc = new XmlDocument();
                orderDoc.Load(subtree);
                // 处理单个 Order 节点(例如序列化、转换或保存)
                ProcessOrder(orderDoc.DocumentElement);
            }
        }
    }
}

关键点:

  • ReadSubtree():捕获当前节点及其所有子节点,生成独立的可读子流。
  • 每次只加载一个 Order 节点,内存占用恒定。
  • XmlDocument 仅用于处理当前块,可替换为更轻量的对象映射(如反序列化到类)。

跳过不关心的数据以提升性能

XmlReader 允许快速跳过不需要的节点,避免不必要的解析开销。

GPT-MINUS1
GPT-MINUS1

通过在文本中随机地用同义词替换单词来愚弄GPT

下载

如果只想读取特定条件的节点(如 Id > 100),可在判断后调用 reader.Skip() 跳过整个节点树。

if (reader.IsStartElement("Order"))
{
    string id = reader["Id"];
    if (int.TryParse(id, out int orderId) && orderId <= 100)
    {
        reader.Skip(); // 直接跳过该节点
    }
    else
    {
        using (var subtree = reader.ReadSubtree())
        {
            // 只处理符合条件的节点
        }
    }
}

结合流式反序列化提高效率

如果你的数据结构固定,可定义对应的 C# 类,并使用 XmlSerializer 直接反序列化子树。

public class Order
{
    [XmlAttribute("Id")]
    public int Id { get; set; }
    public string Item { get; set; }
    public int Qty { get; set; }
}

在读取时直接反序列化:

if (reader.IsStartElement("Order"))
{
    var serializer = new XmlSerializer(typeof(Order));
    var order = (Order)serializer.Deserialize(reader);
    ProcessOrder(order); // 处理对象
}

这种方式更简洁,且避免创建 XmlDocument 对象,进一步降低开销。

基本上就这些。使用 XmlReader 配合 ReadSubtree 或反序列化,能高效地从大 XML 流中分块提取数据,保持低内存占用和良好性能。

相关专题

更多
pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1890

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

2087

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

1023

2024.11.28

treenode的用法
treenode的用法

​在计算机编程领域,TreeNode是一种常见的数据结构,通常用于构建树形结构。在不同的编程语言中,TreeNode可能有不同的实现方式和用法,通常用于表示树的节点信息。更多关于treenode相关问题详情请看本专题下面的文章。php中文网欢迎大家前来学习。

535

2023.12.01

C++ 高效算法与数据结构
C++ 高效算法与数据结构

本专题讲解 C++ 中常用算法与数据结构的实现与优化,涵盖排序算法(快速排序、归并排序)、查找算法、图算法、动态规划、贪心算法等,并结合实际案例分析如何选择最优算法来提高程序效率。通过深入理解数据结构(链表、树、堆、哈希表等),帮助开发者提升 在复杂应用中的算法设计与性能优化能力。

17

2025.12.22

深入理解算法:高效算法与数据结构专题
深入理解算法:高效算法与数据结构专题

本专题专注于算法与数据结构的核心概念,适合想深入理解并提升编程能力的开发者。专题内容包括常见数据结构的实现与应用,如数组、链表、栈、队列、哈希表、树、图等;以及高效的排序算法、搜索算法、动态规划等经典算法。通过详细的讲解与复杂度分析,帮助开发者不仅能熟练运用这些基础知识,还能在实际编程中优化性能,提高代码的执行效率。本专题适合准备面试的开发者,也适合希望提高算法思维的编程爱好者。

21

2026.01.06

Java JVM 原理与性能调优实战
Java JVM 原理与性能调优实战

本专题系统讲解 Java 虚拟机(JVM)的核心工作原理与性能调优方法,包括 JVM 内存结构、对象创建与回收流程、垃圾回收器(Serial、CMS、G1、ZGC)对比分析、常见内存泄漏与性能瓶颈排查,以及 JVM 参数调优与监控工具(jstat、jmap、jvisualvm)的实战使用。通过真实案例,帮助学习者掌握 Java 应用在生产环境中的性能分析与优化能力。

19

2026.01.20

PS使用蒙版相关教程
PS使用蒙版相关教程

本专题整合了ps使用蒙版相关教程,阅读专题下面的文章了解更多详细内容。

61

2026.01.19

java用途介绍
java用途介绍

本专题整合了java用途功能相关介绍,阅读专题下面的文章了解更多详细内容。

87

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
C# 教程
C# 教程

共94课时 | 7.2万人学习

C 教程
C 教程

共75课时 | 4.1万人学习

C++教程
C++教程

共115课时 | 13.1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号