0

0

使用 PyPDF2 提取 PDF 文本内容教程

DDD

DDD

发布时间:2025-10-04 11:15:01

|

913人浏览过

|

来源于php中文网

原创

使用 PyPDF2 提取 PDF 文本内容教程

本文旨在解决使用 PyPDF2 读取 PDF 文件时,获取到的是 PdfReader 对象而非实际文本内容的问题。我们将详细介绍如何通过迭代 PDF 页面并调用 extract_text() 方法,从 PDF 文件中正确提取并显示其文本内容,从而实现对 PDF 文档的可读性操作。

理解 PyPDF2 的工作方式

在使用 python 的 pypdf2 库处理 pdf 文件时,初学者常遇到的一个困惑是,当尝试打开并“读取”pdf 文件时,得到的结果是一个 pypdf2.pdfreader 对象,而非文件中的实际文本内容。例如,以下代码:

import PyPDF2

with open('dummy.pdf', 'rb') as file:
    reader = PyPDF2.PdfReader(file)
    print(reader)

其输出通常是 <PyPDF2._reader.PdfReader object at 0x...>,这表示 reader 变量存储的是一个 PDF 阅读器实例,它代表了整个 PDF 文档的结构和元数据,而不是文档中的文字信息。要获取 PDF 内部的文本,我们需要进一步操作。

核心操作:提取页面文本

PyPDF2 设计的理念是将 PDF 文档视为一个由多个页面组成的集合。要获取文档中的文本,我们需要逐页进行处理。PdfReader 对象提供了一个 pages 属性,它是一个列表,包含了文档中的所有页面对象。每个页面对象(PageObject)都带有一个 extract_text() 方法,专门用于从该页面中提取文本内容。

因此,正确的文本提取流程是:

云从科技AI开放平台
云从科技AI开放平台

云从AI开放平台

下载
  1. 创建一个 PdfReader 对象来加载 PDF 文件。
  2. 遍历 PdfReader 对象的 pages 属性,获取每一个页面。
  3. 对每个页面对象调用 extract_text() 方法。

完整示例代码

以下是使用 PyPDF2 从 PDF 文件中提取并显示所有文本的完整示例代码:

import PyPDF2

def extract_text_from_pdf(pdf_path):
    """
    从指定的 PDF 文件中提取所有文本内容并打印。

    参数:
        pdf_path (str): PDF 文件的路径。
    """
    try:
        with open(pdf_path, 'rb') as file:
            reader = PyPDF2.PdfReader(file)

            # 遍历 PDF 中的每一个页面
            for page_num, page in enumerate(reader.pages):
                print(f"--- 页面 {page_num + 1} ---")
                # 提取当前页面的文本内容
                text = page.extract_text()
                if text:
                    print(text)
                else:
                    print("该页面未能提取到文本内容。")
            print("--- 文本提取完成 ---")
    except FileNotFoundError:
        print(f"错误:文件 '{pdf_path}' 未找到。")
    except Exception as e:
        print(f"处理 PDF 时发生错误:{e}")

# 调用函数,替换 'dummy.pdf' 为你的 PDF 文件路径
if __name__ == "__main__":
    extract_text_from_pdf('dummy.pdf')

代码解析

  • import PyPDF2: 导入 PyPDF2 库。
  • with open(pdf_path, 'rb') as file:: 以二进制读取模式('rb')打开 PDF 文件。这是处理非文本文件(如 PDF)的标准做法。with 语句确保文件在操作完成后会被正确关闭。
  • reader = PyPDF2.PdfReader(file): 创建一个 PdfReader 对象。这个对象现在代表了整个 PDF 文档,包含了访问其所有页面和元数据的方法。
  • for page_num, page in enumerate(reader.pages):: 这是一个关键步骤。reader.pages 是一个列表,其中包含了文档中的所有页面对象。我们通过循环遍历这个列表,每次迭代都会得到一个 page 对象,它代表 PDF 中的一个独立页面。enumerate 函数用于同时获取页面的索引(从0开始)和页面对象本身。
  • text = page.extract_text(): 对每个 page 对象调用 extract_text() 方法。这个方法会尝试从页面中解析并提取所有可见的文本内容,并将其作为一个字符串返回。
  • if text: print(text): 检查 extract_text() 是否返回了内容,如果返回了则打印。某些页面可能不含文本(例如,只有图片),或者文本无法被 PyPDF2 识别,此时 extract_text() 可能返回空字符串或 None。
  • 错误处理: try...except 块用于捕获文件未找到或其他潜在的运行时错误,增强了代码的健壮性。

重要注意事项

  1. 文本提取的准确性: PyPDF2 主要用于处理基于文本的 PDF 文件。对于扫描的 PDF(即图像格式的 PDF),extract_text() 方法通常无法提取任何文本,因为它不具备光学字符识别(OCR)功能。对于这类文件,需要借助专门的 OCR 库或服务。
  2. 布局和格式: extract_text() 方法返回的文本是原始的、顺序的文本流,它会尽力保留文本的阅读顺序。然而,对于包含复杂布局(如多列、表格、图文混排)的 PDF,提取出的文本可能失去原有的格式,导致阅读连贯性下降。
  3. PyPDF2 版本: PyPDF2 在不同版本间可能存在 API 变化。本教程基于较新的 PyPDF2 版本(如 3.x)。在旧版本中,PdfReader 可能被称为 PdfFileReader,并且 page 对象可能直接通过索引访问(reader.getPage(index))。建议使用最新稳定版以获得最佳性能和功能。
  4. 性能: 对于非常大的 PDF 文件,逐页提取文本可能需要一些时间。
  5. 官方文档: 对于更高级的 PDF 操作(如合并、分割、加密、添加水印等),建议查阅 PyPDF2 的官方文档,获取详细的 API 说明和使用示例。

总结

通过上述教程,我们详细解释了如何利用 PyPDF2 库的 PdfReader 对象和页面对象的 extract_text() 方法,从 PDF 文件中准确提取文本内容。理解 PdfReader 对象是文档的抽象表示,而实际文本位于其各个页面中,是成功进行 PDF 文本处理的关键。掌握这一核心技巧,将使您能够有效地利用 PyPDF2 处理各种基于文本的 PDF 文档。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
python中print函数的用法
python中print函数的用法

python中print函数的语法是“print(value1, value2, ..., sep=' ', end=' ', file=sys.stdout, flush=False)”。本专题为大家提供print相关的文章、下载、课程内容,供大家免费下载体验。

193

2023.09.27

python print用法与作用
python print用法与作用

本专题整合了python print的用法、作用、函数功能相关内容,阅读专题下面的文章了解更多详细教程。

19

2026.02.03

if什么意思
if什么意思

if的意思是“如果”的条件。它是一个用于引导条件语句的关键词,用于根据特定条件的真假情况来执行不同的代码块。本专题提供if什么意思的相关文章,供大家免费阅读。

847

2023.08.22

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

760

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

221

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1567

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

650

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

1228

2024.03.22

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

1

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号