LOGO OA教程 ERP教程 模切知识交流 PMS教程 CRM教程 开发文档 其他文档  
 
网站管理员

python提取pdf表格数据并保存到excel中

admin
2025年8月28日 1:51 本文热度 96

pdfplumber操作pdf文件

python开源库pdfplumber,可以较为方便地获取pdf的各种信息,包含pdf的基本信息(作者、创建时间、修改时间...)及表格、文本、图片等信息,基本可以满足较为简单的格式转换功能。


一、pdfplumber安装及导入

跟其他包一样,支持使用pip安装,安装命令:

pip install pdfplumber

安装成功后,可直接用import导入,导入命令:

import pdfplumber


二、pdfplumber基础使用

1、基础知识

(1)pdfplumber有2个基础类

PDFPage,PDF用来处理整个文档,Page用来处理整个页面。

用法简介

pdfplumber.PDF类

.metadata,获取pdf基础信息,返回字典格式,包含作者、创建时间等

.pages,返回pdfplumber.Page实例的列表,每一个实例包含pdf每一页的信息

pdfplumber.Page

pdfplumber核心功能,对PDF的大部分操作都是基于这个类,包括提取文本、表格等

 

(2)pdfplumber读取pdf文件方式

pdfplumber.open(‘文件路径’),返回pdfplumber.PDF类的实例。

如果pdf有密码,加入password参数:

pdfplumber.open(‘文件路径’,password=‘密码’)


 2、获取pdf基础信息

读取pdf文件,并输出pdf文件的基础信息

import pdfplumber
# 打开pdf文件,有密码加入password参数pdf_info =pdfplumber.open(r'test.pdf')meta_data = pdf_info.metadata  # pdf的基础信息page_con = len(pdf_info.pages)  # 获取pdf的总页数print('pdf文件的基础信息:\n', meta_data)print('pdf共%s页' % page_con)


3、pdfplumber提取表格数据

 提取表格数据主要用到extract_tables()和extract_table()两种方法,这两种提取方式各有不同。

用以下pdf文档,作为演示文档。

(1)extract_tables()方法

输出文档所有表格,返回一个嵌套列表,其结构层次为table-row-cell。如:

#extract_tables()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打开pdf文件    page_one = pdf_info.pages[0]  # 选择第一页    page_one_table =page_one.extract_tables()  # 获取pdf文档第一页的所有表格数据    for row in page_one_table:       print('第一页的表格数据:', row)


(2)、extact_table()方法

不会返回文档的所有表格,仅返回行数最多的表格数据,如存在多个行数相等的表格,则默认输出顶部表格数据。返回的数据结构层次为row-cell,表格的每一行都为一个单独的列表,列表中的元素即为原表格的各个单元格的数据。如:

# extract_table()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打开pdf文件    page_one = pdf_info.pages[0]  # 选择第一页    page_one_table = page_one.extract_table()    for row in page_one_table:        print(row)


三、提取pdf表格数据并保存到excel中

结合以上方法,综合使用:

提取pdf文件所有表格数据,并保存excel中,部分代码和效果如下:

(关注本公众号,回复【pdfexcel】即可获得完整代码,运行并输入文件路径,即可转换成excel)。

# 提取表格数据,并保存到excel中def get_table(self):    wb = Workbook()  # 实例化一个工作簿对象    ws = wb.active  # 获取第一个sheet    con = 0    try:        # 获取每一页的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]]        for page in self.pdf_info.pages:            for table in page.extract_tables():                for row in table:                    # 对每个单元格的字符进行简单清洗处理                    row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]                    ws.append(row_list)  # 写入数据            con += 1            print('---------------分割线,第%s页---------------' % con)    except Exception as e:        print('报错:', e)    finally:        wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')print('写入完成!')


以上就是pdfplumber基础知识和表格数据提取方法。


-end-


阅读原文:原文链接


该文章在 2025/8/28 15:44:01 编辑过
关键字查询
相关文章
正在查询...
点晴ERP是一款针对中小制造业的专业生产管理软件系统,系统成熟度和易用性得到了国内大量中小企业的青睐。
点晴PMS码头管理系统主要针对港口码头集装箱与散货日常运作、调度、堆场、车队、财务费用、相关报表等业务管理,结合码头的业务特点,围绕调度、堆场作业而开发的。集技术的先进性、管理的有效性于一体,是物流码头及其他港口类企业的高效ERP管理信息系统。
点晴WMS仓储管理系统提供了货物产品管理,销售管理,采购管理,仓储管理,仓库管理,保质期管理,货位管理,库位管理,生产管理,WMS管理系统,标签打印,条形码,二维码管理,批号管理软件。
点晴免费OA是一款软件和通用服务都免费,不限功能、不限时间、不限用户的免费OA协同办公管理系统。
Copyright 2010-2025 ClickSun All Rights Reserved