溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊(cè)×

獲取短信驗(yàn)證碼

其他方式登錄

點(diǎn)擊登錄注冊(cè) 即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請(qǐng)使用微信掃描上方二維碼

使用幫助

請(qǐng)求超時(shí)！

請(qǐng)點(diǎn)擊重新獲取二維碼

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

發(fā)布時(shí)間：2022-07-25 09:24:07 來(lái)源：億速云閱讀：389 作者：栢白欄目：開(kāi)發(fā)技術(shù)

這篇文章主要介紹了python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中，具有一定借鑒價(jià)值，需要的朋友可以參考下。下面就和我一起來(lái)看看吧。

目錄

pdfplumber操作pdf文件
一、pdfplumber安裝及導(dǎo)入
二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識(shí)
2、獲取pdf基礎(chǔ)信息
3、pdfplumber提取表格數(shù)據(jù)

三、提取pdf表格數(shù)據(jù)并保存到excel中

總結(jié)

pdfplumber操作pdf文件

python開(kāi)源庫(kù)pdfplumber，可以較為方便地獲取pdf的各種信息，包含pdf的基本信息（作者、創(chuàng)建時(shí)間、修改時(shí)間…）及表格、文本、圖片等信息，基本可以滿足較為簡(jiǎn)單的格式轉(zhuǎn)換功能。

一、pdfplumber安裝及導(dǎo)入

跟其他包一樣，支持使用pip安裝，安裝命令：

pip install pdfplumber

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

安裝成功后，可直接用import導(dǎo)入，導(dǎo)入命令：

import pdfplumber

二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識(shí)

（1）pdfplumber有2個(gè)基礎(chǔ)類

PDF和Page，PDF用來(lái)處理整個(gè)文檔，Page用來(lái)處理整個(gè)頁(yè)面。

類	用法簡(jiǎn)介
pdfplumber.PDF	.metadata，獲取pdf基礎(chǔ)信息，返回字典格式，包含作者、創(chuàng)建時(shí)間等。 .pages，返回pdfplumber.Page實(shí)例的列表，每一個(gè)實(shí)例包含pdf每一頁(yè)的信息
pdfplumber.Page	pdfplumber核心功能，對(duì)PDF的大部分操作都是基于這個(gè)類，包括提取文本、表格等

（2）pdfplumber讀取pdf文件方式

pdfplumber.open(‘文件路徑’)，返回pdfplumber.PDF類的實(shí)例。

如果pdf有密碼，加入password參數(shù)：

pdfplumber.open(‘文件路徑’,password=‘密碼’)

2、獲取pdf基礎(chǔ)信息

讀取pdf文件，并輸出pdf文件的基礎(chǔ)信息

import pdfplumber
# 打開(kāi)pdf文件，有密碼加入password參數(shù)
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基礎(chǔ)信息
page_con = len(pdf_info.pages)  # 獲取pdf的總頁(yè)數(shù)
print('pdf文件的基礎(chǔ)信息：\n', meta_data)
print('pdf共%s頁(yè)' % page_con)

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

3、pdfplumber提取表格數(shù)據(jù)

提取表格數(shù)據(jù)主要用到extract_tables()和extract_table()兩種方法，這兩種提取方式各有不同。

用以下pdf文檔，作為演示文檔。

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

（1）extract_tables()方法

輸出文檔所有表格，返回一個(gè)嵌套列表，其結(jié)構(gòu)層次為table-row-cell。如：

#extract_tables()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開(kāi)pdf文件
    page_one = pdf_info.pages[0]  # 選擇第一頁(yè)
    page_one_table =page_one.extract_tables()  # 獲取pdf文檔第一頁(yè)的所有表格數(shù)據(jù)
    for row in page_one_table:
       print('第一頁(yè)的表格數(shù)據(jù)：', row)

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中
（2）、extact_table()方法

不會(huì)返回文檔的所有表格，僅返回行數(shù)最多的表格數(shù)據(jù)，如存在多個(gè)行數(shù)相等的表格，則默認(rèn)輸出頂部表格數(shù)據(jù)。返回的數(shù)據(jù)結(jié)構(gòu)層次為row-cell，表格的每一行都為一個(gè)單獨(dú)的列表，列表中的元素即為原表格的各個(gè)單元格的數(shù)據(jù)。如：

# extract_table()用法
with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開(kāi)pdf文件
    page_one = pdf_info.pages[0]  # 選擇第一頁(yè)
    page_one_table = page_one.extract_table()
    for row in page_one_table:
        print(row)

python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

三、提取pdf表格數(shù)據(jù)并保存到excel中

完整版，提取pdf表格數(shù)據(jù)并保存到excel中

import pdfplumber
from openpyxl import Workbook

class PDF(object):
    def __init__(self, file_path):
        self.pdf_path = file_path
        # 讀取pdf文件
        try:
            self.pdf_info = pdfplumber.open(self.pdf_path)
            print('讀取文件完成！')
        except Exception as e:
            print('讀取文件失?。?#39;, e)

    # 打印pdf的基本信息、返回字典，作者、創(chuàng)建時(shí)間、修改時(shí)間/總頁(yè)數(shù)
    def get_pdf(self):
        pdf_info = self.pdf_info.metadata
        pdf_page = len(self.pdf_info.pages)
        print('pdf共%s頁(yè)' % pdf_page)
        print("pdf文件基本信息：\n", pdf_info)
        self.close_pdf()

    # 提取表格數(shù)據(jù),并保存到excel中
    def get_table(self):
        wb = Workbook()  # 實(shí)例化一個(gè)工作簿對(duì)象
        ws = wb.active  # 獲取第一個(gè)sheet
        con = 0
        try:
            # 獲取每一頁(yè)的表格中的文字，返回table、row、cell格式：[[[row1],[row2]]]
            for page in self.pdf_info.pages:
                for table in page.extract_tables():
                    for row in table:
                        # 對(duì)每個(gè)單元格的字符進(jìn)行簡(jiǎn)單清洗處理
                        row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]
                        ws.append(row_list)  # 寫入數(shù)據(jù)
                con += 1
                print('---------------分割線,第%s頁(yè)---------------' % con)
        except Exception as e:
            print('報(bào)錯(cuò)：', e)
        finally:
            wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')
            print('寫入完成！')
            self.close_pdf()

    # 關(guān)閉文件
    def close_pdf(self):
        self.pdf_info.close()

if __name__ == "__main__":
    file_path = input('請(qǐng)輸入pdf文件路徑：')
    pdf_info = PDF(file_path)
    # pdf_info.get_pdf() # 打印pdf基礎(chǔ)信息
    # 提取pdf表格數(shù)據(jù)并保存到excel中,文件保存到跟pdf同一文件路徑下
    pdf_info.get_table()

以上就是python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中的詳細(xì)內(nèi)容了，看完之后是否有所收獲呢？如果想了解更多相關(guān)內(nèi)容，歡迎來(lái)億速云行業(yè)資訊！

向AI問(wèn)一下細(xì)節(jié)

推薦閱讀：

免責(zé)聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如果涉及侵權(quán)請(qǐng)聯(lián)系站長(zhǎng)郵箱：is@yisu.com進(jìn)行舉報(bào)，并提供相關(guān)證據(jù)，一經(jīng)查實(shí)，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
Pandas統(tǒng)計(jì)計(jì)數(shù)value_counts()的使用方法解析
下一篇新聞：
如何使用JQuery實(shí)現(xiàn)電梯導(dǎo)航效果

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動(dòng)

幫助支持

關(guān)于我們

售后咨詢

7*24小時(shí)在線電話：400-100-2938

7*24小時(shí)在線 QQ：800811969

關(guān)注億速云

億速云公眾號(hào)

手機(jī)網(wǎng)站二維碼

<pre id="04ccq"></pre>

<pre id="04ccq"><noscript id="04ccq"></noscript></pre>

<pre id="04ccq"><li id="04ccq"></li></pre>