您好,登錄后才能下訂單哦!
這篇文章主要介紹了python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中,具有一定借鑒價(jià)值,需要的朋友可以參考下。下面就和我一起來(lái)看看吧。
pdfplumber操作pdf文件
一、pdfplumber安裝及導(dǎo)入
二、pdfplumber基礎(chǔ)使用
1、基礎(chǔ)知識(shí)
2、獲取pdf基礎(chǔ)信息
3、pdfplumber提取表格數(shù)據(jù)
三、提取pdf表格數(shù)據(jù)并保存到excel中
總結(jié)
python開(kāi)源庫(kù)pdfplumber,可以較為方便地獲取pdf的各種信息,包含pdf的基本信息(作者、創(chuàng)建時(shí)間、修改時(shí)間…)及表格、文本、圖片等信息,基本可以滿足較為簡(jiǎn)單的格式轉(zhuǎn)換功能。
跟其他包一樣,支持使用pip安裝,安裝命令:
pip install pdfplumber
安裝成功后,可直接用import導(dǎo)入,導(dǎo)入命令:
import pdfplumber
(1)pdfplumber有2個(gè)基礎(chǔ)類
PDF和Page,PDF用來(lái)處理整個(gè)文檔,Page用來(lái)處理整個(gè)頁(yè)面。
類 | 用法簡(jiǎn)介 |
---|---|
pdfplumber.PDF | .metadata,獲取pdf基礎(chǔ)信息,返回字典格式,包含作者、創(chuàng)建時(shí)間等。 .pages,返回pdfplumber.Page實(shí)例的列表,每一個(gè)實(shí)例包含pdf每一頁(yè)的信息 |
pdfplumber.Page | pdfplumber核心功能,對(duì)PDF的大部分操作都是基于這個(gè)類,包括提取文本、表格等 |
(2)pdfplumber讀取pdf文件方式
pdfplumber.open(‘文件路徑’),返回pdfplumber.PDF類的實(shí)例。
如果pdf有密碼,加入password參數(shù):
pdfplumber.open(‘文件路徑’,password=‘密碼’)
讀取pdf文件,并輸出pdf文件的基礎(chǔ)信息
import pdfplumber # 打開(kāi)pdf文件,有密碼加入password參數(shù) pdf_info =pdfplumber.open(r'test.pdf') meta_data = pdf_info.metadata # pdf的基礎(chǔ)信息 page_con = len(pdf_info.pages) # 獲取pdf的總頁(yè)數(shù) print('pdf文件的基礎(chǔ)信息:\n', meta_data) print('pdf共%s頁(yè)' % page_con)
提取表格數(shù)據(jù)主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。
用以下pdf文檔,作為演示文檔。
(1)extract_tables()方法
輸出文檔所有表格,返回一個(gè)嵌套列表,其結(jié)構(gòu)層次為table-row-cell。如:
#extract_tables()用法 with pdfplumber.open(r'test.pdf') as pdf_info: # 打開(kāi)pdf文件 page_one = pdf_info.pages[0] # 選擇第一頁(yè) page_one_table =page_one.extract_tables() # 獲取pdf文檔第一頁(yè)的所有表格數(shù)據(jù) for row in page_one_table: print('第一頁(yè)的表格數(shù)據(jù):', row)
(2)、extact_table()方法
不會(huì)返回文檔的所有表格,僅返回行數(shù)最多的表格數(shù)據(jù),如存在多個(gè)行數(shù)相等的表格,則默認(rèn)輸出頂部表格數(shù)據(jù)。返回的數(shù)據(jù)結(jié)構(gòu)層次為row-cell,表格的每一行都為一個(gè)單獨(dú)的列表,列表中的元素即為原表格的各個(gè)單元格的數(shù)據(jù)。如:
# extract_table()用法 with pdfplumber.open(r'test.pdf') as pdf_info: # 打開(kāi)pdf文件 page_one = pdf_info.pages[0] # 選擇第一頁(yè) page_one_table = page_one.extract_table() for row in page_one_table: print(row)
完整版,提取pdf表格數(shù)據(jù)并保存到excel中
import pdfplumber from openpyxl import Workbook class PDF(object): def __init__(self, file_path): self.pdf_path = file_path # 讀取pdf文件 try: self.pdf_info = pdfplumber.open(self.pdf_path) print('讀取文件完成!') except Exception as e: print('讀取文件失?。?#39;, e) # 打印pdf的基本信息、返回字典,作者、創(chuàng)建時(shí)間、修改時(shí)間/總頁(yè)數(shù) def get_pdf(self): pdf_info = self.pdf_info.metadata pdf_page = len(self.pdf_info.pages) print('pdf共%s頁(yè)' % pdf_page) print("pdf文件基本信息:\n", pdf_info) self.close_pdf() # 提取表格數(shù)據(jù),并保存到excel中 def get_table(self): wb = Workbook() # 實(shí)例化一個(gè)工作簿對(duì)象 ws = wb.active # 獲取第一個(gè)sheet con = 0 try: # 獲取每一頁(yè)的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]] for page in self.pdf_info.pages: for table in page.extract_tables(): for row in table: # 對(duì)每個(gè)單元格的字符進(jìn)行簡(jiǎn)單清洗處理 row_list = [cell.replace('\n', ' ') if cell else '' for cell in row] ws.append(row_list) # 寫入數(shù)據(jù) con += 1 print('---------------分割線,第%s頁(yè)---------------' % con) except Exception as e: print('報(bào)錯(cuò):', e) finally: wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx') print('寫入完成!') self.close_pdf() # 關(guān)閉文件 def close_pdf(self): self.pdf_info.close() if __name__ == "__main__": file_path = input('請(qǐng)輸入pdf文件路徑:') pdf_info = PDF(file_path) # pdf_info.get_pdf() # 打印pdf基礎(chǔ)信息 # 提取pdf表格數(shù)據(jù)并保存到excel中,文件保存到跟pdf同一文件路徑下 pdf_info.get_table()
以上就是python如何用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中的詳細(xì)內(nèi)容了,看完之后是否有所收獲呢?如果想了解更多相關(guān)內(nèi)容,歡迎來(lái)億速云行業(yè)資訊!
免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如果涉及侵權(quán)請(qǐng)聯(lián)系站長(zhǎng)郵箱:is@yisu.com進(jìn)行舉報(bào),并提供相關(guān)證據(jù),一經(jīng)查實(shí),將立刻刪除涉嫌侵權(quán)內(nèi)容。