實(shí)用腳本！Python提取PDF指定內(nèi)容生成新文件！

大家好，我是早起。

創(chuàng)新互聯(lián)-專(zhuān)業(yè)網(wǎng)站定制、快速模板網(wǎng)站建設(shè)、高性?xún)r(jià)比疊彩網(wǎng)站開(kāi)發(fā)、企業(yè)建站全套包干低至880元,成熟完善的模板庫(kù),直接使用。一站式疊彩網(wǎng)站制作公司更省心,省錢(qián),快速模板網(wǎng)站建設(shè)找我們，業(yè)務(wù)覆蓋疊彩地區(qū)。費(fèi)用合理售后完善，十多年實(shí)體公司更值得信賴(lài)。

在之前的「Python辦公自動(dòng)化」案專(zhuān)題中，我們已經(jīng)介紹了如何有選擇的提取某些頁(yè)面進(jìn)行合并。

但是很多時(shí)候，我們并不會(huì)預(yù)知希望提取的頁(yè)號(hào)，而是希望將包含指定內(nèi)容的頁(yè)面提取合并為新PDF，本文就以?xún)蓚€(gè)真實(shí)需求為例進(jìn)行講解。

01. 需求描述

數(shù)據(jù)是一份有286頁(yè)的上市公司公開(kāi)年報(bào)PDF，大致如下：

現(xiàn)在需要利用 Python 完成以下兩個(gè)需求：

需求一：提取所有包含戰(zhàn)略二字的頁(yè)面并合并新PDF

需求二：提取所有包含圖片的頁(yè)面，并分別保存為 PDF 文件

02. 前置知識(shí)和邏輯梳理

2.1 PyPDF2 模塊實(shí)現(xiàn)合并

PyPDF2 導(dǎo)入模塊的代碼常常是：

 
 
 
 
  
  
  
  from PyPDF2 import PdfFileReader, PdfFileWriter

這里導(dǎo)入了兩個(gè)方法：

PdfFileReader 可以理解為讀取器
PdfFileWriter 可以理解為寫(xiě)入器

利用 PyPDF2 實(shí)現(xiàn)合并運(yùn)用的一下邏輯：

讀取器將所有pdf讀取一遍
讀取器將讀取的內(nèi)容交給寫(xiě)入器
寫(xiě)入器統(tǒng)一輸出到一個(gè)新pdf

隱含知識(shí)點(diǎn)：讀取器只能將讀取的內(nèi)容一頁(yè)一頁(yè)交給寫(xiě)入器

2.2 獲取與添加頁(yè)面

之前我們的推文中提到這兩個(gè)代碼，下面列出作為復(fù)習(xí)：

.getPage 獲取特定頁(yè)
.addPage 添加特定頁(yè)

2.3 圖片和文字的處理

要實(shí)現(xiàn)本文的需求還要做到很重要的一個(gè)判斷：確定頁(yè)面中有無(wú)包含的文字或圖片

判斷是否包含特定的文字比較簡(jiǎn)單，遍歷每一頁(yè)的時(shí)候都將包含的文本抽提出，做字符串層面的判斷即可，代碼思路：

利用 pdfplumber 打開(kāi)PDF 文件
獲取指定的頁(yè)，或者遍歷每一頁(yè)
利用 .extract_text() 方法提取當(dāng)前頁(yè)的文字
判斷 “戰(zhàn)略” 是否在提取的文字中

判斷是否包含圖片，思路和上面是類(lèi)似的，但方法不同。圖片考慮用正則的方法識(shí)別，用 fitz 和 re 配合，具體見(jiàn)下文代碼

03. 代碼實(shí)現(xiàn)

3.1 需求一的實(shí)現(xiàn)

首先來(lái)完成需求一的任務(wù)，導(dǎo)入需要用到的庫(kù)：讀取寫(xiě)入PDF文件的 PyPDF2 以及抽提文本的 pdfplumber

 
 
 
 
  
  
  
  from PyPDF2 import PdfFileReader, PdfFileWriter  
  
  
  
  import pdfplumber

指定文件所在的路徑，同時(shí)初始化寫(xiě)入器，將文件交給讀取器：

 
 
 
 
  
  
  
  path = r'C:\xxxxxx'  
  
  
  
  pdf_writer = PdfFileWriter()  
  
  
  
  pdf_reader = PdfFileReader(path + r'\公司年報(bào).PDF')

以上下文管理器形式通過(guò) pdfplumber 打開(kāi)文件，同時(shí)用 .getNumPages 獲取讀取器的最大頁(yè)利于遍歷每一頁(yè)來(lái)抽提文字：

 
 
 
 
  
  
  
  with pdfplumber.open(path + r'\公司年報(bào).PDF') as pdf:  
  
  
  
      for i in range(pdf_reader.getNumPages()):  
  
  
  
          page = pdf.pages[i]  
  
  
  
          print(page.extract_text())

我們抽提文字的目的是用來(lái)判斷，將符合要求的頁(yè)碼作為讀取器 .getPage 的參數(shù)，最后用 .addPage 交給寫(xiě)入器：

 
 
 
 
  
  
  
  with pdfplumber.open(path + r'\公司年報(bào).PDF') as pdf:  
  
  
  
      for i in range(pdf_reader.getNumPages()):  
  
  
  
          page = pdf.pages[i]  
  
  
  
          print(page.extract_text()) 
  
  
  
          if '戰(zhàn)略' in page.extract_text():  
  
  
  
              pdf_writer.addPage(pdf_reader.getPage(i))  
  
  
  
              print(i + 1, page.extract_text())

完成識(shí)別后讓寫(xiě)入器輸出為需要的文件名：

 
 
 
 
  
  
  
  with open(path + r'\new_公司年報(bào).pdf', 'wb') as out:  
  
  
  
      pdf_writer.write(out)

至此，我們就完成了包含特定文字內(nèi)容頁(yè)面的提取，并整合成一個(gè)PDF。所有的頁(yè)面均包含“戰(zhàn)略”二字：

需求一完整代碼如下，感興趣的讀者可以自行研究。

 
 
 
 
  
  
  
  from PyPDF2 import PdfFileReader, PdfFileWriter  
  
  
  
  import pdfplumber  
  
  
  
  path = r'C:\xxx'  
  
  
  
  pdf_writer = PdfFileWriter()  
  
  
  
  pdf_reader = PdfFileReader(path + r'\公司年報(bào).PDF')  
  
  
  
  with pdfplumber.open(path + r'\公司年報(bào).PDF') as pdf:  
  
  
  
      for i in range(pdf_reader.getNumPages()):  
  
  
  
          page = pdf.pages[i]  
  
  
  
          print(page.extract_text())  
  
  
  
          if '戰(zhàn)略' in page.extract_text():  
  
  
  
              pdf_writer.addPage(pdf_reader.getPage(i))  
  
  
  
              print(i + 1, page.extract_text()) 
  
  
  
  with open(path + r'\new_公司年報(bào)1.pdf', 'wb') as out:  
  
  
  
      pdf_writer.write(out)

3.2 需求二的實(shí)現(xiàn)

接下來(lái)完成需求二的任務(wù)。首先導(dǎo)入需要的庫(kù)：

 
 
 
 
  
  
  
  from PyPDF2 import PdfFileReader, PdfFileWriter  
  
  
  
  import fitz  
  
  
  
  import re  
  
  
  
  import os

指定文件所在的路徑：

 
 
 
 
  
  
  
  path = r'C:\xxxxxx'

正則識(shí)別圖片的部分不細(xì)講，之前的推文已經(jīng)介紹過(guò)，我們直接看代碼：

 
 
 
 
  
  
  
  page_lst = []  
  
  
  
  checkImg = r"/Subtype(?= */Image)"  
  
  
  
  pdf = fitz.open(path + r'\公司年報(bào).PDF')  
  
  
  
  lenXREF = pdf._getXrefLength()  
  
  
  
  for i in range(lenXREF):  
  
  
  
      text = pdf._getXrefString(i)  
  
  
  
      isImage = re.search(checkImg, text)  
  
  
  
      if isImage:  
  
  
  
          page_lst.append(i)  
  
  
  
  print(page_lst)

獲取到所有包含圖片的頁(yè)面后，再結(jié)合讀取器和寫(xiě)入器的配合就能完成新 PDF 的產(chǎn)生。注意本需求是所有圖片單獨(dú)輸出，因此獲取到頁(yè)面后交給寫(xiě)入器直接輸出成文件：

 
 
 
 
  
  
  
  pdf_reader = PdfFileReader(path + r'\公司年報(bào).PDF')  
  
  
  
  for page in page_lst:  
  
  
  
      pdf_writer = PdfFileWriter()  
  
  
  
      pdf_writer.addPage(pdf_reader.getPage(page))  
  
  
  
      with open(path + r'\公司年報(bào)_{}.pdf'.format(page + 1), 'wb') as out:  
  
  
  
          pdf_writer.write(out)

至此也完成了第二個(gè)需求。需要說(shuō)明的是目前沒(méi)有非常完美提取PDF圖片的方法，本案例介紹的方法識(shí)別圖片也并不穩(wěn)定。讀者可以利用自己的數(shù)據(jù)多做嘗試。完整代碼如下：

 
 
 
 
  
  
  
  from PyPDF2 import PdfFileReader, PdfFileWriter  
  
  
  
  import fitz  
  
  
  
  import re  
  
  
  
  import os  
  
  
  
  path = r'C:\xxx'  
  
  
  
  page_lst = []  
  
  
  
  checkImg = r"/Subtype(?= */Image)"  
  
  
  
  pdf = fitz.open(path + r'\公司年報(bào).PDF')  
  
  
  
  lenXREF = pdf._getXrefLength()  
  
  
  
  for i in range(lenXREF):  
  
  
  
      text = pdf._getXrefString(i)  
  
  
  
      isImage = re.search(checkImg, text)  
  
  
  
      if isImage:  
  
  
  
          page_lst.append(i)  
  
  
  
  print(page_lst)  
  
  
  
  pdf_reader = PdfFileReader(path + r'\公司年報(bào).PDF')  
  
  
  
  for page in page_lst:  
  
  
  
      pdf_writer = PdfFileWriter()  
  
  
  
      pdf_writer.addPage(pdf_reader.getPage(page))  
  
  
  
      with open(path + r'\公司年報(bào)_{}.pdf'.format(page + 1), 'wb') as out:  
  
  
  
          pdf_writer.write(out)

實(shí)現(xiàn)這兩個(gè)單個(gè)需求后，就可以將相關(guān)代碼封裝并結(jié)合os等模塊實(shí)現(xiàn)批量操作，解放雙手。

分享題目：實(shí)用腳本！Python提取PDF指定內(nèi)容生成新文件！
本文路徑：http://uogjgqi.cn/article/dpodpdh.html

掃二維碼與項(xiàng)目經(jīng)理溝通

我們?cè)谖⑿派?4小時(shí)期待你的聲音

解答本文疑問(wèn)/技術(shù)咨詢(xún)/運(yùn)營(yíng)咨詢(xún)/技術(shù)建議/互聯(lián)網(wǎng)交流

av激情亚洲男人的天堂国语,日韩欧美精品一中文字幕,无码av一区二区三区无码,国产又色又爽又刺激的a片,国产又色又爽又刺激的a片

實(shí)用腳本！Python提取PDF指定內(nèi)容生成新文件！

01. 需求描述

02. 前置知識(shí)和邏輯梳理

2.1 PyPDF2 模塊實(shí)現(xiàn)合并

2.2 獲取與添加頁(yè)面

2.3 圖片和文字的處理

03. 代碼實(shí)現(xiàn)

3.1 需求一的實(shí)現(xiàn)

3.2 需求二的實(shí)現(xiàn)

掃二維碼與項(xiàng)目經(jīng)理溝通

其他資訊

行業(yè)動(dòng)態(tài)

企業(yè)網(wǎng)站建設(shè)的重要性！

服務(wù)項(xiàng)目

網(wǎng)站建設(shè)

移動(dòng)端/APP

微信/小程序

技術(shù)支持

其它服務(wù)

更多服務(wù)項(xiàng)目

聯(lián)系吧在百度地圖上找到我們

電話(huà)：13518219792

av激情亚洲男人的天堂国语,日韩欧美精品一中文字幕,无码av一区二区三区无码,国产又色又爽又刺激的a片,国产又色又爽又刺激的a片

實(shí)用腳本！Python提取PDF指定內(nèi)容生成新文件！

01. 需求描述

02. 前置知識(shí)和邏輯梳理

2.1 PyPDF2 模塊實(shí)現(xiàn)合并

2.2 獲取與添加頁(yè)面

2.3 圖片和文字的處理

03. 代碼實(shí)現(xiàn)

3.1 需求一的實(shí)現(xiàn)

3.2 需求二的實(shí)現(xiàn)

掃二維碼與項(xiàng)目經(jīng)理溝通

其他資訊

行業(yè)動(dòng)態(tài)

企業(yè)網(wǎng)站建設(shè)的重要性！

服務(wù)項(xiàng)目

網(wǎng)站建設(shè)

移動(dòng)端/APP

微信/小程序

技術(shù)支持

其它服務(wù)

更多服務(wù)項(xiàng)目

聯(lián)系吧 在百度地圖上找到我們

電話(huà)：13518219792

實(shí)用腳本！Python提取PDF指定內(nèi)容生成新文件！

企業(yè)網(wǎng)站建設(shè)的重要性！

聯(lián)系吧在百度地圖上找到我們