我正在尋找從 PDF 中提取一些文本。我正在使用這段代碼:
import PyPDF2
Doc = open('document.pdf','rb')
pdfreader = PyPDF2.PdfFileReader(Doc)
pageObj = pdfreader.getPage(0)
pageObj.extractText()
使用此代碼的結果pageObj.extractText()是''。我不知道為什么會發生這種情況,因為 pdf 中有打開的文本。這份檔案只有 1 頁。
有人知道會發生什么嗎?或者是否有其他方法可以從 PDF 中獲取資訊?
uj5u.com熱心網友回復:
您可以嘗試使用 PDF Plumber。
您可以將其寫入文本檔案,而不是列印。
import pdfplumber
with pdfplumber.open(r'D:\document.pdf') as pdf:
first_page = pdf.pages[0]
print(first_page.extract_text())
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/410358.html
標籤:
