获得了BrTH 的出色帮助,在此处阅读 Python PDF
现在的问题是我正在处理foregin(巴西葡萄牙语)文本。得到并解决了“UnicodeDecodeError”致命错误,将此添加到 BrTH 的代码中
import codecs
#next lines are inside getPDFContent function
content += pdf.getPage(i).extractText() + "\n"
content = content.decode("utf-8")
Run Code Online (Sandbox Code Playgroud)
现在的问题是“print getPDFContent(f)”只从我尝试使用的任何 PDF 返回两个空行。显然关键字搜索只返回“False”。你能再帮我一次吗?
我是Python新手。我正在使用此代码提取文本。是否可以提取所有页面并在文件中输出?
import PyPDF2
pdf_file = open('sample.pdf','rb')
read_pdf = PyPDF2.PdfFileReader(pdf_file)
number_of_pages = read_pdf.getNumPages()
page = read_pdf.getPage(10)
page_content = page.extractText()
print (page_content)
Run Code Online (Sandbox Code Playgroud) 以下错误消息:
device = XMLConverter(rsrcmgr, retstr, laparams=laparams, codec=codec)
TypeError: __init__() got an unexpected keyword argument 'codec'
Run Code Online (Sandbox Code Playgroud)
原始代码:
rsrcmgr = PDFResourceManager()
retstr = BytesIO()
codec = 'utf-8'
laparams = LAParams()
device = XMLConverter(rsrcmgr, retstr, laparams=laparams, codec=codec)
Run Code Online (Sandbox Code Playgroud)
令人惊讶的是,这在我的项目设置(python 3.5.3)中运行良好,但在新设置(python 3.7.4)中则不然。不确定这是否是一个问题,或者现在是否有新版本的 XMLConverter 可用
需要解析 PDF 文件以仅提取文本的第一行,并寻找不同的 Python 包来完成这项工作,但没有任何运气。
尝试过:
PDFminer,PDFminer.six和PDFminer3k,这对于简单的工作来说似乎过于复杂,我找不到一个简单的工作示例
tika,它给出了不同的终端错误消息并且非常慢
pdftotext安装失败
pdf2text在“导入 pdf2text”时失败,当更改为“pdftotext”时,即使pip list显示已安装“Extractor”也无法导入“ImportError: cannot import name 'Extractor'”
通常我发现安装的 Python 包工作得非常好,但是将 PDF 解析为文本似乎是一个丛林,无数工具也表明了这一点。
关于如何在 Python 中将 PDF 文件简单解析为文本的任何建议?
添加了 PyPDF2 示例
PyPDF2 的一个例子是:
import PyPDF2
pdfFileObj = open('file.pdf', 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
pageObj_0 = pdfReader.getPage(0)
print(pageObj_0.extractText())
Run Code Online (Sandbox Code Playgroud)
它返回垃圾为:
$%$%&%&$'('~!)"*+#
我正在尝试查看多个 PDF 文件,查看每个文件的文本,并提取(开始)“注释 1- 组织”和“注释 2- 组织”(结束)之间的段落。每个文件在这个地方都有不同的文本,我想打印每个文件中的每个段落,或者将该段落保存到文本文件中。
下面,我编写了一个小脚本,该脚本打开一个文件,查找一串文本,然后打印找到该文本的页面。我认为这是一个好的开始,但我真的想循环浏览许多 PDF 文件,查找特定的文本正文,并将找到的所有内容保存到单个文本文件中。
import PyPDF2
import re
# open the pdf file
object = PyPDF2.PdfFileReader("C:/my_path/file1.pdf")
# get number of pages
NumPages = object.getNumPages()
# define keyterms
String = "New York State Real Property Law"
# extract text and do the search
for i in range(0, NumPages):
PageObj = object.getPage(i)
print("this is page " + str(i))
Text = PageObj.extractText()
# print(Text)
ResSearch = re.search(String, Text)
print(ResSearch)
Run Code Online (Sandbox Code Playgroud)
非常感谢任何解决此问题的见解!
我想从 pdf 论文中提取作者姓名。有人知道一种可靠的方法吗?
例如,我想Archana Shukla从此pdf中提取名称https://arxiv.org/pdf/1111.1648
python pdf nlp named-entity-recognition information-extraction
我的 PDF 文件遇到严重问题。我想从 PDF 中提取所有文本。提取后,我将所有内容都保存为字节码。
您可以在下面看到提取文本的提取部分:
b'%PDF-1.7\r\n%\xb5\xb5\xb5\xb5\r\n1 0 obj\r\n<</Type/Catalog/Pages 2 0 R/Lang(en-US) /Metadata 89 0 R/ViewerPreferences 90 0 R>>\r\nendobj\r\n2 0 obj\r\n<</Type/Pages/Count 11/Kids[ 3 0 R 28 0 R 36 0 R 38 0 R 42 0 R 49 0 R 58 0 R 60 0 R 62 0 R 64 0 R 66 0 R] >>\r\nendobj\r\n3 0 obj\r\n<</Type/Page/Parent 2 0 R/Resources<</Font<</F1 5 0 R/F2 9 0 R/F3 12 0 R/F4 17 0 R/F5 19 0 R>>/ExtGState<</GS7 7 0 R/GS8 8 …Run Code Online (Sandbox Code Playgroud) I am trying to extract text from a PDF file using Python. My main goal is I am trying to create a program that reads a bank statement and extracts its text to update an excel file to easily record monthly spendings. Right now I am focusing just extracting the text from the pdf file but I don't know how to do so.
What is currently the best and easiest way to extract text from a PDF file into a …