相关疑难解决方法(0)

PyPDF2 - 只返回空行。编码问题?

获得了BrTH 的出色帮助,在此处阅读 Python PDF

现在的问题是我正在处理foregin(巴西葡萄牙语)文本。得到并解决了“UnicodeDecodeError”致命错误,将此添加到 BrTH 的代码中

 import codecs

 #next lines are inside getPDFContent function
 content += pdf.getPage(i).extractText() + "\n"
 content = content.decode("utf-8")
Run Code Online (Sandbox Code Playgroud)

现在的问题是“print getPDFContent(f)”只从我尝试使用的任何 PDF 返回两个空行。显然关键字搜索只返回“False”。你能再帮我一次吗?

python pdf encode decode

5
推荐指数
0
解决办法
3291
查看次数

使用Python从PDF中提取文本-所有页面和输出-文件

我是Python新手。我正在使用此代码提取文本。是否可以提取所有页面并在文件中输出?

import PyPDF2
pdf_file = open('sample.pdf','rb')
read_pdf = PyPDF2.PdfFileReader(pdf_file)
number_of_pages = read_pdf.getNumPages()
page = read_pdf.getPage(10)
page_content = page.extractText()
print (page_content)
Run Code Online (Sandbox Code Playgroud)

python

5
推荐指数
1
解决办法
6362
查看次数

XMLConverter 中出现意外的关键字参数“codec”

以下错误消息:

device = XMLConverter(rsrcmgr, retstr, laparams=laparams, codec=codec)
TypeError: __init__() got an unexpected keyword argument 'codec'
Run Code Online (Sandbox Code Playgroud)

原始代码:

rsrcmgr = PDFResourceManager()
retstr = BytesIO()
codec = 'utf-8'
laparams = LAParams()
device = XMLConverter(rsrcmgr, retstr, laparams=laparams, codec=codec)
Run Code Online (Sandbox Code Playgroud)

令人惊讶的是,这在我的项目设置(python 3.5.3)中运行良好,但在新设置(python 3.7.4)中则不然。不确定这是否是一个问题,或者现在是否有新版本的 XMLConverter 可用

codec xmlconvert python-3.x pdfminer

4
推荐指数
1
解决办法
8161
查看次数

如何使用 Python 从 PDF 文件中读取简单文本?

需要解析 PDF 文件以仅提取文本的第一行,并寻找不同的 Python 包来完成这项工作,但没有任何运气。

尝试过:

  • PDFminerPDFminer.sixPDFminer3k,这对于简单的工作来说似乎过于复杂,我找不到一个简单的工作示例

  • slate,安装时出错,虽然使用线程修复,但尝试时出错;也许使用了错误的 PDFminer,但无法确定使用哪个

  • PyPDF2PyPDF3但这些给出了垃圾,如here所述

  • tika,它给出了不同的终端错误消息并且非常慢

  • pdftotext安装失败

  • pdf2text在“导入 pdf2text”时失败,当更改为“pdftotext”时,即使pip list显示已安装“Extractor”也无法导入“ImportError: cannot import name 'Extractor'”

通常我发现安装的 Python 包工作得非常好,但是将 PDF 解析为文本似乎是一个丛林,无数工具也表明了这一点。

关于如何在 Python 中将 PDF 文件简单解析为文本的任何建议?

添加了 PyPDF2 示例

PyPDF2 的一个例子是:

import PyPDF2
pdfFileObj = open('file.pdf', 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
pageObj_0 = pdfReader.getPage(0)
print(pageObj_0.extractText())
Run Code Online (Sandbox Code Playgroud)

它返回垃圾为:

$%$%&%&$'('~!)"*+#

python pdf text python-3.x

4
推荐指数
1
解决办法
3066
查看次数

尝试循环遍历多个 PDF 文件并提取两个搜索条件之间的文本

我正在尝试查看多个 PDF 文件,查看每个文件的文本,并提取(开始)“注释 1- 组织”和“注释 2- 组织”(结束)之间的段落。每个文件在这个地方都有不同的文本,我想打印每个文件中的每个段落,或者将该段落保存到文本文件中。

下面,我编写了一个小脚本,该脚本打开一个文件,查找一串文本,然后打印找到该文本的页面。我认为这是一个好的开始,但我真的想循环浏览许多 PDF 文件,查找特定的文本正文,并将找到的所有内容保存到单个文本文件中。

import PyPDF2
import re

# open the pdf file
object = PyPDF2.PdfFileReader("C:/my_path/file1.pdf")

# get number of pages
NumPages = object.getNumPages()

# define keyterms
String = "New York State Real Property Law"

# extract text and do the search
for i in range(0, NumPages):
    PageObj = object.getPage(i)
    print("this is page " + str(i)) 
    Text = PageObj.extractText() 
    # print(Text)
    ResSearch = re.search(String, Text)
    print(ResSearch)
Run Code Online (Sandbox Code Playgroud)

非常感谢任何解决此问题的见解!

python python-3.x

3
推荐指数
1
解决办法
2万
查看次数

如何从pdf论文中稳健地提取作者姓名?

我想从 pdf 论文中提取作者姓名。有人知道一种可靠的方法吗?

例如,我想Archana Shukla从此pdf中提取名称https://arxiv.org/pdf/1111.1648

python pdf nlp named-entity-recognition information-extraction

0
推荐指数
1
解决办法
4812
查看次数

我的 PDF 文件内容在提取内容后没有意义

我的 PDF 文件遇到严重问题。我想从 PDF 中提取所有文本。提取后,我将所有内容都保存为字节码。

您可以在下面看到提取文本的提取部分:

b'%PDF-1.7\r\n%\xb5\xb5\xb5\xb5\r\n1 0 obj\r\n<</Type/Catalog/Pages 2 0 R/Lang(en-US) /Metadata 89 0 R/ViewerPreferences 90 0 R>>\r\nendobj\r\n2 0 obj\r\n<</Type/Pages/Count 11/Kids[ 3 0 R 28 0 R 36 0 R 38 0 R 42 0 R 49 0 R 58 0 R 60 0 R 62 0 R 64 0 R 66 0 R] >>\r\nendobj\r\n3 0 obj\r\n<</Type/Page/Parent 2 0 R/Resources<</Font<</F1 5 0 R/F2 9 0 R/F3 12 0 R/F4 17 0 R/F5 19 0 R>>/ExtGState<</GS7 7 0 R/GS8 8 …
Run Code Online (Sandbox Code Playgroud)

python pdf python-3.x

0
推荐指数
1
解决办法
1724
查看次数

How to extract text from pdf in python 3.7.3

I am trying to extract text from a PDF file using Python. My main goal is I am trying to create a program that reads a bank statement and extracts its text to update an excel file to easily record monthly spendings. Right now I am focusing just extracting the text from the pdf file but I don't know how to do so.

What is currently the best and easiest way to extract text from a PDF file into a …

python pdf pdf-extraction pypdf2

-1
推荐指数
3
解决办法
5849
查看次数