小编Eva*_*ata的帖子

将边界框中的pdf文本直接提取到python中

我正在尝试在给定的边界矩形内提取 pdf 的文本。据我所知，有一些用于 pdf 抓取的工具，例如 pdfminer、pypdf 和 pdftotext。我已经尝试了所有 3 个方法，到目前为止，我只获得了 pdftotext 的代码，用于从给定的边界框中提取文本。该代码看起来像这样：

s = "pdftotext -x %d -y %d -w %d -h %d"
s = s%(<various inputs into my function>)
cmd = [s, pdf_path,
           text_out]
subprocess.call(cmd)

Run Code Online (Sandbox Code Playgroud)

但是，这会输出/写入一个文本文件。我想立即使用该文本，这意味着我不想打开一个文本文件来检索该边界框中的任何单词，因为我将为 10,000 多个文档执行此操作，并打开那么多文件可能是一种痛苦。我基本上是从 python 脚本运行命令行提示符，所以我认为实际上没有办法解决这个问题，但我不确定。由于 pdfminer 和 pypdf 是实际的 python 包，我可以获取它们的文本，但它们似乎没有任何方法在给定的像素限制内提取文本。

进一步说明 - 我希望专门在 python 中执行此操作，因为我有大量针对同一个总体项目的其他代码。

python pdf text-extraction pypdf pdfminer

Eva*_*ata

lucky-day

6
推荐指数

1
解决办法

1万
查看次数