相关疑难解决方法(0)

如何从PDF文件中提取文本和文本坐标?

我想用PDFMiner从PDF文件中提取所有文本框和文本框坐标.

许多其他Stack Overflow帖子解决了如何以有序方式提取所有文本,但是如何进行获取文本和文本位置的中间步骤?

给定一个PDF文件,输出应该类似于:

   489, 41,  "Signature"
   500, 52,  "b"
   630, 202, "a_g_i_r"
Run Code Online (Sandbox Code Playgroud)

python pdf pdfminer

21
推荐指数
3
解决办法
2万
查看次数

如何使用PDFMiner获取PDF中文本的位置?

PDFMiner的文档说:

PDFMiner允许人们获取页面中文本的确切位置

但是,我还没有找到如何做到这一点.PDFMiner的'文档'相当稀疏,所以我不明白如何做到这一点.

python pdf position pdfminer

16
推荐指数
1
解决办法
1万
查看次数

Python - 从pdf中提取格式化文本(即粗体,斜体,颜色)

是否有任何Python库允许从PDF中提取文本,但保留格式(即粗体,斜体,下划线,颜色等)?

我已经研究过各种选项,pdfminer但据我所知,他们只提取原始文本.

python pdf formatting extraction

8
推荐指数
0
解决办法
2536
查看次数

PDFminer:使用其字体信息提取文本

我发现这个问题,但它使用命令行,我不想使用子进程在命令行中调用Python脚本并解析HTML文件以获取字体信息.

我想使用PDFminer作为库,我发现这个问题,但它们只是提取纯文本,没有其他信息,如字体名称,字体大小等.

python text-extraction pdfminer

8
推荐指数
3
解决办法
9070
查看次数

从 PDF 中提取文本的格式(字体大小、类型等)

是否可以从 PDF 文件中提取有关特定字体/字体大小/字体颜色等的文本?我更喜欢 Perl、python 或 *nix 命令行实用程序。我的目标是从 PDF 文件中提取所有标题,这样我就可以在单个 PDF 中获得一个很好的文章索引。

pdf fonts extract font-size

7
推荐指数
1
解决办法
7887
查看次数