我想用PDFMiner从PDF文件中提取所有文本框和文本框坐标.
许多其他Stack Overflow帖子解决了如何以有序方式提取所有文本,但是如何进行获取文本和文本位置的中间步骤?
给定一个PDF文件,输出应该类似于:
489, 41, "Signature"
500, 52, "b"
630, 202, "a_g_i_r"
Run Code Online (Sandbox Code Playgroud) PDFMiner的文档说:
PDFMiner允许人们获取页面中文本的确切位置
但是,我还没有找到如何做到这一点.PDFMiner的'文档'相当稀疏,所以我不明白如何做到这一点.
是否有任何Python库允许从PDF中提取文本,但保留格式(即粗体,斜体,下划线,颜色等)?
我已经研究过各种选项,pdfminer但据我所知,他们只提取原始文本.
是否可以从 PDF 文件中提取有关特定字体/字体大小/字体颜色等的文本?我更喜欢 Perl、python 或 *nix 命令行实用程序。我的目标是从 PDF 文件中提取所有标题,这样我就可以在单个 PDF 中获得一个很好的文章索引。
pdf ×4
python ×4
pdfminer ×3
extract ×1
extraction ×1
font-size ×1
fonts ×1
formatting ×1
position ×1