jom*_*web 8 bash shell-script pdf
我正在尝试预处理大量 PDF 文件,其中许多实际上不是文本而是图像,以便将它们移动到适当的位置进行 OCR 处理。
问题是我试图在 OCR 之前检测 PDF 是否基于图像,但到目前为止没有成功。使用“ pdffonts filename”应该是正确的方法,但只有图像的 PDF 也有字体!
pdfimages -list filename.pdf
Run Code Online (Sandbox Code Playgroud)
应该做到这一点。这将为您提供 PDF 文件中包含的图像列表。