如何识别需要OCR的PDF文件?

Fuj*_*H2O 7 pdf ocr

我有超过30,000个pdf文件.有些文件已经是OCR而有些则不是.有没有办法找出哪些文件已经OCR'd以及哪些pdf只是图像?

如果我通过OCR处理器运行每个文件,将永远需要.

Oca*_*tal 6

我会编写一个小脚本来从 PDF 文件中提取文本并查看它是否为“空”。如果有文本,则 PDF 已被 ORed。您可以使用Ghostscript或XPDF来提取文本。

编辑:这应该让你开始:

foreach ($pdffile in get-childitem -filter *.pdf){
    $pdftext=invoke-expression ("\path\to\xpdf\pdftotext.exe '"+$pdffile.fullname+"' -");
    write-host $pdffile.fullname
    write-host $pdftext.length;
    write-host $pdftext;
    write-host "-------------------------------";
}
Run Code Online (Sandbox Code Playgroud)

不幸的是,即使您的 PDF 中只有图像,pdftotext也会提取一些文本,因此您必须做更多的工作来检查是否需要 OCR pdf。