我有超过30,000个pdf文件.有些文件已经是OCR而有些则不是.有没有办法找出哪些文件已经OCR'd以及哪些pdf只是图像?
如果我通过OCR处理器运行每个文件,将永远需要.
我会编写一个小脚本来从 PDF 文件中提取文本并查看它是否为“空”。如果有文本,则 PDF 已被 ORed。您可以使用Ghostscript或XPDF来提取文本。
编辑:这应该让你开始:
foreach ($pdffile in get-childitem -filter *.pdf){
$pdftext=invoke-expression ("\path\to\xpdf\pdftotext.exe '"+$pdffile.fullname+"' -");
write-host $pdffile.fullname
write-host $pdftext.length;
write-host $pdftext;
write-host "-------------------------------";
}
Run Code Online (Sandbox Code Playgroud)
不幸的是,即使您的 PDF 中只有图像,pdftotext也会提取一些文本,因此您必须做更多的工作来检查是否需要 OCR pdf。