nma*_*mac 1 python terminal ubuntu recursion pdfbox
我正在解决一个需要从pdf提取文本的问题。我正在使用pdfbox来这样做。因此,我在终端(linux ubuntu)中运行以下命令:
java -jar pdfbox-app-1.8.7.jar ExtractText [path leading to file here]
Run Code Online (Sandbox Code Playgroud)
一切正常。但是,我想对特定目录中的数千个文件进行递归操作,因此不必每次都手动插入pdf路径。我会很感激任何来自终端或脚本的解决方案。
使用find命令:
find /path/to/directory -type f -exec java -jar pdfbox-app-1.8.7.jar ExtractText {} \;
Run Code Online (Sandbox Code Playgroud)