我有以下网站http://www.asd.com.tr.我想将所有PDF文件下载到一个目录中.我尝试过几个命令,但运气不好.
$ wget --random-wait -r -l inf -nd -A pdf http://www.asd.com.tr/
Run Code Online (Sandbox Code Playgroud)
使用此代码,仅下载了四个PDF文件.查看此链接,有超过数千个可用的PDF:
例如,以下文件夹中有数百个文件:
但我无法弄清楚如何正确访问它们以查看和下载它们,这个子目录中有一些文件夹,http://www.asd.com.tr/Folders/,以及这些文件夹中的数千个PDF文件.
我试图使用-m命令镜像站点,但它也失败了.
还有什么建议吗?
首先,验证网站的TOS是否允许抓取它.然后,一个解决方案是:
mech-dump --links 'http://domain.com' |
grep pdf$ |
sed 's/\s+/%20/g' |
xargs -I% wget http://domain.com/%
Run Code Online (Sandbox Code Playgroud)
该mech-dump命令附带Perl的模块WWW::Mechanize(libwww-mechanize-perldebian和debian上的软件包喜欢发行版)