使用wget下载所有pdf文件

edd*_*ker 2 wget

我有以下网站http://www.asd.com.tr.我想将所有PDF文件下载到一个目录中.我尝试过几个命令,但运气不好.

$ wget --random-wait -r -l inf -nd -A pdf http://www.asd.com.tr/
Run Code Online (Sandbox Code Playgroud)

使用此代码,仅下载了四个PDF文件.查看此链接,有超过数千个可用的PDF:

例如,以下文件夹中有数百个文件:

但我无法弄清楚如何正确访问它们以查看和下载它们,这个子目录中有一些文件夹,http://www.asd.com.tr/Folders/,以及这些文件夹中的数千个PDF文件.

我试图使用-m命令镜像站点,但它也失败了.

还有什么建议吗?

Gil*_*not 8

首先,验证网站的TOS是否允许抓取它.然后,一个解决方案是:

mech-dump --links 'http://domain.com' |
    grep pdf$ |
    sed 's/\s+/%20/g' |
    xargs -I% wget http://domain.com/%
Run Code Online (Sandbox Code Playgroud)

mech-dump命令附带Perl的模块WWW::Mechanize(libwww-mechanize-perldebian和debian上的软件包喜欢发行版)