使用wget但忽略url参数

coo*_*tje 12 linux wget

我想下载构建URL的网站的内容

http://www.example.com/level1/level2?option1=1&option2=2

在URL中,只有http://www.example.com/level1/level2对于每个页面都是唯一的,并且option1和option2的值正在变化.实际上,由于这些变量,每个唯一页面都可以有数百种不同的符号.我正在使用wget来获取所有网站的内容.由于这个问题,我已经下载了超过3GB的数据.有没有办法告诉wget忽略URL问号背后的一切?我在手册页中找不到它.

ken*_*orb 16

您可以使用--reject-regex指定模式来拒绝特定的URL地址,例如

wget --reject-regex "(.*)\?(.*)" -m -c --content-disposition http://example.com/
Run Code Online (Sandbox Code Playgroud)

这将反映网站,但它会忽略带问号的地址 - 对镜像维基站点很有用.


Jan*_*neš 5

wget2--cut-url-get-vars通过选项和内置了此功能--cut-file-get-vars