我想下载构建URL的网站的内容
http://www.example.com/level1/level2?option1=1&option2=2
在URL中,只有http://www.example.com/level1/level2对于每个页面都是唯一的,并且option1和option2的值正在变化.实际上,由于这些变量,每个唯一页面都可以有数百种不同的符号.我正在使用wget来获取所有网站的内容.由于这个问题,我已经下载了超过3GB的数据.有没有办法告诉wget忽略URL问号背后的一切?我在手册页中找不到它.
ken*_*orb 16
您可以使用--reject-regex指定模式来拒绝特定的URL地址,例如
wget --reject-regex "(.*)\?(.*)" -m -c --content-disposition http://example.com/
Run Code Online (Sandbox Code Playgroud)
这将反映网站,但它会忽略带问号的地址 - 对镜像维基站点很有用.
| 归档时间: |
|
| 查看次数: |
5145 次 |
| 最近记录: |