通过wget命令抓取sitemap.xml的链接

doh*_*omi 8 wget web-crawler sitemap.xml

我尝试抓取sitemap.xml的所有链接以重新缓存网站.但是wget的递归选项不起作用,我只得到回应:

远程文件存在但不包含任何链接 - 不检索.

但是,确保sitemap.xml充满了"http:// ..."链接.

我几乎尝试了wget的所有选项,但没有任何对我有用:

wget -r --mirror http://mysite.com/sitemap.xml
Run Code Online (Sandbox Code Playgroud)

有谁知道如何打开网站sitemap.xml内的所有链接?

谢谢,多米尼克

小智 12

似乎wget无法解析XML.因此,您必须手动提取链接.你可以这样做:

wget --quiet http://www.mysite.com/sitemap.xml --output-document - | egrep -o "https?://[^<]+" | wget -i -
Run Code Online (Sandbox Code Playgroud)

在这里学到了这个技巧.

  • 如何将每个下载的 html 文件名设置为页面标题?现在一切都只是index.html、index.html.1、index.html.2等 (2认同)