下载整个网站 wget

Phi*_*ene 9 linux download wget arch-linux

我正在尝试使用下载网站http://julesverne.ca/wget的全部内容。我正在运行以下命令:

wget --wait 20 --limit-rate=20K --recursive --no-clobber --page-requisites --convert-links --domains julesverne.ca http://julesverne.ca/
Run Code Online (Sandbox Code Playgroud)

问题是:当我运行上述命令时,wget仅下载julesverne.ca/index.html. 而已。

我怎样才能获得整个网站?

Mad*_*ala 17

尝试

wget -mpEk "url"
Run Code Online (Sandbox Code Playgroud)

首选使用-m(mirror) 而不是,-r因为它可以直观地下载资源,并且您不必指定递归深度,使用镜像通常会确定返回正常运行站点的正确深度。

这些命令-p -E -k确保您不会下载可能链接到的整个页面(例如,链接到 Twitter 个人资料会导致您下载 Twitter 代码),同时包含站点所需的所有先决文件(JavaScript、CSS 等)。正确的站点结构也被保留(而不是一个带有嵌入脚本/样式表的大 .html 文件,有时可以作为输出。

它速度很快,我从来不需要限制任何东西来让它工作,并且生成的目录看起来比简单地使用-r“url”参数更好,并且可以更好地了解网站是如何组合在一起的,特别是当您进行逆向工程时教育目的。

请注意,如果您下载的 Web 应用程序或网站包含大量从 TypeScript 编译而来的 JavaScript,您将无法获取最初使用的 TypeScript,只能获取编译并发送到浏览器的内容。如果网站的脚本量很大,请考虑这一点。

或者使用httrack

httrack --ext-depth=1 "url"
Run Code Online (Sandbox Code Playgroud)