HTML 到 UNFORMATTED 纯文本?

pat*_*ney 8 linux html

我正在寻找一种将充满 HTML 文件的文件夹转换为纯文本的方法。我想要的是文本文件尽可能多,就像我在网络浏览器中选择所有文本,复制它,然后将文本粘贴到纯文本文件中一样。

不,真的,我想要无格式的纯文本。我找到的所有解决方案都产生 Markdown 或类似的东西,或者试图保留布局,或者使用星号和下划线来指示文本格式,或者保留输出文件中脚本的内容,或者一些聪明的该死的东西.

我想要的只是作者写的文字,按照作者写的顺序。我什至不在乎处理是否将列表中的所有列表项转换为单个段落,或者甚至将整个文档折叠为单个段落。除了文档中包含的实际语言之外,任何这些都比给我任何东西要好得多。

我想要一个终端应用程序或 Python 脚本,但我会接受我能得到的任何东西。

NZD*_*NZD 5

使用w3m -dump <page.html>.

它将为您提供 html 文件的文本表示。

从手册页:

-dump  dump formatted page into stdout
Run Code Online (Sandbox Code Playgroud)

虽然 is say formatted,但输出只是纯文本。

  • 是的,使用像这样的旧 lynx 也可以实现同样的效果:lynx -dump -nolist -nomargins (3认同)
  • `lynx` 也支持 `-dump`。 (2认同)

kar*_*rel 4

html2text是一个 Python 脚本,可将 HTML 页面转换为等效的 Markdown 结构文本。html2text 可以在任何安装了 Python 的操作系统中下载并运行。html2text 程序位于许多 Linux 发行版的存储库中,可以像这样从命令行运行:

html2text -style pretty input.html  
Run Code Online (Sandbox Code Playgroud)

该命令不仅将原始 html 文件转换为文本,而且还很好地使纯文本输出易于阅读。标题看起来像标题,列表看起来像列表,等等。

如果您在自动将表格从网页转换为无格式文本时遇到问题,可以使用现代 Markdown 编辑器(例如适用于 Windows/Mac/Linux 的TyporaMark Text GUI 应用程序)轻松完成此操作。比较这两个应用程序,Mark Text 在准确捕获网页上的所有内容方面比 Typora 更好,而且 Typora 有一个更用户友好的编辑器,所以我使用这两个应用程序。我使用 Mark Text 作为网页抓取器,然后将捕获的 Markdown 文本复制/粘贴到 Typora 中并使用 Typora 进行编辑。