如何从 HTML 文档中提取术语

boo*_*sey 2 html regex sublime-text-2 macos

我有一个 HTML 文档,其中包含需要放入电子表格的术语。

他们遵循以下基本模式:

<ul>
     <li class="name"><a href="spot.html">Spot</a></li>
     <li class="type">Dog</li>
     <li class="color">Red</li>
</ul>
<ul>
     <li class="name"><a href="mittens.html">Mittens</a></li>
     <li class="type">Cat</li>
     <li class="color">Brown</li>
</ul>
<ul>
     <li class="name"><a href="squakers.html">Squakers</a></li>
     <li class="type">Little Parrot</li>
     <li class="color">Rainbow</li>
</ul>
Run Code Online (Sandbox Code Playgroud)

这是非常一致的。

我需要在中提取字符串li.name a(因此,“点”),但type是“狗”或“鹦鹉”,并把它们在电子表格中。

我一直在尝试使用 Sublime Text 的 regex 查找功能,但我真的很挣扎,而且由于 regex 和 HTML 通常不能很好地发挥作用,我想知道是否有更好、更简单的方法来实现这一点。谢谢。

Red*_*ick 7

不要使用 Regex 解析 XML 或 HTML,使用 XML 或 HTML 解析器。

另一种方法是将 XML 或 HTML 转换为文本,然后使用 grep

请参阅从文档中提取 XML 标签的应用程序
请参阅RedHat 上是否有用于解析 xml 文件的本机工具?
请参阅脚本:在 XML 文件的标记中提取值最简单的方法是什么?