Nei*_*gan 3 .net xpath html-parsing
我在一个文件夹中有大约 5000 个 html 文件。我需要遍历它们,打开,使用 xpath 抓取说 10 个值,关闭并存储在(SQL Server)数据库中。
使用 .Net 读取 xpath 值的最简单方法是什么?
xpaths 应该非常稳定。
请提供示例代码以读取一个值,例如 /html/head/title/text()
谢谢
我认为您应该查看HTML Agility Pack。它是一个 HTML 解析器而不是一个 XML 解析器,更适合这个任务。如果有任何与正在解析的 XML 不一致的内容,那么解析器将抛出异常。使用 HTML 解析器可以为您提供更多的输入文件余地。
显示如何使用所有 HREF(链接)属性执行某些操作的示例:
HtmlDocument doc = new HtmlDocument();
doc.Load("file.htm");
foreach(HtmlNode link in doc.DocumentElement.SelectNodes("//a[@href"])
{
HtmlAttribute att = link["href"];
att.Value = FixLink(att);
}
Run Code Online (Sandbox Code Playgroud)
我不在编译器附近,但您想要的示例类似于:
string title = doc.DocumentNode.SelectSingleNode("//title").InnerText;
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
1061 次 |
| 最近记录: |