如何使用.NET RegEx解析HTML文件并找到1.外部链接.2.内部链接

Eyt*_*vit 0 c# regex web-crawler

我正在编写一个程序,可以帮助我找到链接到我的竞争对手的网站.

为了做到这一点,我正在编写一个解析HTML文件的程序,并将生成2个列表:内部链接和外部链接.

我将使用内部链接进一步抓取网站,外部链接实际上是我正在寻找的.

如何使用.NET RegEx解析HTML文件并找到1.外部链接.2.内部链接.

提前谢谢,Eytan Levit.

编辑:回答问题 - 不 - 我不一定是正则表达式,我可以使用任何其他想法.

Luk*_*keH 8

不要使用正则表达式.

使用专门用于解析HTML 的HTML Agility Pack.(在他们的CodePlex主页上甚至有一个例子,它可以找到页面中的所有链接.)