如何解析HTML/XML并从中提取信息?
(http([s]?):\/\/?)(([a-zA-Z0-9]+(\.?))+)([a-zA-Z0-9]+((\.[a-zA-Z]{2,5}){1,2})((\/[a-zA-Z0-9\?&=_\-\~:/?#[\]@!\$&'()\*\+,;]*)*)((\.[a-zA-Z]{2,5}){0,2}))
Run Code Online (Sandbox Code Playgroud)
这是我的正则表达式,它适用于匹配字符串中的链接.但我不希望它选择每个链接.如果链接">在它之前或</a>之后,则不应该对该链接进行数学运算.怎么做到呢?
这些应该匹配:
adasdas http://www.stackoverflow.com asdasas
adasdasahttp://www.stackoverflow.com/something asdas
Run Code Online (Sandbox Code Playgroud)
这些不应该匹配:
adasdas<a href="somelink"> http://www.stackoverflow.com </a>asdasas
adasdasa<a href="somelink">http://www.stackoverflow.com/something</a> asdas
Run Code Online (Sandbox Code Playgroud)
为什么我需要这个?:我希望每个链接都是可点击的,即使它不在锚标签之间.