相关疑难解决方法(0)

我需要匹配所有这些开始标记:

<p>
<a href="foo">

但不是这些:

<br />
<hr class="foo" />

我想出了这个,并希望确保我做对了.我只抓住了a-z.

<([a-z]+) *[^/]*?>

我相信它说:

我有这个权利吗？更重要的是,你怎么看？

1323
推荐指数

36
解决办法

270万
查看次数

我正在做一些网页抓取,网站经常使用HTML实体来表示非ascii字符.Python是否有一个实用程序,它接受带有HTML实体的字符串并返回unicode类型？

例如:

我回来了:

&#x01ce;

代表带有音标的"ǎ".在二进制中,这表示为16位01ce.我想将html实体转换为值 u'\u01ce'

69
推荐指数

7
解决办法

6万
查看次数