从Python中的unicode字符串中删除HTML标记

Ale*_*x B 2 html python string unicode replace

我有一个强大的功能,我从XML文件中删除它,它包含一些HTML格式标记

(<b>, <i>, etc)
Run Code Online (Sandbox Code Playgroud)

有没有一种快速简便的方法从文本中删除所有这些标签?

我试过了

str = str.replace("<b>","")
Run Code Online (Sandbox Code Playgroud)

并将其多次应用于其他标签,但这不起作用

lun*_*orn 5

使用lxml.html:

lxml.html.fromstring(s).text_content()
Run Code Online (Sandbox Code Playgroud)

这将剥离所有标记并将所有实体转换为其对应的字符.