Ale*_*x B 2 html python string unicode replace
我有一个强大的功能,我从XML文件中删除它,它包含一些HTML格式标记
(<b>, <i>, etc)
Run Code Online (Sandbox Code Playgroud)
有没有一种快速简便的方法从文本中删除所有这些标签?
我试过了
str = str.replace("<b>","")
Run Code Online (Sandbox Code Playgroud)
并将其多次应用于其他标签,但这不起作用
使用lxml.html:
lxml.html.fromstring(s).text_content()
Run Code Online (Sandbox Code Playgroud)
这将剥离所有标记并将所有实体转换为其对应的字符.