从HtmlCleaner获取文本中的清理HTML

Nay*_*ayn 7 html-parsing htmlcleaner

我想看看我们从HTMLCleaner获得的清理HTML.我看到在TagNode上有一个名为serialize的方法,但是不知道如何使用它.有人有任何示例代码吗?

谢谢Nayn

Rah*_*ani 7

这是示例代码:

HtmlCleaner htmlCleaner = new HtmlCleaner();

TagNode root = htmlCleaner.clean(url);

HtmlCleaner.getInnerHtml(root);

String html = "<" + root.getName() + ">" + htmlCleaner.getInnerHtml(root) + "</" + root.getName() + ">";
Run Code Online (Sandbox Code Playgroud)


lui*_*iss 6

使用子类org.htmlcleaner.XmlSerializer,例如:

// get the element you want to serialize
HtmlCleaner cleaner     = new HtmlCleaner();
TagNode     rootTagNode = cleaner.clean(url);

// set up properties for the serializer (optional, see online docs)
CleanerProperties cleanerProperties = cleaner.getProperties();
cleanerProperties.setOmitXmlDeclaration(true);

// use the getAsString method on an XmlSerializer class
XmlSerializer xmlSerializer = new PrettyXmlSerializer(cleanerProperties);
String        html          = xmlSerializer.getAsString(rootTagNode);
Run Code Online (Sandbox Code Playgroud)