相关疑难解决方法(0)

我可以使用哪些算法来识别网页上的内容

我在浏览器中加载了一个网页(即我的DOM和元素定位都可以访问),我想找到块元素(或这些元素的排序列表),它们可能包含最多内容(如连续的文本块).目标是排除菜单,页眉,页脚等内容.

algorithm webpage html-content-extraction

9
推荐指数
1
解决办法
1383
查看次数