如何从网络浏览器中过滤掉匹配等.不是人类的命中...
我使用maxmind.com从IP请求城市..如果我必须支付所有点击数,包括网络浏览器,机器人等,这不是很便宜.
我正在使用html敏捷包来解析论坛网站的各个页面.因此,解析方法返回页面链接上的所有主题/线程链接,作为参数传递.我在一个集合中收集所有已解析页面的所有主题链接.
在那之后,我检查它们是否在我Dictionary已经查看的URL上,如果它们不是,那么我将它们添加到新列表中,UI显示此列表,这基本上是自上次创建的新主题/线程.
由于所有这些操作看起来都是独立的,因此最好的并行方法是什么?
我应该使用.NET 4.0 Parallel.For/ForEach吗?
无论哪种方式,我如何在一个集合中收集每个页面的结果?或者这不是必要的吗?
Dictionary每当解析方法完成时,我是否可以从我的集中式读取同时查看它们是否在那里?
如果我运行这个程序4000页,它需要90分钟,如果我可以使用我所有的8个核心在约10分钟内完成相同的任务将是很好的.
我正在开发一个项目,需要用Java设计一个Web爬虫,可以让用户查询特定的新闻主题,然后访问不同的新闻网站,然后从这些页面中提取新闻内容并将其存储在一些文件/数据库中.我需要这个来总结整个存储的内容.我是这个领域的新手,所以希望得到一些有经验的人的帮助.
现在我有了从单个页面中提取新闻内容的代码,该页面手动获取页面,但我不知道如何将其集成到Web爬虫中以从不同页面中提取内容.
任何人都可以提供一些很好的链接到Java的教程或实现,我可以根据我的需要使用或修改?
我想出一个面试问题,想了解您对此的看法。问题是,在设计网络爬虫时:
1)用DFS和BFS会打什么样的页面?
2)如何避免陷入无限循环?
我很高兴有人可以回答他们。