如何增加 Apache Nutch 爬虫获取的文档数量

HMS*_*HMS 2 web-crawler nutch

我正在使用 Apache Nutch 2.3 进行爬行。开始时种子中有大约 200 个 url。现在,随着时间的推移,文档爬虫的数量将会减少或最多与开始时相同。

如何配置 Nutch 以便增加我抓取的文档?有没有什么参数可以控制文档数量?其次,如何统计每天抓取的文档数量?

m5k*_*han 5

一个抓取周期由四个步骤组成:生成、获取、解析和更新数据库。有关详细信息,请阅读我的回答

导致 URL 获取受限的原因可能有以下几个因素:

爬行周期数:

如果您只执行一个爬网周期,那么您将获得很少的结果,因为注入或播种到crawldb中的URL将首先被提取。在渐进式抓取周期中,您的crawldb将使用从先前获取的页面中提取的新URL进行更新。

最高N值:

正如这里这里提到的提到的,topN 值导致nutch 在每个周期获取有限数量的URL。如果您的 topN 值较小,您将获得较少的页面数。

生成最大计数

generate.max.count在您的 nutch 配置文件中,即nutch-default.xmlnutch-site.xml限制从单个域获取的 URL 数量,如此处所述


回答关于如何计算每天抓取的页面数的第二个问题。您可以做的就是读取日志文件。从那里您可以累积每天抓取的页面数量的信息。

在 nutch 1.x 中,日志文件在日志文件夹中生成NUTCH_HOME/logs/hadoop.log

您可以计算与日志中“获取”的日期和状态相关的行数,如下所示:

cat logs/hadoop.log | grep -i 2016-05-26.*fetching | wc -l