相关疑难解决方法(0)

管理木偶手的内存和性能

我正在使用puppeteer抓取一些页面,但是我很好奇如何在生产中为节点应用程序管理此页面。我一天最多要抓取500,000页,但是这些抓取作业将以随机的间隔发生,因此我无法耕种一个队列。

我想知道的是,打开浏览器,转到页面,然后在每个作业之间关闭浏览器会更好吗?我以为会慢很多,但也许可以更好地处理内存?

还是在应用启动时打开一个全局浏览器,然后转到页面,并用某种方法转储该页面(例如,关闭chrome中的所有标签,而不关闭chrome),然后在需要时重新打开一个新页面?这样看来会更快,但可能会消耗大量内存。

我从来没有使用过这个库,尤其是在生产环境中,所以我不确定是否需要注意。

node.js web-scraping puppeteer

7
推荐指数
3
解决办法
5423
查看次数

标签 统计

node.js ×1

puppeteer ×1

web-scraping ×1