在Python中存储刮取数据以进行分析的最佳方法

Mic*_*ael -1 python database numpy web-scraping

我正在使用python和Beautiful Soup从网上抓取足球运动员统计数据.我将从多个来源进行搜索,每个源都会有各种各样的变量,包括字符串,整数和布尔值.例如球员姓名,职位选秀,职业选秀权(y/n).

最后,我想将这些数据放入数据挖掘工具或分析工具中,以便找到趋势.这需要是可搜索的,当我从不同顺序的新来源中搜索时,我需要能够将数据添加到玩家的信息中.

我应该使用哪些技术来存储数据,这样我才能最好地添加它并在以后进行分析?

Lev*_*evi 5

使用分层方法:下载,解析,存储,分析.

分层.最重要的是,不要只下载数据,然后以最终解析的格式存储它.你将不可避免地意识到你错过了一些东西,需要再次抓住它.使用像requests+ 这样的东西requests_cache(我发现requests_cache.backends.BaseCache在文件系统上扩展和存储它比检测scped html更方便,而不是默认的sqlite存储后端).

为了解析你已经使用美味的汤,工作正常.

对于存储和分析,请使用数据库.避免使用NoSQL的诱惑 - 只要您需要运行聚合查询,您就会后悔.