Mic*_*ael -1 python database numpy web-scraping
我正在使用python和Beautiful Soup从网上抓取足球运动员统计数据.我将从多个来源进行搜索,每个源都会有各种各样的变量,包括字符串,整数和布尔值.例如球员姓名,职位选秀,职业选秀权(y/n).
最后,我想将这些数据放入数据挖掘工具或分析工具中,以便找到趋势.这需要是可搜索的,当我从不同顺序的新来源中搜索时,我需要能够将数据添加到玩家的信息中.
我应该使用哪些技术来存储数据,这样我才能最好地添加它并在以后进行分析?
使用分层方法:下载,解析,存储,分析.
分层.最重要的是,不要只下载数据,然后以最终解析的格式存储它.你将不可避免地意识到你错过了一些东西,需要再次抓住它.使用像requests+ 这样的东西requests_cache(我发现requests_cache.backends.BaseCache在文件系统上扩展和存储它比检测scped html更方便,而不是默认的sqlite存储后端).
为了解析你已经使用美味的汤,工作正常.
对于存储和分析,请使用数据库.避免使用NoSQL的诱惑 - 只要您需要运行聚合查询,您就会后悔.
| 归档时间: |
|
| 查看次数: |
1252 次 |
| 最近记录: |