AWS Glue 爬网程序需要从许多具有相同架构的文件中创建一张表

Dav*_*vid 5 amazon-athena aws-glue

我们在 S3 中有非常多的文件夹和文件,都在一个特定的文件夹下,我们想抓取所有 CSV 文件,然后从Athena 中的一张表中查询它们。CSV 文件都具有相同的架构。问题是爬虫为每个文件生成一个表,而不是一个表。爬虫配置有一个复选框选项“为每个 S3 路径创建一个模式”,但这似乎没有任何作用。

我需要的可能吗?谢谢。

The*_*heo 2

胶水爬虫号称能解决很多问题,但实际上解决的问题很少。如果你稍微超出了他们为你设计的范围,那你就不走运了。可能有一种方法可以将其配置为执行您想要的操作,但根据我的经验,尝试让 Glue 爬虫执行与其不完全一致的操作是不值得的。

\n\n

听起来您很清楚数据的架构是什么。在这种情况下,Glue 爬虫也提供很少的价值。您可能比 Glue 更清楚架构应该是什么样子。

\n\n

我建议您手动创建表,并编写一个一次性脚本,列出 S3 上您想要包含在表中的所有分区位置,并生成ALTER TABLE ADD PARTITION \xe2\x80\xa6SQL 或 Glue API 调用以将这些分区添加到表中。

\n\n

要在添加新分区位置时保持表最新,请查看此答案以获取指导:/sf/answers/3950760061/

\n