小编trp*_*trp的帖子

胶水爬虫爬红移表时Serde序列化lib为空

我试图创建一个爬行红移表的胶水爬虫。胶水爬虫执行成功并创建了一个外部表。但是当我查看表的元数据时,我发现了“输入格式”、“输出格式”、“Serde 名称”和“Serde 序列化库”为空。因此,当我尝试使用爬虫表从 Athena 或 spark 读取数据时,出现异常。以下是我使用 spark 读取表时遇到的异常。

Caused by: org.apache.hadoop.hive.ql.metadata.HiveException: Unable to fetch table redshift_table. StorageDescriptor#InputFormat cannot be null for table: redshift_table (Service: null; Status Code: 0; Error Code: null;Request ID: null)

以下是胶水爬虫表属性的屏幕截图。

Glue Crawler 表属性

请帮助我解决上述问题。

amazon-web-services amazon-redshift amazon-redshift-spectrum aws-glue

5
推荐指数
0
解决办法
925
查看次数

AWS 胶水增量加载

我有一个 S3 存储桶,每天都在其中转储文件。AWS 爬虫从这个位置爬取数据。在我的胶水作业运行的第一天,它会获取由 AWS 爬虫创建的表中存在的所有数据。例如,在第一天有三个文件。(即 file1.txt)。 txt,file2.txt,file3.txt) 和粘合作业在粘合作业执行的第一天处理这些文件。第二天,另外两个文件到达 S3 位置。现在在 S3 位置,这些是存在的文件。(即 file1 .txt,file2.txt,file3.txt,file4.txt,file5.txt。我能否以某种方式设计我的 AWS 爬虫,使其在作业执行的第二天只读取两个文件(file4.txt,file5 .txt)?否则我如何编写 AWS 粘合作业来识别这些增量文件?

amazon-web-services apache-spark aws-glue

4
推荐指数
1
解决办法
4267
查看次数

通过HADOOP进行XML解析

我有大量 WIKI 数据需要分析。这些转储基本上是 XML 文件。如何使用HADOOP MapReduce解析XML文件?

hadoop

1
推荐指数
1
解决办法
1万
查看次数