pyspark.sql.utils.AnalysisException:u'无法推断 Parquet 的架构。必须手动指定。;'

Tay*_*lrl 5 apache-spark parquet pyspark

这与上面帖子中给出的答案不同

我收到一个错误,内容为

pyspark.sql.utils.AnalysisException: u'Unable to infer schema for Parquet. It must be specified manually.;'
Run Code Online (Sandbox Code Playgroud)

当我尝试使用 Spark 2.1.0 读取这样的镶木地板文件时

data = spark.read.parquet('/myhdfs/location/')
Run Code Online (Sandbox Code Playgroud)

我已经通过 Hue WebPortal 查看 impala 表进行了检查,发现文件/表不为空。此外,我存储在类似目录中的其他文件读取起来也绝对没问题。根据记录,文件名包含连字符,但不包含下划线或句号/句点。

因此,以下帖子中的所有答案均不适用 Unable to infer schema when loading Parquet file

有任何想法吗?

Tay*_*lrl 6

事实证明我收到此错误是因为目录结构还有另一个级别。以下是我所需要的;

data = spark.read.parquet('/myhdfs/location/anotherlevel/')
Run Code Online (Sandbox Code Playgroud)