Tay*_*lrl 5 apache-spark parquet pyspark
这与上面帖子中给出的答案不同
我收到一个错误,内容为
pyspark.sql.utils.AnalysisException: u'Unable to infer schema for Parquet. It must be specified manually.;'
Run Code Online (Sandbox Code Playgroud)
当我尝试使用 Spark 2.1.0 读取这样的镶木地板文件时
data = spark.read.parquet('/myhdfs/location/')
Run Code Online (Sandbox Code Playgroud)
我已经通过 Hue WebPortal 查看 impala 表进行了检查,发现文件/表不为空。此外,我存储在类似目录中的其他文件读取起来也绝对没问题。根据记录,文件名包含连字符,但不包含下划线或句号/句点。
因此,以下帖子中的所有答案均不适用 Unable to infer schema when loading Parquet file
有任何想法吗?
事实证明我收到此错误是因为目录结构还有另一个级别。以下是我所需要的;
data = spark.read.parquet('/myhdfs/location/anotherlevel/')
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
19005 次 |
| 最近记录: |