相关疑难解决方法(0)

处理Spark中的大型gzip压缩文件

我有一个来自s3的大型(大约85 GB压缩)gzip压缩文件,我正在尝试使用AWS EMR上的Spark处理(现在有一个m4.xlarge主实例和两个m4.10xlarge核心实例,每个实例都有一个100 GB的EBS卷) .我知道gzip是一种不可拆分的文件格式, 看到 建议应该重新分区压缩文件,因为Spark最初给出了一个带有一个分区的RDD.但是,做完之后

scala> val raw = spark.read.format("com.databricks.spark.csv").
     | options(Map("delimiter" -> "\\t", "codec" -> "org.apache.hadoop.io.compress.GzipCodec")).
     | load("s3://path/to/file.gz").
     | repartition(sc.defaultParallelism * 3)
raw: org.apache.spark.sql.Dataset[org.apache.spark.sql.Row] = [_c0: string, _c1: string ... 48 more fields
scala> raw.count()
Run Code Online (Sandbox Code Playgroud)

并且看一下Spark应用程序UI,我仍然看到只有一个活动执行程序(其他14个已经死了)有一个任务,并且作业永远不会完成(或者至少我没有等待足够长的时间).

  • 这里发生了什么?有人可以帮我理解Spark在这个例子中是如何工作的吗?
  • 我应该使用不同的群集配置吗?
  • 不幸的是,我无法控制压缩模式,但有没有其他方法来处理这样的文件?

gzip amazon-emr apache-spark

9
推荐指数
2
解决办法
8785
查看次数

标签 统计

amazon-emr ×1

apache-spark ×1

gzip ×1