写入 Hive 分区时 Spark 暂存目录竞争条件?

Ter*_*tyl 5 hive apache-spark apache-spark-sql

尝试将数据集写入配置单元表中的分区时,我看到间歇性异常。

Caused by: org.apache.hadoop.fs.FileAlreadyExistsException: /user/hive/warehouse/devl_fr9.db/fr9_ftdelivery_cpy_2_4d8eebd3_9691_47ce_8acc_b2a5123dabf6/.spark-staging-d996755c-eb81-4362-a393-31e8387104f0/date_id=20180604/part-00000-d996755c-eb81-4362-a393-31e8387104f0.c000.snappy.parquet for client 10.56.219.20 already exists

如果我检查 HDFS,相关路径不存在。我只能假设这是有关临时暂存文件的一些竞争条件。我使用的是 Spark 2.3

jmn*_*mng 1

出现此问题的一个可能原因是,在作业执行期间,任务开始向该文件写入数据并失败。

当任务失败时,Spark不会删除/清除它已经写入的数据(至少在2.3和2.4中得到确认)。因此,当不同的执行器尝试重新执行失败的任务时,它将尝试写入具有相同名称的文件,并且您将收到 FileAlreadyExistsException。

在您的情况下,已存在的文件名为part -00000 -d996755c-eb81-4362-a393-31e8387104f0.c000,因此stderr中可能有一条日志消息,指示任务00000由于失败而丢失,类似于

WARN TaskSetManager: Lost task **00000** in stage...
Run Code Online (Sandbox Code Playgroud)

如果您解决此失败的原因(可能是 OutOfMemoryError,如果问题是间歇性的),则 FileAlreadyExistsException 可能会得到解决,因为任务不会失败并留下临时文件。