在 Spark hadoop 中移动/复制文件

ND *_*ser 2 apache-spark

我有一个包含许多文件的输入文件夹。我想对它们进行批量操作,例如将它们复制/移动到新路径。

我想使用 Spark 来做到这一点。

请帮助/建议如何进行此操作。

小智 5

val myfile = sc.textFile("file://file-path")如果它是本地目录,您可以使用读取它并使用 myfile.saveAsTextFile("new-location"). 也可以通过压缩链接保存到 ScalaDoc

spark会做的是读取所有文件,同时将它们保存到一个新位置,制作一批这些文件并将它们存储在新位置(HDFS/本地)。

确保在 Spark 集群的每个工作节点中都有相同的目录可用