Ewa*_*ers 6 amazon-s3 amazon-web-services aws-glue
我正在使用AWS来转换一些JSON文件.我已将文件添加到S3的Glue中.我设置的作业在ok中读取文件,作业成功运行,有一个文件添加到正确的S3存储桶中.我遇到的问题是我无法命名文件 - 它被赋予一个随机名称,它也没有给出.JSON扩展名.
如何命名文件并将扩展名添加到输出中?
由于 Spark 工作方式的性质,无法命名文件。但是,之后可以立即重命名文件。
URI = sc._gateway.jvm.java.net.URI
Path = sc._gateway.jvm.org.apache.hadoop.fs.Path
FileSystem = sc._gateway.jvm.org.apache.hadoop.fs.FileSystem
fs = FileSystem.get(URI("s3://{bucket_name}"), sc._jsc.hadoopConfiguration())
file_path = "s3://{bucket_name}/processed/source={source_name}/year={partition_year}/week={partition_week}/"
df.coalesce(1).write.format("json").mode(
"overwrite").option("codec", "gzip").save(file_path)
# rename created file
created_file_path = fs.globStatus(Path(file_path + "part*.gz"))[0].getPath()
fs.rename(
created_file_path,
Path(file_path + "{desired_name}.jl.gz"))
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
1763 次 |
| 最近记录: |