Ger*_*os 6 configuration hadoop amazon-web-services apache-spark
我将 AWS Glue 与 pySpark 结合使用,并希望在 SparkSession 中添加一些配置,例如'"spark.hadoop.fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem"、spark.hadoop.fs.s3a.multiobjectdelete.enable","false"、"spark.serializer", "org.apache.spark.serializer.KryoSerializer"、"spark.hadoop.fs.s3a.fast.upload","true"。我用来初始化上下文的代码如下:
glueContext = GlueContext(SparkContext.getOrCreate())
spark = glueContext.spark_session
Run Code Online (Sandbox Code Playgroud)
据我从文档中了解到,我应该在提交粘合作业时将这些配置添加为作业参数。是这样还是可以在初始化火花时添加它们?
这似乎没有出错 - 不确定它是否有效
hadoop_conf = spark.sparkContext._jsc.hadoopConfiguration()
hadoop_conf.set("spark.hadoop.fs.s3.maxRetries", "20")
hadoop_conf.set("spark.hadoop.fs.s3.consistent.retryPolicyType", "exponential")
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
5943 次 |
| 最近记录: |