在 awsglue pyspark 中设置 Spark 配置

Ger*_*os 6 configuration hadoop amazon-web-services apache-spark

我将 AWS Glue 与 pySpark 结合使用,并希望在 SparkSession 中添加一些配置,例如'"spark.hadoop.fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem"、spark.hadoop.fs.s3a.multiobjectdelete.enable","false"、"spark.serializer", "org.apache.spark.serializer.KryoSerializer"、"spark.hadoop.fs.s3a.fast.upload","true"。我用来初始化上下文的代码如下:

glueContext = GlueContext(SparkContext.getOrCreate())
spark = glueContext.spark_session
Run Code Online (Sandbox Code Playgroud)

据我从文档中了解到,我应该在提交粘合作业时将这些配置添加为作业参数。是这样还是可以在初始化火花时添加它们?

tam*_*ama 3

这似乎没有出错 - 不确定它是否有效

hadoop_conf = spark.sparkContext._jsc.hadoopConfiguration()
hadoop_conf.set("spark.hadoop.fs.s3.maxRetries", "20")
hadoop_conf.set("spark.hadoop.fs.s3.consistent.retryPolicyType", "exponential")
Run Code Online (Sandbox Code Playgroud)