使用 Spark 访问 s3a 时出现 403 错误

Question

使用 Spark 访问 s3a 时出现 403 错误

Aje*_*040 6 hadoop amazon-s3 apache-spark pyspark

问题：

能够使用 AWS CLI 和 boto 3 成功下载文件。但是，在使用 Hadoop/Spark 的 S3A 连接器时，收到以下错误：

py4j.protocol.Py4JJavaError: An error occurred while calling o24.parquet.
: com.amazonaws.services.s3.model.AmazonS3Exception: Status Code: 403, AWS Service: Amazon S3, AWS Request ID: BCFFD14CB2939D68, AWS Error Code: null, AWS Error Message: Forbidden, S3 Extended Request ID: MfT8J6ZPlJccgHBXX+tX1fpX47V7dWCP3Dq+W9+IBUfUhsD4Nx+DcyqsbgbKsPn8NZzjc2U

Run Code Online (Sandbox Code Playgroud)

配置： 在我的本地机器上运行

火花版本 2.4.4
Hadoop 2.7 版

罐子补充道：

hadoop-aws-2.7.3.jar
aws-java-sdk-1.7.4.jar

Hadoop 配置：

hadoop_conf.set("fs.s3a.access.key", access_key)
hadoop_conf.set("fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem")
hadoop_conf.set("fs.s3a.secret.key", secret_key)
hadoop_conf.set("fs.s3a.aws.credentials.provider","org.apache.hadoop.fs.s3a.TemporaryAWSCredentialsProvider")
hadoop_conf.set("fs.s3a.session.token", session_key)
hadoop_conf.set("fs.s3a.endpoint", "s3-us-west-2.amazonaws.com") # yes, I am using central eu server.
hadoop_conf.set("com.amazonaws.services.s3.enableV4", "true")

Run Code Online (Sandbox Code Playgroud)

读取文件的代码：

from pyspark import SparkConf, SparkContext, SQLContext
sc = SparkContext.getOrCreate()
hadoop_conf=sc._jsc.hadoopConfiguration()
sqlContext = SQLContext(sc)
df = sqlContext.read.parquet(path)
print(df.head())

Run Code Online (Sandbox Code Playgroud)

Answer 1

小智 1

将 AWS 凭证提供程序设置为配置文件凭证：

hadoopConf.set("fs.s3a.aws.credentials.provider", "com.amazonaws.auth.profile.ProfileCredentialsProvider")

Run Code Online (Sandbox Code Playgroud)

归档时间：	6 年前
查看次数：	1672 次
最近记录：	5 年，5 月前