小编syf*_*rce的帖子

Spark 3.1.2 的 hadoop-aws 和 aws-java-sdk 版本兼容性

为了在 EMR 6.5.0 上运行,我在使用 Scala 2.12.15hadoop-aws和Spark 3.1.2更新 Spark 项目时遇到了版本兼容性问题。aws-java-sdk-s3

我检查了EMR 发行说明,说明了这些版本:

  • 适用于 Java 的 AWS 开发工具包 v1.12.31
  • 火花v3.1.2
  • Hadoop v3.2.1

我目前在本地运行spark以确保上述版本的兼容性,并得到以下错误:

 java.lang.NoSuchFieldError: SERVICE_ID
    at com.amazonaws.services.s3.AmazonS3Client.createRequest(AmazonS3Client.java:4925)
    at com.amazonaws.services.s3.AmazonS3Client.createRequest(AmazonS3Client.java:4911)
    at com.amazonaws.services.s3.AmazonS3Client.headBucket(AmazonS3Client.java:1441)
    at com.amazonaws.services.s3.AmazonS3Client.doesBucketExist(AmazonS3Client.java:1381)
    at org.apache.hadoop.fs.s3a.S3AFileSystem.lambda$verifyBucketExists$1(S3AFileSystem.java:381)
    at org.apache.hadoop.fs.s3a.Invoker.once(Invoker.java:109)
    at org.apache.hadoop.fs.s3a.Invoker.lambda$retry$3(Invoker.java:265)
    at org.apache.hadoop.fs.s3a.Invoker.retryUntranslated(Invoker.java:322)
    at org.apache.hadoop.fs.s3a.Invoker.retry(Invoker.java:261)
    at org.apache.hadoop.fs.s3a.Invoker.retry(Invoker.java:236)
    at org.apache.hadoop.fs.s3a.S3AFileSystem.verifyBucketExists(S3AFileSystem.java:380)
    at org.apache.hadoop.fs.s3a.S3AFileSystem.initialize(S3AFileSystem.java:314)
    at org.apache.hadoop.fs.FileSystem.createFileSystem(FileSystem.java:3303)
    at org.apache.hadoop.fs.FileSystem.access$200(FileSystem.java:124)
    at org.apache.hadoop.fs.FileSystem$Cache.getInternal(FileSystem.java:3352)
    at org.apache.hadoop.fs.FileSystem$Cache.get(FileSystem.java:3320)
    at org.apache.hadoop.fs.FileSystem.get(FileSystem.java:479)
    at org.apache.hadoop.fs.Path.getFileSystem(Path.java:365)
    at org.apache.spark.sql.execution.streaming.FileStreamSink$.hasMetadata(FileStreamSink.scala:46)
Run Code Online (Sandbox Code Playgroud)

我还尝试检查aws-java-sdk hadoop-aws基于的版本。Hadoop-aws3.2.1 依赖于aws-java-sdk1.11.375,可以在此处找到

然而,这些版本会导致不同的错误:

 'org.apache.http.client.methods.HttpRequestBase com.amazonaws.http.HttpResponse.getHttpRequest()'
    at …
Run Code Online (Sandbox Code Playgroud)

hadoop amazon-web-services apache-spark aws-sdk

5
推荐指数
1
解决办法
1万
查看次数