W.P*_*ill 5 amazon-s3 amazon-ec2 apache-spark
我想在EC2上运行Spark代码以防止存储在我的S3存储桶中的数据.根据Spark EC2文档和Amazon S3文档,我必须将我的AWS_ACCESS_KEY_ID和AWS_SECRET_ACCESS_KEY添加到core-site.xml文件中.但是,当我进入主EC2节点时,我会看到几个core-site.xml文件.
$ find . -name core-site.xml
./mapreduce/conf/core-site.xml
./persistent-hdfs/share/hadoop/templates/conf/core-site.xml
./persistent-hdfs/src/packages/templates/conf/core-site.xml
./persistent-hdfs/src/contrib/test/core-site.xml
./persistent-hdfs/src/test/core-site.xml
./persistent-hdfs/src/c++/libhdfs/tests/conf/core-site.xml
./persistent-hdfs/conf/core-site.xml
./ephemeral-hdfs/share/hadoop/templates/conf/core-site.xml
./ephemeral-hdfs/src/packages/templates/conf/core-site.xml
./ephemeral-hdfs/src/contrib/test/core-site.xml
./ephemeral-hdfs/src/test/core-site.xml
./ephemeral-hdfs/src/c++/libhdfs/tests/conf/core-site.xml
./ephemeral-hdfs/conf/core-site.xml
./spark-ec2/templates/root/mapreduce/conf/core-site.xml
./spark-ec2/templates/root/persistent-hdfs/conf/core-site.xml
./spark-ec2/templates/root/ephemeral-hdfs/conf/core-site.xml
./spark-ec2/templates/root/spark/conf/core-site.xml
./spark/conf/core-site.xml
Run Code Online (Sandbox Code Playgroud)
经过一些实验,我确定s3n://mcneill-scratch/GR.txt只有将我的凭据添加到mapreduce/conf/core-site.xml和spark/conf/core-site.xml ,我才能访问类似Spark 的s3n url .
这对我来说似乎不对.这不是DRY,我在文档中找不到任何说明你必须将你的凭证添加到多个文件的内容.
是否通过core-site.xml修改多个文件以设置s3凭据的正确方法?那里有文件可以解释这个吗?
| 归档时间: |
|
| 查看次数: |
747 次 |
| 最近记录: |