小编DAV*_*ROA的帖子

如何使用Apache Spark读/写协议缓冲区消息?

我想使用Apache Spark从/向HDFS读取/写入协议缓冲区消息。我发现了以下建议的方法:

1)使用Google的Gson库将protobuf消息转换为Json,然后由SparkSql对其进行读写。该解决方案在此链接中进行了解释,但是我认为这样做(转换为json)是一项额外的任务。

2)转换为Parquet文件。有这样的parquet-mrsparksql-protobuf github项目,但是我不想要Parquet文件,因为我总是处理所有列(而不是某些列),并且Parquet Format不会给我带来任何收益(至少我认为)。

3)ScalaPB。可能正是我要找的东西。但是用斯卡拉语言我对此一无所知。我正在寻找基于Java的解决方案。此youtube视频介绍了scalaPB并说明了如何使用它(适用于scala开发人员)。

4)通过使用序列文件,这就是我想要的,但是对此一无所获。因此,我的问题是:如何将protobuf消息写到HDFS上的序列文件中?任何其他建议将是有用的。

5)通过推特的象鸟图书馆。

protocol-buffers hdfs sequencefile apache-spark

5
推荐指数
1
解决办法
2116
查看次数

Alluxio有/无HDFS

我有一个HDFS集群作为底层存储分布式文件系统,但我刚刚读到了关于alluxio的快速而灵活的内容.所以,我的问题是:我应该将Alluxio与HDFS一起使用,还是Alluxio可以替代HDFS?(我在他们的网站上看到,存储文件系统下的共享存储可以是网络文件系统(NFS).所以,我认为不需要HDFS.如果我犯了错误,请纠正我).

在哪种模式下性能更好:使用Alluxio或Alluxio stanalone的HDFS(我的意思是单独使用的术语是在群集中单独使用而不是在本地使用).

hadoop hdfs distributed-filesystem alluxio

1
推荐指数
1
解决办法
384
查看次数