有没有人可以通过示例帮助我理解DataSet API和DataFrame API之间的区别?为什么需要在Spark中引入DataSet API?
从spark 2.0.1开始我有一些问题.我阅读了很多文档,但到目前为止找不到足够的答案:
df.select("foo")df.select($"foo")myDataSet.map(foo.someVal)是类型安全的,不会转换为RDD但保留在DataSet表示/没有额外的开销(2.0.0的性能明智)df.select("foo")没有地图声明,我怎么能输入?
scala apache-spark apache-spark-sql apache-spark-dataset apache-spark-2.0
我正在尝试使用Spark 数据集 API但我在进行简单连接时遇到了一些问题.
假设我有两个带有字段的数据集:date | value,然后在DataFrame我的连接的情况下看起来像:
val dfA : DataFrame
val dfB : DataFrame
dfA.join(dfB, dfB("date") === dfA("date") )
Run Code Online (Sandbox Code Playgroud)
但是,Dataset有.joinWith方法,但相同的方法不起作用:
val dfA : Dataset
val dfB : Dataset
dfA.joinWith(dfB, ? )
Run Code Online (Sandbox Code Playgroud)
需要什么论点.joinWith?