有人可以帮我解决Spark DataFrame中的这个问题吗?
当我这样做时,myFloatRDD.toDF()我收到一个错误:
TypeError:无法推断类型的模式:类型'float'
我不明白为什么......
例:
myFloatRdd = sc.parallelize([1.0,2.0,3.0])
df = myFloatRdd.toDF()
Run Code Online (Sandbox Code Playgroud)
谢谢
我想将两个列表转换为pyspark数据框,其中列表分别是列。
我试过了
a=[1, 2, 3, 4]
b=[2, 3, 4, 5]
sqlContext.createDataFrame([a, b], schema=['a', 'b']).show()
Run Code Online (Sandbox Code Playgroud)
但是我得到了
+---+---+---+---+
| a| b| _3| _4|
+---+---+---+---+
| 1| 2| 3| 4|
| 2| 3| 4| 5|
+---+---+---+---+
Run Code Online (Sandbox Code Playgroud)
我真正想要的是:
+---+---+
| a| b|
+---+---+
| 1| 2|
| 2| 3|
| 3| 4|
| 4| 5|
+---+---+
Run Code Online (Sandbox Code Playgroud)
是否有方便的方法来创建此结果?