获取数组列的大小/长度

alu*_*990 13 scala apache-spark apache-spark-sql databricks

我是Scala编程的新手,这是我的问题:如何计算每行的字符串数量?我的Dataframe由一列Array [String]类型组成.

friendsDF: org.apache.spark.sql.DataFrame = [friends: array<string>]
Run Code Online (Sandbox Code Playgroud)

Psi*_*dom 27

你可以使用这个size功能:

val df = Seq((Array("a","b","c"), 2), (Array("a"), 4)).toDF("friends", "id")
// df: org.apache.spark.sql.DataFrame = [friends: array<string>, id: int]

df.select(size($"friends").as("no_of_friends")).show
+-------------+
|no_of_friends|
+-------------+   
|            3|
|            1|
+-------------+
Run Code Online (Sandbox Code Playgroud)

要添加为新列:

df.withColumn("no_of_friends", size($"friends")).show
+---------+---+-------------+
|  friends| id|no_of_friends|
+---------+---+-------------+
|[a, b, c]|  2|            3|
|      [a]|  4|            1|
+---------+---+-------------+
Run Code Online (Sandbox Code Playgroud)

  • 对于空数组,大小也是 1。 (3认同)
  • @aloplop85 不。空数组的大小为 0。像 `[""]` 这样的东西不是空的。 (2认同)