对于 python 中的 Spark,sc.parallelize()和collect()操作是否保持顺序?例如,如果我有一个元素列表x,将返回与?sc.parallelize(x).collect()完全相同的顺序的元素列表。x
我在哪里可以了解console.log的实现?要清楚,我知道如何使用console.log(),但我希望看到一些主要浏览器的console.log的底层实现.console.log只是将输入回送到屏幕的一部分吗?它是否在解析js时将记录的字符串保存到磁盘然后将其写回到屏幕?等等
在PySpark中是否有一种方法可以执行特征选择,但是保留或获取回原始特征索引/描述的映射?
例如:
CountVectorizer(col ="features")将它们转换为数字计数
.ChiSqSelector
以选择前1000个功能(col ="selectedFeatures").如何获取与前1000个特征相对应的原始特征字符串(或者甚至只是步骤#2中原始"特征"col中这些所选特征的相应索引)?
apache-spark apache-spark-sql pyspark apache-spark-ml apache-spark-mllib