有谁知道 Python / PySpark 中的任何简单算法来检测 K 均值聚类中的异常值并创建这些异常值的列表或数据框?我不确定如何获得质心。我正在使用以下代码:
n_clusters = 10 kmeans = KMeans(k = n_clusters, seed = 0) model = kmeans.fit(Data.select("features"))
python outliers k-means apache-spark pyspark
apache-spark ×1
k-means ×1
outliers ×1
pyspark ×1
python ×1