小编Rak*_*rma的帖子

Scikit DBSCAN eps和min_sample值确定

我一直在尝试使用scikit实现DBSCAN,但到目前为止,我无法确定epsilon和min_sample的值,这将给我带来相当数量的集群。我尝试在距离矩阵中找到平均值,并在均值的任一侧使用了值,但没有令人满意的聚类数:

输入:

db=DBSCAN(eps=13.0,min_samples=100).fit(X)
labels = db.labels_

# Number of clusters in labels, ignoring noise if present.
n_clusters_ = len(set(labels)) - (1 if -1 in labels else 0)
print('Estimated number of clusters: %d' % n_clusters_)
Run Code Online (Sandbox Code Playgroud)

输出:

Estimated number of clusters: 1
Run Code Online (Sandbox Code Playgroud)

输入:

db=DBSCAN(eps=27.0,min_samples=100).fit(X)
Run Code Online (Sandbox Code Playgroud)

输出:

Estimated number of clusters: 1
Run Code Online (Sandbox Code Playgroud)

其他信息也是如此:

The average distance between any 2 points in the distance matrix is 16.8354
the min distance is 1.0
the max distance is 258.653
Run Code Online (Sandbox Code Playgroud)

同样,在代码中传递的X也不是距离矩阵,而是特征向量的矩阵。所以请告诉我如何确定这些参数

python cluster-analysis dbscan scikit-learn

3
推荐指数
1
解决办法
6142
查看次数

用于存储CDN使用的静态文件的AWS服务

以下哪种AWS服务更适合存储经常访问的CDN使用的静态文件?

EC2 S3 Glacier ElastiCache RDS

amazon-web-services

0
推荐指数
1
解决办法
2260
查看次数