小编Ale*_*kov的帖子

Apache Spark 随机森林性能缓慢

如果能获得一些关于调整 Apache Spark 进行随机森林分类的​​技巧,那就太好了。
目前,我们有一个如下所示的模型:

  • 特征子集策略全部
  • 杂质基尼
  • 最大Bins 32
  • 最大深度 11
  • 类数 2
  • 树数 100

我们将 Spark 1.5.1 作为独立集群运行。

  • 1 个主节点和 2 个工作节点。
  • 每个 4 核节点的 RAM 量为 32GB。
  • 分类耗时 440ms。

当我们将树的数量增加到 500 棵时,已经需要 8 秒了。我们尝试减少深度,但错误率更高。我们大约有 246 个属性。

也许我们做错了什么。我们有什么想法可以提高性能吗?

machine-learning random-forest apache-spark

5
推荐指数
1
解决办法
2109
查看次数