如果能获得一些关于调整 Apache Spark 进行随机森林分类的技巧,那就太好了。 目前,我们有一个如下所示的模型:
我们将 Spark 1.5.1 作为独立集群运行。
当我们将树的数量增加到 500 棵时,已经需要 8 秒了。我们尝试减少深度,但错误率更高。我们大约有 246 个属性。
也许我们做错了什么。我们有什么想法可以提高性能吗?
machine-learning random-forest apache-spark
apache-spark ×1
machine-learning ×1
random-forest ×1