Ale*_*kov 5 machine-learning random-forest apache-spark
如果能获得一些关于调整 Apache Spark 进行随机森林分类的技巧,那就太好了。
目前,我们有一个如下所示的模型:
我们将 Spark 1.5.1 作为独立集群运行。
当我们将树的数量增加到 500 棵时,已经需要 8 秒了。我们尝试减少深度,但错误率更高。我们大约有 246 个属性。
也许我们做错了什么。我们有什么想法可以提高性能吗?
增加决策树的数量肯定会增加预测时间,因为问题实例必须遍历所有树。但减少它对预测准确性没有好处。您必须改变此参数(决策树的数量)并找到最佳值。这就是为什么它被称为超参数。超参数高度依赖于数据和属性的性质。您可能还需要一一改变其他超参数,并实现全局最优。
另外,当您说预测时间时,您是否也包括加载模型的时间!如果是这样,我想模型时间不应被视为预测时间。这只是加载模型和准备应用程序进行预测的开销。
| 归档时间: |
|
| 查看次数: |
2109 次 |
| 最近记录: |