mac*_*ner 6 scala random-forest apache-spark apache-spark-mllib
我使用Spark 1.5.0 MLlib Random Forest算法(scala代码)来做两类分类.由于我使用的数据集非常不平衡,因此大多数类以10%的采样率进行下采样.在Spark随机森林培训中是否可以使用采样权重(在这种情况下为10)?我没有看到trainClassifier()随机森林中输入参数的权重.我也在stackoverflow中进行了搜索,但在这个主题上找不到任何问题.非常感谢你的帮助!
Spark 1.5 中完全没有,Spark 1.6 中只有部分(Logistic/LinearRegression)
https://issues.apache.org/jira/browse/SPARK-7685
这是跟踪所有子任务的 JIRA 伞
https://issues.apache.org/jira/browse/SPARK-9610