在 Spark 中堆叠 ML 算法

Odi*_*seo 2 python apache-spark ensemble-learning pyspark apache-spark-mllib

是否有 Spark api 可以在 Spark 中构建堆叠集成,或者应该从头开始构建它们?我还没有\xe2\x80\x99t 在网上找到任何有关此主题的资源

\n

小智 5

正如 AKSW 的评论中所述,在当前的 Apache Spark MLlib 中,集成模型只有两种具体实现,即用于Bagging的随机森林和用于 Boosting 的梯度提升树

对于堆叠部分,我认为您在 MLlib 上找不到任何东西,您必须通过以下任一方式自己完成:

  1. 创建一个函数来生成一个管道,通过使用向量汇编器和最终的堆叠算法添加基础学习器来进行堆叠
  2. 创建一个元估计器,它将您的基础学习器和堆叠算法作为参数

第二个很方便,因为它可以与所有 MLlib 工具一起用作调优工具

对于第二个解决方案,我创建了一个包含 Boosting、Bagging 和 Stacking Meta-Estimators 的库:spark-ensemble

您可以从中汲取一些实现想法!