使用Spark Streaming和机器学习实时预测在线数据

Gop*_*K M 5 random-forest apache-spark spark-streaming apache-spark-mllib

如何为实时交易数据设计架构以便将其归类为欺诈?

使用Scala和Spark MLLib使用历史数据开发,训练和测试随机森林分类器ML模型并持久化.

实时事务数据正在使用Apache Kafka从一个主题和Spark Streaming处理并写入另一个主题,以便通过分类器ML模型进行预测.

我关心的问题:我如何使用上面提到的ML模式提供并获得从Kafka主题收到的预测当前交易数据

使用已经过培训和测试过的ML模型获取预测的在线当前单一交易数据的最佳做法是什么?

欢迎任何设计建议.

小智 1

您可以在训练后保存模型并在实时 api 中使用它进行预测。例如, https://databricks.gitbooks.io/databricks-spark-reference-applications/content/twitter_classifier/predict.html 另一种解决方案可能是使用sparkling-water并使用POJO:https: //github.com/h2oai /sparkling-water/tree/master/examples#step-by-step-through-weather-data-example