Gop*_*K M 5 random-forest apache-spark spark-streaming apache-spark-mllib
如何为实时交易数据设计架构以便将其归类为欺诈?
使用Scala和Spark MLLib使用历史数据开发,训练和测试随机森林分类器ML模型并持久化.
实时事务数据正在使用Apache Kafka从一个主题和Spark Streaming处理并写入另一个主题,以便通过分类器ML模型进行预测.
我关心的问题:我如何使用上面提到的ML模式提供并获得从Kafka主题收到的预测当前交易数据?
使用已经过培训和测试过的ML模型获取预测的在线当前单一交易数据的最佳做法是什么?
欢迎任何设计建议.
小智 1
您可以在训练后保存模型并在实时 api 中使用它进行预测。例如, https://databricks.gitbooks.io/databricks-spark-reference-applications/content/twitter_classifier/predict.html 另一种解决方案可能是使用sparkling-water并使用POJO:https: //github.com/h2oai /sparkling-water/tree/master/examples#step-by-step-through-weather-data-example
| 归档时间: |
|
| 查看次数: |
3353 次 |
| 最近记录: |