新手在这里与Hadoop.从概念上讲,理解起来非常简单,然而,真正的挑战之一是如何在map-reduce架构中对要解决的问题进行建模.假设我的数据包含两部分(全部在oracle中):1.相反静态数据不会发生太大变化2.每天收集的新数据.
目前数据处理基本上是读取新数据,查找并使用相应的静态数据(或元数据)并在其上应用一些算法并将其转储回Oracle.
我如何建模这样的应用范例?我是否将静态数据保存/存储为分布式缓存的一部分?如果那个数据很大怎么办?
基本上我正在寻找更多如下例子:http: //stevekrenzel.com/finding-friends-with-mapreduce
谢谢,
我会看一下下面关于 Map/Reduce 模式的文章,它应该能让您对常见算法及其在 Map/Reduce 世界中的翻译有一个很好的了解。
更一般地说,我不认为有一个神奇的公式可以将问题转化为一组 Map/Reduce,你必须问自己因数据集而异的问题,查看现有示例是一件好事,你绝对应该尝试在一个小玩具问题上实现一些东西。
此外,如果您在将问题抽象为一组 Map/Reduce 作业时遇到问题,您还可以使用 Hive,它的工作方式类似于关系数据库,只需进行一些调整,即可为您生成 Map/Reduce 作业,而无需过多担心会发生什么。