小编MrG*_*Kat的帖子

为什么分区连接(随机播放)并不总是比广播连接更好?

我做了深入的研究,但我找不到足够详细的内容。我读过这些:1)http://www.cloudera.com/content/www/en-us/documentation/enterprise/latest/PDF /cloudera-impala.pdf 2)http://www.cidrdb.org/cidr2015/Papers/CIDR15_Paper28.pdf

但我没有找到任何答案..

有人可以解释一下为什么分区连接并不总是更好吗?我的意思是,如果我们有两个表 T1(大表)和 T2(小表),如果我使用分区策略,它们都会被分区,并且我们将 T1/n-1 子集发送到其他节点,T2 也是如此。另一方面,如果我选择广播,Impala 会将 T2*n-1 的数据发送给其他人。

也许我不明白这些策略是如何运作的..如果我错了,有人可以解释一下吗?也许用简单的画法?(我已经在谷歌图片上搜索过了..)

提前致谢

hadoop hive hdfs cloudera impala

2
推荐指数
1
解决办法
2414
查看次数

标签 统计

cloudera ×1

hadoop ×1

hdfs ×1

hive ×1

impala ×1