标签: bigdata

DELETE在另一个表中没有匹配的记录

有两个表由id链接:

item_tbl (id)
link_tbl (item_id)
Run Code Online (Sandbox Code Playgroud)

有些记录中item_tbl没有匹配的行link_tbl.一个可以计算其金额的选择将是:

SELECT COUNT(*)
FROM link_tbl lnk LEFT JOIN item_tbl itm ON lnk.item_id=itm.id
WHERE itm.id IS NULL
Run Code Online (Sandbox Code Playgroud)

我想删除那些孤儿记录(那些在其他表中没有匹配的记录),link_tbl但我能想到的唯一方法是:

DELETE FROM link_tbl lnk
WHERE lnk.item_id NOT IN (SELECT itm.id FROM item_tbl itm)
Run Code Online (Sandbox Code Playgroud)

2003年的16,844,347个孤儿记录中有
3,033,811个记录的link_tbl
262,086,253条记录. 服务器有4GB RAM和8核CPU.item_tbl
link_tbl

EXPLAIN DELETE FROM link_tbl lnk
WHERE lnk.item_id NOT IN (SELECT itm.id FROM item_tbl itm)
Run Code Online (Sandbox Code Playgroud)

返回:

Delete on link lnk  (cost=0.00..11395249378057.98 rows=131045918 width=6)
->  Seq Scan …
Run Code Online (Sandbox Code Playgroud)

sql postgresql exists bigdata sql-delete

15
推荐指数
3
解决办法
4万
查看次数

Hadoop中Sort Comparator和Group Comparator之间有什么区别?

Hadoop中Sort ComparatorGroup Comparator之间有什么区别?

hadoop bigdata

15
推荐指数
2
解决办法
1万
查看次数

如何使用Apache Spark计算精确中位数?

页面包含一些统计函数(均值,stdev,方差等),但不包含中位数.如何计算准确的中位数?

谢谢

hadoop scala bigdata apache-spark

15
推荐指数
2
解决办法
1万
查看次数

如何将数据从一个HDFS复制到另一个HDFS?

我有两个HDFS设置,并希望将一些表从HDFS1复制(不迁移或移动)到HDFS2.如何将数据从一个HDFS复制到另一个HDFS?是否可以通过Sqoop或其他命令行?

hadoop bigdata hdfs sqoop

15
推荐指数
3
解决办法
8万
查看次数

使用 R 解决 Lucky 26 游戏

我试图向我的儿子展示如何使用编码来解决游戏带来的问题,以及了解 R 如何处理大数据。有问题的游戏被称为“幸运26”。在这个游戏中,数字(1-12 没有重复)位于大卫之星上的 12 个点上(6 个顶点,6 个交点),4 个数字的 6 行必须全部加起来为 26。在大约 4.79 亿种可能性中(12P12 ) 显然有 144 个解决方案。我尝试在 R 中编写如下代码,但内存似乎是一个问题。如果成员有时间,我将不胜感激任何建议以推进答案。提前感谢会员。

library(gtools)

x=c()
elements <- 12
for (i in 1:elements)
{ 
    x[i]<-i
}

soln=c()            

y<-permutations(n=elements,r=elements,v=x)  
j<-nrow(y)
for (i in 1:j) 
{
L1 <- y[i,1] + y[i,3] + y[i,6] + y[i,8]
L2 <- y[i,1] + y[i,4] + y[i,7] + y[i,11]
L3 <- y[i,8] + y[i,9] + y[i,10] + y[i,11]
L4 <- y[i,2] + y[i,3] + y[i,4] + y[i,5]
L5 <- y[i,2] + …
Run Code Online (Sandbox Code Playgroud)

r permutation bigdata

15
推荐指数
3
解决办法
369
查看次数

R中数据的快速边界

假设我有一个向量,vec它很长(从1E8条目开始),并希望将其绑定到范围[a,b].我肯定能代码vec[vec < a] = avec[vec > b] = b,但是这需要两个越过数据和用于临时指标向量大RAM分配(〜800MB,两次).这两个过程的刻录时间是因为如果我们只将数据从主内存复制到本地缓存一次就会做得更好(对主内存的调用很糟糕,缓存未命中也是如此).谁知道多线程可以提高多少,但让我们不要贪心.:)

在基础R或某些我正在忽略的软件包中是否有一个很好的实现,或者这是Rcpp(或我的老朋友data.table)的工作?

performance r bigdata rcpp data.table

14
推荐指数
2
解决办法
390
查看次数

Lambda架构 - 这个名字的起源是什么?

我已经阅读了曼宁的大数据Lambda架构(http://www.manning.com/marz/BD_meap_ch01.pdf),仍然无法理解为什么它被命名为'Lambda'.它有点像这个架构基于的系统的代号或名称吗?

lambda bigdata lambda-architecture

14
推荐指数
2
解决办法
3839
查看次数

蜂巢填充前导零

我需要在我的表中输出一个字符串列作为13长度字符,无论它的长度如何,我需要用0填充剩余的字符...

我尝试在我的配置单元查询中使用以下代码,但未能获得所需的输出

right('0000000000000' + ProductID, 13)
Run Code Online (Sandbox Code Playgroud)

有帮助吗?谢谢

sql hive bigdata

14
推荐指数
1
解决办法
2万
查看次数

如何确定HBase表的大小?有没有命令这样做?

我的Hbase shell上有多个表,我想复制到我的文件系统中.有些表超过100GB.但是,我的本地文件系统中只剩下55gb可用空间.因此,我想知道我的hbase表的大小,以便我只能导出小型表.任何建议表示赞赏.

谢谢,gautham

hadoop hbase export bigdata

14
推荐指数
3
解决办法
2万
查看次数

cassandra的cqlsh控制台中的操作超时错误

我有三个节点Cassandra Cluster,我创建了一个表,其中有超过2,000,000行.

当我select count(*) from userdetails在cqlsh中执行this()查询时,我收到此错误:

OperationTimedOut:errors = {},last_host = 192.168.1.2

当我为较少的行或限制50,000运行计数功能时,它工作正常.

java bigdata cassandra cqlsh datastax

14
推荐指数
2
解决办法
2万
查看次数