标签: bigdata

实现MySQL NDB Cluster有哪些局限性?

我想为MySQL Cluster 6实现NDB Cluster.我想用非常庞大的数据结构来完成它,最少有200万条记录.

我想知道是否存在实施NDB集群的任何限制.例如,RAM大小,数据库数或NDB集群的数据库大小.

mysql cluster-computing bigdata mysql6

10
推荐指数
1
解决办法
1万
查看次数

如何加快GLM估算?

我在Amazon EC2上使用RStudio 0.97.320(R 2.15.3).我的数据框有200k行和12列.

我试图用大约1500个参数拟合逻辑回归.

R使用7%的CPU并且具有60 + GB内存并且仍然需要很长时间.

这是代码:

glm.1.2 <- glm(formula = Y ~ factor(X1) * log(X2) * (X3 + X4 * (X5 + I(X5^2)) * (X8 + I(X8^2)) + ((X6 + I(X6^2)) * factor(X7))), 
  family = binomial(logit), data = df[1:150000,])
Run Code Online (Sandbox Code Playgroud)

有什么建议可以加快这一速度吗?

performance r bigdata

10
推荐指数
3
解决办法
8416
查看次数

Hbase FuzzyRowFilter如何跳跃键工作

我知道模糊行滤波器首先将两个参数作为行键,第二个作为模糊逻辑.我从相应的java类FuzzyRowFilter中理解的是,过滤器评估当前行并尝试计算与模糊逻辑匹配的下一个更高的行键,并跳转非匹配键.

我无法理解以下事情

扫描如何跳转某些行键?它是否使用Get获取并比较当前行键.扫描如何知道下一个匹配的行键存在的位置?没有进行全扫描(如果它跳转)

hbase bigdata hfile

10
推荐指数
1
解决办法
3549
查看次数

如何使用spark处理一系列hbase行?

我正在尝试使用HBase作为spark的数据源.因此,第一步是从HBase表创建RDD.由于Spark使用hadoop输入格式,我可以通过创建rdd找到一种使用所有行的方法http://www.vidyasource.com/blog/Programming/Scala/Java/Data/Hadoop/Analytics/2014/01/25/lighting-a-spark-with-hbase但我们如何为范围扫描创建RDD?

欢迎所有建议.

java hadoop bigdata apache-spark

10
推荐指数
2
解决办法
1万
查看次数

将Google Cloud Storage存储桶移至另一个项目

将现有Google云存储存储桶移至另一个项目的最佳方法是什么?

我不想将其复制到Google Cloud Storage外部进行传输,拥有两份数据副本或使用其他存储桶名称.

我能达到这些要求的距离有多近?

bigdata google-cloud-storage

10
推荐指数
3
解决办法
3140
查看次数

在Java中实现自定义Spark RDD

我有一个自定义数据源,我想将数据加载到我的Spark集群中以执行一些计算.为此我发现我可能需要RDD为我的数据源实现一个新的.

我是一个完整的Scala noob,我希望我能RDD在Java中实现它.我环顾互联网,找不到任何资源.有什么指针吗?

我的数据在S3中,并在Dynamo中编入索引.例如,如果我想加载给定时间范围的数据,我首先需要查询Dynamo以查找相应时间范围的S3文件密钥,然后在Spark中加载它们.这些文件可能并不总是具有相同的S3路径前缀,因此sc.testFile("s3://directory_path/")不起作用.

我要寻找关于如何实现一些类似于指针HadoopRDDJdbcRDD但在Java.类似于他们在这里所做的事:DynamoDBRDD.这个从Dynamo读取数据,我的自定义RDD将查询DynamoDB以获取S3文件密钥,然后从S3加载它们.

bigdata apache-spark

10
推荐指数
2
解决办法
6024
查看次数

Dynamodb查询错误 - 不支持查询密钥条件

我试图查询我的dynamodb表以获取feed_guid和status_id = 1.但它返回查询键条件不支持错误.请找到我的表架构和查询.

$result =$dynamodbClient->createTable(array(
            'TableName' => 'feed',
            'AttributeDefinitions' => array(
                array('AttributeName' => 'user_id', 'AttributeType' => 'S'),
                array('AttributeName' => 'feed_guid',    'AttributeType' => 'S'),
                array('AttributeName' => 'status_id',  'AttributeType' => 'N'),
            ),
            'KeySchema' => array(
                array('AttributeName' => 'feed_guid', 'KeyType' => 'HASH'),
            ),

            'GlobalSecondaryIndexes' => array(
                array(
                    'IndexName' => 'StatusIndex',
                    'ProvisionedThroughput' => array (
                        'ReadCapacityUnits' => 5,
                        'WriteCapacityUnits' => 5
                    ),
                    'KeySchema' => array(
                        array(
                            'AttributeName' => 'status_id',
                            'KeyType' => 'HASH'
                        ),
                    ),
                    'Projection' => array(
                        'ProjectionType' => 'ALL'
                    )
                ),

                array(
                    'IndexName' …
Run Code Online (Sandbox Code Playgroud)

bigdata amazon-web-services amazon-dynamodb

10
推荐指数
3
解决办法
2万
查看次数

在hive中创建外部表中的分区

我已在hive 的内部表中成功创建并添加了动态分区.即通过使用以下步骤:

1创建了一个源表

从本地到源表的2个加载数据

3-创建了另一个包含分区的表 - partition_table

4-从源表中将数据插入此表,从而动态创建所有分区

我的问题是,如何在外部表中执行此操作?我读了这么多文章,但我很困惑,我是否必须指定已存在的分区的路径来为外部表创建分区?

示例:第1步:

create external table1 ( name string, age int, height int)
location 'path/to/dataFile/in/HDFS';
Run Code Online (Sandbox Code Playgroud)

第2步:

alter table table1 add partition(age) 
location 'path/to/already/existing/partition'
Run Code Online (Sandbox Code Playgroud)

我不知道如何在外部表中进行分区.有人可以通过一步一步的描述来帮助吗?

提前致谢!

hadoop hbase hive mapreduce bigdata

10
推荐指数
2
解决办法
3万
查看次数

R向量大小限制:.C中不支持"长向量(参数5)"

我有一个非常大的矩阵我试图在具有足够内存的服务器上运行glmnet.它甚至在非常大的数据集上工作到一定程度,之后我得到以下错误:

Error in elnet(x, ...) : long vectors (argument 5) are not supported in .C
Run Code Online (Sandbox Code Playgroud)

如果我理解正确,这是由R的限制引起的,R不能有任何长度超过INT_MAX的向量.那是对的吗?有没有可用的解决方案,不需要完全重写glmnet?任何替代R解释器(Riposte等)是否解决了这个限制?

谢谢!

scalability r vector bigdata glmnet

10
推荐指数
1
解决办法
3265
查看次数

Apache Spark-SQL与Sqoop基准测试同时将数据从RDBMS传输到hdfs

我正在研究一个用例,我必须将数据从RDBMS传输到HDFS.我们使用sqoop对此案例进行了基准测试,发现我们能够在6-7分钟内传输大约20GB的数据.

当我尝试使用Spark SQL时,性能非常低(1 GB的记录从netezza转移到hdfs需要4分钟).我正在尝试进行一些调整并提高其性能,但不太可能将其调整到sqoop的水平(1分钟内大约3 Gb的数据).

我同意spark主要是一个处理引擎这一事实,但我的主要问题是spark和sqoop都在内部使用JDBC驱动程序,所以为什么性能上有太大差异(或者可能是我遗漏了一些东西).我在这里发布我的代码.

object helloWorld {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setAppName("Netezza_Connection").setMaster("local")
    val sc= new SparkContext(conf)
    val sqlContext = new org.apache.spark.sql.hive.HiveContext(sc)
    sqlContext.read.format("jdbc").option("url","jdbc:netezza://hostname:port/dbname").option("dbtable","POC_TEST").option("user","user").option("password","password").option("driver","org.netezza.Driver").option("numPartitions","14").option("lowerBound","0").option("upperBound","13").option("partitionColumn", "id").option("fetchSize","100000").load().registerTempTable("POC")
    val df2 =sqlContext.sql("select * from POC")
    val partitioner= new org.apache.spark.HashPartitioner(14)
    val rdd=df2.rdd.map(x=>(String.valueOf(x.get(1)),x)).partitionBy(partitioner).values
    rdd.saveAsTextFile("hdfs://Hostname/test")
  }
}
Run Code Online (Sandbox Code Playgroud)

我检查了很多其他帖子,但无法得到sqoop内部工作和调优的明确答案,也没有得到sqoop vs spark sql基准测试.有助于理解这个问题.

hadoop bigdata sqoop apache-spark-sql

10
推荐指数
2
解决办法
8678
查看次数