标签: bigdata

使用R绘制大数字,但不显示所有数字

我试图使用R在图形上渲染739455数据点,但在x轴上我无法查看所有这些数字,有没有办法可以做到这一点?

我是R.的新手在此输入图像描述

谢谢

graphics r data-visualization bigdata

1
推荐指数
1
解决办法
332
查看次数

SolrCloud:如何在不知道个人姓名的情况下搜索所有可用的馆藏?

使用solrcloud 4.6,假设我有一个8节点集群,每个节点上运行一个分片和许多不同的集合.基本上每天都会收集一些(用于分区数据).现在的问题是如何在不知道名字的情况下搜索所有收藏品?

维基说我可以这样做:

http://localhost:8983/solr/collection1/select?collection=collection1_NY,collection1_NJ,collection1_CT
Run Code Online (Sandbox Code Playgroud)

这基本上是同时搜索多个集合.但在我的情况下,集合是动态创建的,我不知道当前的名称.

有没有办法发送命中所有集合的通用搜索查询?

或者指定一系列集合的方式,如collection1-10或collection*2013?

我也知道我可以加入ZK并获取信息,但这对我正在做的事情来说太先进了.

谢谢.

collections solr bigdata solrcloud

1
推荐指数
1
解决办法
3814
查看次数

查找对象之间相似性的算法

我有一些巨大的数据集(介于10-20之间),我需要找出这些数据集之间的关系.数据集非常庞大,计算可能不适合单台计算机.这些数据集中的字段是文本而不是数字.增加复杂性,一些字段也可能有不正确的单词,例如'huose'为'house',我正在使用模糊算法.

为了解决这个问题,我正在考虑使用余弦相似性但不确定这么大的数据集的性能.我的问题是,这种算法是否足以应对这种问题(性能和准确性).如果没有,是否还有其他一些我应该研究的算法?

编辑:更多信息

我将使用的数据集可能是文本文件和数据库表的混合.列中的值通常为10-50 char,并且它不是一个巨大的文档.我寻找的关系是数据集的一列与另一列的相似程度.我有点想根据列之间的相似性得出分数.例如

Col1     Col2     Col3
A        B        X
C        S        B
E        C        A
T        V        C
X        E

因此,在上面的例子中,人们可以说Col1并且Col3彼此之间有很强的关系Col1而且Col2关系很弱.

algorithm string-matching bigdata

1
推荐指数
1
解决办法
1369
查看次数

Presto上的UNION ALL/UNION

我正在使用宝藏数据进行数据分析,并且在presto db中遇到了union语句的问题.

我如何在presto上做一个Union All.我不明白文档.每次我尝试这样做UNION:

SELECT 
  COUNT(*) AS ReservationsCreated,
  resource
FROM
  reservation
WHERE
  type = 'create'
UNION
SELECT 
  COUNT(*) AS ReservationsDeleted,
  resource
FROM
  reservation
WHERE
  type = 'delete'
GROUP BY
  resource
;
Run Code Online (Sandbox Code Playgroud)

我得到重新格式化的输出,如:

SELECT 
  COUNT(*) AS ReservationsCreated,
  resource
FROM
  reservation
WHERE
  type = 'create'
UNION
SELECT 
COUNT(*) AS ReservationsDeleted,
resource
FROM
reservation
WHERE
type = 'delete'
GROUP BY
resource
;
Run Code Online (Sandbox Code Playgroud)

和错误说:

'"resource"' must be an aggregate expression or appear in GROUP BY clause
Run Code Online (Sandbox Code Playgroud)

我想我不理解Presto的语法.联盟上的文档非常令人困惑.任何帮助赞赏.

sql union bigdata presto treasure-data

1
推荐指数
1
解决办法
9990
查看次数

提取因子级别的名称

我正在尝试读取R中的一个巨大矩阵(2.8gb),因此,到目前为止,我发现的最好结果是

 require(data.table)

 DT<-fread("bigmatrix.csv")
Run Code Online (Sandbox Code Playgroud)

其中我几乎一无所知!

之后,我可以告诉您该矩阵有3列和5千万行。

每行的类型

             object1                       object 2           distance
 1: Kho.CENTRAL_KHOISAN.GWI           Kho.CENTRAL_KHOISAN.GWI 0.0000000
 2: Kho.CENTRAL_KHOISAN.GWI         Kho.CENTRAL_KHOISAN.GXANA 0.2195843  
 3: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.KHOEKHOEGOWAB 0.6749363
 4: Kho.CENTRAL_KHOISAN.GWI          Kho.CENTRAL_KHOISAN.KHWE 0.6089206
 5: Kho.CENTRAL_KHOISAN.GWI        Kho.CENTRAL_KHOISAN.KORANA 0.7163111
 6: Kho.CENTRAL_KHOISAN.GWI         Kho.CENTRAL_KHOISAN.KWADI 0.8017179
Run Code Online (Sandbox Code Playgroud)

因此,它将两个对象的距离成对比较大约6900个对象

现在是我的问题:

我只想对41个对象进行成对比较。但是我不知道给我这个数据集的那个家伙怎么称这41个对象!

因此,我的解决方案是找到DT $ object1的级别,将其写入文件中,然后对其进行扫描以找到所需的41,该怎么办?

我试过了

foo<-factor(DT$object1)
Run Code Online (Sandbox Code Playgroud)

所以当我打电话

foo

....

6895 Levels: AA.BEJA.BEJA AA.BEJA.BEJA_2 AA.BERBER.AWJILAH ... Zun.ZUNI.ZUNI
Run Code Online (Sandbox Code Playgroud)

但

foo$Levels
Run Code Online (Sandbox Code Playgroud)

给我一个错误!

我敢肯定,有一种比C ++更聪明的方法(即循环遍历每行,仅在尚不存在的情况下将对象1的名称插入字符串向量中),但是我该怎么做?


编辑:现在出现另一个问题:

我已经确定了需要的41个对象,如何从data.table中提取与我相关的行?

我可以将对象的名称存储在数据框或向量中

r matrix bigdata data.table

1
推荐指数
1
解决办法
5362
查看次数

scala中最简单的多线程形式

所以,我有一部分代码如下所示.

for(a <- 0 until segments)
{
    // do something with elements at index a
}
Run Code Online (Sandbox Code Playgroud)

什么是最简单的多线程类型,它允许我在一个单独的线程中执行该循环的每个元素.我还有每个线程需要访问的全局集合(由a索引).我在互联网上看到的只是期货和演员,但它们很难掌握.我想要一些像OpenMP一样简单的东西.

我试过以下,但它给了我错误,';' expected but '.' found. }} thread.start.

for (a <- 0 until segments) {
    val thread = new Thread {
        override def run {
            // do something with elements at index a
        }} thread.start
}
Run Code Online (Sandbox Code Playgroud)

scala bigdata apache-spark

1
推荐指数
1
解决办法
1482
查看次数

如何将表注册为Spark表到数据框

我已经使用spark-thriftserver jdbc连接将表从PostgreSQL数据库导入到spark-sql中,现在从beeline中可以看到这些表。

有什么办法可以将这些表转换为Spark数据框架。

hadoop bigdata apache-spark apache-spark-sql

1
推荐指数
1
解决办法
5367
查看次数

在hadoop HDFS中存储大文件?

我需要在HDFS上存储大约10TB的大文件.我需要了解的是HDFS将如何存储此文件.比如,群集的复制因子是3,我有一个10节点群集,每个节点上有超过10 TB的磁盘空间,即总群集容量超过100TB.

现在,HDFS随机选择三个节点并将文件存储在这三个节点上.那么这就像听起来一样简单.请确认?

或者HDFS将文件分割 - 比如说每个10T分割1TB,然后将每个分割存储在随机选择的3个节点上.分裂是可能的,如果是,则是启用它的配置方面.如果HDFS必须拆分二进制文件或文本文件 - 它是如何拆分的.只需按字节.

java hadoop mapreduce bigdata hdfs

1
推荐指数
1
解决办法
1933
查看次数

从kafka转换数据的最简单方法

我正在开发一个项目,使用kafka connect从多个数据库源中提取数据.我希望能够将数据转换为指定的json格式,然后最终将最终的json推送到S3存储桶,最好使用kafka connect来保持我的开销.

以下是数据目前进入kafka(以avro格式)的示例:

{"tableName":"TABLE1","SchemaName{"string":"dbo"},"tableID":1639117030,"columnName":{"string":"DATASET"},"ordinalPosition":{"int":1},"isNullable":{"int":1},"dataType":{"string":"varchar"},"maxLength":{"int":510},"precision":{"int":0},"scale":{"int":0},"isPrimaryKey":{"int":0},"tableSizeKB":{"long":72}}
{"tableName":"dtproperties","SchemaName":{"string":"dbo"},"tableID":1745441292,"columnName":{"string":"id"},"ordinalPosition":{"int":1},"isNullable":{"int":0},"dataType":{"string":"int"},"maxLength":{"int":4},"precision":{"int":10},"scale":{"int":0},"isPrimaryKey":{"int":1},"tableSizeKB":{"long":24}}
Run Code Online (Sandbox Code Playgroud)

转换为JSON时看起来如此:

{
      "tablename" : "AS_LOOKUPS",
      "tableID": 5835333,
      "columnName": "SVALUE",
      "ordinalPosition": 6,
      "isNullable": 1,
      "dataType": "varchar",
      "maxLength": 4000,
      "precision": 0,
      "scale": 0,
      "isPrimaryKey": 0,
      "tableSize": 0,
      "sizeUnit": "GB"
},
{
      "tablename" : "AS_LOOKUPS",
      "tableID": 5835333,
      "columnName": "SORT_ORDER",
      "ordinalPosition": 7,
      "isNullable": 1,
      "dataType": "int",
      "maxLength": 4,
      "precision": 10,
      "scale": 0,
      "isPrimaryKey": 0,
      "tableSize": 0,
      "sizeUnit": "GB"
}
Run Code Online (Sandbox Code Playgroud)

我的目标是让数据看起来像这样:

{
  "header": "Database Inventory",
  "DBName": "DB",
  "ServerName": "server@server.com",
  "SchemaName": "DBE",
  "DB Owner": "Name",
  "DB Guardian" : "Name/Group",
  "ASV" …
Run Code Online (Sandbox Code Playgroud)

bigdata apache-kafka apache-kafka-streams apache-kafka-connect

1
推荐指数
1
解决办法
3814
查看次数

了解SSTable不可移植性

我试图更好地理解在卡桑德拉的sstables的不变性.非常清楚当插入操作或memtable中存在数据时的更新/删除操作中会发生什么.但是,当我想要修改已经被刷新的数据时,不清楚会发生什么.

所以我理解简单的senario:我执行insert opertaion并将数据写入memtable.当记忆已满时,它会被冲到一个稳定的状态.

现在,如何进行数据修改?执行删除或更新命令时(当数据被刷新时)会发生什么?如果sstable是不可变的,那么数据将如何被删除/更新?memtable如何在删除和更新命令(由于它已被刷新而不存在于其中的数据)中起作用?记忆包含什么?

database bigdata cassandra nosql

1
推荐指数
1
解决办法
254
查看次数