我试图使用R在图形上渲染739455数据点,但在x轴上我无法查看所有这些数字,有没有办法可以做到这一点?
我是R.的新手
谢谢
使用solrcloud 4.6,假设我有一个8节点集群,每个节点上运行一个分片和许多不同的集合.基本上每天都会收集一些(用于分区数据).现在的问题是如何在不知道名字的情况下搜索所有收藏品?
维基说我可以这样做:
http://localhost:8983/solr/collection1/select?collection=collection1_NY,collection1_NJ,collection1_CT
Run Code Online (Sandbox Code Playgroud)
这基本上是同时搜索多个集合.但在我的情况下,集合是动态创建的,我不知道当前的名称.
有没有办法发送命中所有集合的通用搜索查询?
或者指定一系列集合的方式,如collection1-10或collection*2013?
我也知道我可以加入ZK并获取信息,但这对我正在做的事情来说太先进了.
谢谢.
我有一些巨大的数据集(介于10-20之间),我需要找出这些数据集之间的关系.数据集非常庞大,计算可能不适合单台计算机.这些数据集中的字段是文本而不是数字.增加复杂性,一些字段也可能有不正确的单词,例如'huose'为'house',我正在使用模糊算法.
为了解决这个问题,我正在考虑使用余弦相似性但不确定这么大的数据集的性能.我的问题是,这种算法是否足以应对这种问题(性能和准确性).如果没有,是否还有其他一些我应该研究的算法?
编辑:更多信息
我将使用的数据集可能是文本文件和数据库表的混合.列中的值通常为10-50 char,并且它不是一个巨大的文档.我寻找的关系是数据集的一列与另一列的相似程度.我有点想根据列之间的相似性得出分数.例如
Col1 Col2 Col3 A B X C S B E C A T V C X E
因此,在上面的例子中,人们可以说Col1并且Col3彼此之间有很强的关系Col1而且Col2关系很弱.
我正在使用宝藏数据进行数据分析,并且在presto db中遇到了union语句的问题.
我如何在presto上做一个Union All.我不明白文档.每次我尝试这样做UNION:
SELECT
COUNT(*) AS ReservationsCreated,
resource
FROM
reservation
WHERE
type = 'create'
UNION
SELECT
COUNT(*) AS ReservationsDeleted,
resource
FROM
reservation
WHERE
type = 'delete'
GROUP BY
resource
;
Run Code Online (Sandbox Code Playgroud)
我得到重新格式化的输出,如:
SELECT
COUNT(*) AS ReservationsCreated,
resource
FROM
reservation
WHERE
type = 'create'
UNION
SELECT
COUNT(*) AS ReservationsDeleted,
resource
FROM
reservation
WHERE
type = 'delete'
GROUP BY
resource
;
Run Code Online (Sandbox Code Playgroud)
和错误说:
'"resource"' must be an aggregate expression or appear in GROUP BY clause
Run Code Online (Sandbox Code Playgroud)
我想我不理解Presto的语法.联盟上的文档非常令人困惑.任何帮助赞赏.
我正在尝试读取R中的一个巨大矩阵(2.8gb),因此,到目前为止,我发现的最好结果是
require(data.table)
DT<-fread("bigmatrix.csv")
Run Code Online (Sandbox Code Playgroud)
其中我几乎一无所知!
之后,我可以告诉您该矩阵有3列和5千万行。
每行的类型
object1 object 2 distance
1: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.GWI 0.0000000
2: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.GXANA 0.2195843
3: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.KHOEKHOEGOWAB 0.6749363
4: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.KHWE 0.6089206
5: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.KORANA 0.7163111
6: Kho.CENTRAL_KHOISAN.GWI Kho.CENTRAL_KHOISAN.KWADI 0.8017179
Run Code Online (Sandbox Code Playgroud)
因此,它将两个对象的距离成对比较大约6900个对象
现在是我的问题:
我只想对41个对象进行成对比较。但是我不知道给我这个数据集的那个家伙怎么称这41个对象!
因此,我的解决方案是找到DT $ object1的级别,将其写入文件中,然后对其进行扫描以找到所需的41,该怎么办?
我试过了
foo<-factor(DT$object1)
Run Code Online (Sandbox Code Playgroud)
所以当我打电话
foo
....
6895 Levels: AA.BEJA.BEJA AA.BEJA.BEJA_2 AA.BERBER.AWJILAH ... Zun.ZUNI.ZUNI
Run Code Online (Sandbox Code Playgroud)
但
foo$Levels
Run Code Online (Sandbox Code Playgroud)
给我一个错误!
我敢肯定,有一种比C ++更聪明的方法(即循环遍历每行,仅在尚不存在的情况下将对象1的名称插入字符串向量中),但是我该怎么做?
编辑:现在出现另一个问题:
我已经确定了需要的41个对象,如何从data.table中提取与我相关的行?
我可以将对象的名称存储在数据框或向量中
所以,我有一部分代码如下所示.
for(a <- 0 until segments)
{
// do something with elements at index a
}
Run Code Online (Sandbox Code Playgroud)
什么是最简单的多线程类型,它允许我在一个单独的线程中执行该循环的每个元素.我还有每个线程需要访问的全局集合(由a索引).我在互联网上看到的只是期货和演员,但它们很难掌握.我想要一些像OpenMP一样简单的东西.
我试过以下,但它给了我错误,';' expected but '.' found. }} thread.start.
for (a <- 0 until segments) {
val thread = new Thread {
override def run {
// do something with elements at index a
}} thread.start
}
Run Code Online (Sandbox Code Playgroud) 我已经使用spark-thriftserver jdbc连接将表从PostgreSQL数据库导入到spark-sql中,现在从beeline中可以看到这些表。
有什么办法可以将这些表转换为Spark数据框架。
我需要在HDFS上存储大约10TB的大文件.我需要了解的是HDFS将如何存储此文件.比如,群集的复制因子是3,我有一个10节点群集,每个节点上有超过10 TB的磁盘空间,即总群集容量超过100TB.
现在,HDFS随机选择三个节点并将文件存储在这三个节点上.那么这就像听起来一样简单.请确认?
或者HDFS将文件分割 - 比如说每个10T分割1TB,然后将每个分割存储在随机选择的3个节点上.分裂是可能的,如果是,则是启用它的配置方面.如果HDFS必须拆分二进制文件或文本文件 - 它是如何拆分的.只需按字节.
我正在开发一个项目,使用kafka connect从多个数据库源中提取数据.我希望能够将数据转换为指定的json格式,然后最终将最终的json推送到S3存储桶,最好使用kafka connect来保持我的开销.
以下是数据目前进入kafka(以avro格式)的示例:
{"tableName":"TABLE1","SchemaName{"string":"dbo"},"tableID":1639117030,"columnName":{"string":"DATASET"},"ordinalPosition":{"int":1},"isNullable":{"int":1},"dataType":{"string":"varchar"},"maxLength":{"int":510},"precision":{"int":0},"scale":{"int":0},"isPrimaryKey":{"int":0},"tableSizeKB":{"long":72}}
{"tableName":"dtproperties","SchemaName":{"string":"dbo"},"tableID":1745441292,"columnName":{"string":"id"},"ordinalPosition":{"int":1},"isNullable":{"int":0},"dataType":{"string":"int"},"maxLength":{"int":4},"precision":{"int":10},"scale":{"int":0},"isPrimaryKey":{"int":1},"tableSizeKB":{"long":24}}
Run Code Online (Sandbox Code Playgroud)
转换为JSON时看起来如此:
{
"tablename" : "AS_LOOKUPS",
"tableID": 5835333,
"columnName": "SVALUE",
"ordinalPosition": 6,
"isNullable": 1,
"dataType": "varchar",
"maxLength": 4000,
"precision": 0,
"scale": 0,
"isPrimaryKey": 0,
"tableSize": 0,
"sizeUnit": "GB"
},
{
"tablename" : "AS_LOOKUPS",
"tableID": 5835333,
"columnName": "SORT_ORDER",
"ordinalPosition": 7,
"isNullable": 1,
"dataType": "int",
"maxLength": 4,
"precision": 10,
"scale": 0,
"isPrimaryKey": 0,
"tableSize": 0,
"sizeUnit": "GB"
}
Run Code Online (Sandbox Code Playgroud)
我的目标是让数据看起来像这样:
{
"header": "Database Inventory",
"DBName": "DB",
"ServerName": "server@server.com",
"SchemaName": "DBE",
"DB Owner": "Name",
"DB Guardian" : "Name/Group",
"ASV" …Run Code Online (Sandbox Code Playgroud) bigdata apache-kafka apache-kafka-streams apache-kafka-connect
我试图更好地理解在卡桑德拉的sstables的不变性.非常清楚当插入操作或memtable中存在数据时的更新/删除操作中会发生什么.但是,当我想要修改已经被刷新的数据时,不清楚会发生什么.
所以我理解简单的senario:我执行insert opertaion并将数据写入memtable.当记忆已满时,它会被冲到一个稳定的状态.
现在,如何进行数据修改?执行删除或更新命令时(当数据被刷新时)会发生什么?如果sstable是不可变的,那么数据将如何被删除/更新?memtable如何在删除和更新命令(由于它已被刷新而不存在于其中的数据)中起作用?记忆包含什么?