标签: bigdata

Solr DataImportHandler的Chunked UrlDataSource

我正在考虑将我的数据源分块以便将优化数据导入到solr中,并且想知道是否可以使用将数据分块的主URL.

例如文件1可能有

<chunks>
  <chunk url="http://localhost/chunker?start=0&stop=100" />
  <chunk url="http://localhost/chunker?start=100&stop=200" />
  <chunk url="http://localhost/chunker?start=200&stop=300" />
  <chunk url="http://localhost/chunker?start=300&stop=400" />
  <chunk url="http://localhost/chunker?start=400&stop=500" />
  <chunk url="http://localhost/chunker?start=500&stop=600" />
</chunks>
Run Code Online (Sandbox Code Playgroud)

每个块网址都会导致类似的内容

<items>
   <item data1="info1" />
   <item data1="info2" />
   <item data1="info3" />
   <item data1="info4" />
</iems>
Run Code Online (Sandbox Code Playgroud)

我正在处理5亿多条记录,因此我认为数据需要分块以避免内存问题(在使用SQLEntityProcessor时遇到这种情况).我还想避免提出超过500万的网络请求,因为我认为这可能会变得昂贵

indexing solr bigdata

1
推荐指数
1
解决办法
2451
查看次数

删除HBase中的列

在HBase中,调用DeleteColumn()方法,即基本上对列系列的模式更改或删除列系列将导致HBase Cluster的停机时间?

hadoop hbase bigdata nosql

1
推荐指数
1
解决办法
6395
查看次数

Cassandra 具有高 SSTable 计数的低读取性能

我正在构建一个处理非常大数据(超过 300 万)的应用程序。我是 cassandra 的新手,我正在使用 5 节点 cassandra 集群来存储数据。我有两个列族

Table 1 : CREATE TABLE keyspace.table1 (
    partkey1 text,
    partkey2 text,
    clusterKey text,
    attributes text,
    PRIMARY KEY ((partkey1, partkey2), clusterKey1)
) WITH bloom_filter_fp_chance = 0.01
    AND caching = '{"keys":"ALL", "rows_per_partition":"NONE"}'
    AND comment = ''
    AND compaction = {'min_threshold': '4', 'class': 'org.apache.cassandra.db.compaction.SizeTieredCompactionStrategy', 'max_threshold': '32'}
    AND compression = {'sstable_compression': 'org.apache.cassandra.io.compress.LZ4Compressor'}
    AND dclocal_read_repair_chance = 0.1
    AND default_time_to_live = 0
    AND gc_grace_seconds = 864000
    AND max_index_interval = 2048
    AND memtable_flush_period_in_ms = 0
    AND min_index_interval = …
Run Code Online (Sandbox Code Playgroud)

data-modeling bigdata cassandra datastax cassandra-2.0

1
推荐指数
1
解决办法
6860
查看次数

为什么我的 Python 脚本比它的 R 等价物慢得多?

注意:这个问题涵盖了为什么脚本这么慢。但是,如果您更喜欢改进某些东西,可以查看我在 CodeReview 上的帖子,该帖子旨在提高性能。

我正在处理一个处理纯文本文件 (.lst) 的项目。

文件名 ( fileName) 的名称很重要,因为我将从它们中提取node(例如abessijn)和component(例如 WR-PEA)到一个数据帧中。例子:

abessijn.WR-P-E-A.lst
A-bom.WR-P-E-A.lst
acroniem.WR-P-E-C.lst
acroniem.WR-P-E-G.lst
adapter.WR-P-E-A.lst
adapter.WR-P-E-C.lst
adapter.WR-P-E-G.lst
Run Code Online (Sandbox Code Playgroud)

每个文件由一行或多行组成。每行由一个句子(在<sentence>标签内)组成。示例(abessijn.WR-PEA.lst)

/home/nobackup/SONAR/COMPACT/WR-P-E-A/WR-P-E-A0000364.data.ids.xml:  <sentence>Vooral mijn abessijn ruikt heerlijk kruidig .. : ) )</sentence>
/home/nobackup/SONAR/COMPACT/WR-P-E-A/WR-P-E-A0000364.data.ids.xml:  <sentence>Mijn abessijn denkt daar heel anders over .. : ) ) Maar mijn kinderen richt ik ook niet af , zit niet in mijn bloed .</sentence>
Run Code Online (Sandbox Code Playgroud)

我从每一行中提取句子,对其进行一些小的修改,然后将其命名为sentence. 接下来是一个名为 的元素leftContext,它采用node(例如 …

python regex r text-analysis bigdata

1
推荐指数
1
解决办法
671
查看次数

oozie中Hive操作的作业队列

我有一个oozie工作流程.我正在提交所有的蜂巢行动

<name>mapred.job.queue.name</name>
<value>${queueName}</value>
Run Code Online (Sandbox Code Playgroud)

但是对于几个hive操作,启动的作业不在指定的队列中; 它在默认队列中调用.

请告诉我这种行为和解决方案背后的原因.

hadoop hive bigdata oozie

1
推荐指数
1
解决办法
3521
查看次数

Spark会使用此sortByKey/map/collect序列保留密钥顺序吗?

让我们说,我们有这个.

val sx = sc.parallelize(Array((0, 39), (4, 47), (3, 51), (1, 98), (2, 61)))
Run Code Online (Sandbox Code Playgroud)

我们后来称之为.

val sy = sx.sortByKey(true)
Run Code Online (Sandbox Code Playgroud)

哪个会

sy = RDD[(0, 39), (1, 98), (2, 61), (3, 51), (4, 47)] 
Run Code Online (Sandbox Code Playgroud)

然后我们这样做

collected = sy.map(x => (x._2 / 10, x._2)).collect
Run Code Online (Sandbox Code Playgroud)

我们会不会得到以下内容.我的意思是,尽管改变了键值,原始的键顺序是否会被保留?

collected = [(3, 39), (9, 98), (6, 61), (5, 51), (4, 47)]
Run Code Online (Sandbox Code Playgroud)

hadoop scala bigdata apache-spark

1
推荐指数
1
解决办法
1474
查看次数

在数据集Apache Spark中拆分字符串

我是Spark中的新手我有一个带有导管属性的txt数据集,如下所示:

10000,5,0,1,0,0,5,3,2,2,1,0,1,0,4,3,0,2,0,0,1,0,0,0,0,10,0,1,0,1,0,1,4,2,2,3,0,2,0,2,1,4,3,0,0,0,3,1,0,3,22,0,3,0,1,0,1,0,0,0,5,0,2,1,1,0,11,1,0
10001,6,1,1,0,0,7,5,2,2,0,0,3,0,1,1,0,1,0,0,0,0,1,0,0,4,0,2,0,0,0,1,4,1,2,2,0,2,0,2,2,4,2,1,0,0,1,1,0,2,10,0,1,0,1,0,1,0,0,0,1,0,2,1,1,0,5,1,0
10002,3,1,2,0,0,7,4,2,2,0,0,1,0,4,4,0,1,0,1,0,0,0,0,0,1,0,2,0,4,0,10,4,1,2,4,0,2,0,2,1,4,2,2,0,0,0,1,0,2,10,0,6,0,1,0,1,0,0,0,2,0,2,1,1,0,10,1,0
10003,4,1,2,0,0,1,3,2,2,0,0,3,0,3,3,0,1,0,0,0,0,0,0,1,4,0,2,0,2,0,1,4,1,2,2,0,2,0,2,1,2,2,0,0,0,1,1,0,2,10,0,4,0,1,0,1,0,0,0,1,0,1,1,1,0,10,1,0
10004,7,1,1,0,0,0,0,2,2,0,0,3,0,0,0,0,0,0,0,0,1,0,0,0,0,0,2,2,0,0,0,4,1,2,0,0,2,0,2,1,4,0,1,0,0,0,6,0,2,22,0,1,0,1,0,1,0,0,3,0,0,0,2,2,0,5,6,0
10005,1,1,2,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,2,0,4,0,0,0,1,0,0,0,0,0,2,0,4,0,2,0,121,0,0,1,0,10,1,0,0,2,0,1,0,0,0,0,0,0,0,0,0,4,0,0
10006,1,1,1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,2,0,4,0,0,0,1,0,0,0,0,0,2,1,0,0,2,0,121,0,0,1,0,10,1,0,0,2,0,0,0,0,0,0,0,0,0,0,0,4,0,0
10007,4,1,2,0,0,6,0,2,2,0,0,4,0,5,5,0,2,1,0,0,0,0,0,0,9,0,2,0,0,0,11,4,1,2,3,0,2,0,2,1,2,3,1,0,0,0,1,0,3,10,0,1,0,1,0,1,0,0,0,0,0,2,1,1,0,11,1,0
10008,6,1,1,0,0,1,0,2,2,0,0,7,0,1,0,0,1,0,0,0,0,0,0,0,7,0,2,2,0,0,0,4,1,2,6,0,2,0,2,1,2,2,1,0,0,0,6,0,2,10,0,1,0,1,0,1,0,0,3,0,0,1,1,2,0,10,1,0
10009,3,1,12,0,0,1,0,2,2,0,0,0,0,3,0,0,1,0,0,0,0,0,0,0,4,0,2,2,4,0,0,2,1,2,6,0,2,0,2,1,0,2,2,0,0,0,3,0,2,10,0,6,1,1,1,0,0,0,1,0,0,1,1,2,0,8,1,1
10010,5,11,1,0,0,1,3,2,2,0,0,0,0,3,3,0,3,0,0,0,0,0,0,0,6,0,2,0,0,0,1,4,1,2,1,0,2,0,2,1,0,4,0,0,0,1,1,0,4,21,0,1,0,1,0,0,0,0,0,4,0,2,1,1,0,11,1,0
10011,4,0,1,0,0,1,5,2,2,0,0,3,0,1,1,0,1,0,0,0,0,0,0,0,7,0,2,0,0,0,1,4,1,2,1,0,2,0,2,1,3,2,1,0,0,1,1,0,2,10,0,1,0,1,0,1,0,0,0,2,0,2,1,1,0,10,1,0
10012,1,1,2,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,4,0,0,0,0,0,0,0,0,0,2,0,0,0,2,0,112,0,0,1,0,10,1,0,0,1,0,0,0,0,0,0,0,0,0,2,0,1,0,0
10013,1,1,1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,2,0,4,0,0,0,1,0,0,0,0,0,2,1,4,0,2,0,121,0,0,1,0,10,1,0,0,2,0,1,0,0,0,0,0,0,0,0,0,4,0,0
10014,3,11,1,0,0,6,4,2,2,0,0,1,0,2,2,0,0,1,0,0,0,0,0,0,3,0,2,0,3,0,1,4,2,2,5,0,2,0,1,2,4,2,10,0,0,1,1,0,2,10,0,5,0,1,0,1,0,0,0,3,0,1,1,1,0,7,1,0
10015,4,3,1,0,0,1,3,2,2,1,0,0,0,3,5,0,3,0,0,1,0,0,0,0,4,0,1,0,0,1,1,2,2,2,2,0,2,0,2,0,0,4,0,0,0,1,1,0,4,10,0,1,3,1,1,0,0,0,0,3,0,2,1,1,0,11,1,1
10016,4,11,1,0,0,0,0,1,1,0,0,0,0,0,0,0,0,0,0,0,0,1,0,0,0,0,2,2,4,0,0,4,1,1,0,0,1,0,0,2,0,0,12,0,0,0,6,0,2,23,0,6,0,1,0,0,0,0,3,0,0,0,2,0,0,5,7,0
10017,7,1,1,0,0,0,0,2,2,0,0,3,0,0,0,0,0,0,0,1,1,0,1,0,0,0,2,2,0,0,0,4,1,2,0,0,2,0,2,1,4,0,1,0,0,0,6,0,2,10,0,1,0,1,0,1,0,0,3,0,0,0,2,2,0,6,6,0
Run Code Online (Sandbox Code Playgroud)

任务是获取字符串的数量,其中数字位于第57位

10001,6,1,1,0,0,7,5,2,2,0,0,3,0,1,1,0,1,0,0,0,0,1,0,0,4,0,2,0,0,0,1,4,1,2,2,0,2,0,2,2,4,2,1,0,0,1,1,0,2,10,0,1,0,1,0,((1)),0,0,0,1,0,2,1,1,0,5,1,0
Run Code Online (Sandbox Code Playgroud)

是1.问题是字符串是RDD的元素,所以我需要拆分每个字符串并创建一个数组(x,y)来获得我需要的位置.我试着用

val censusText = sc.textFile("USCensus1990.data.txt")
val splitRDD = censusText.map(line=>line.split(","))
Run Code Online (Sandbox Code Playgroud)

但它没有帮助但我不知道该怎么做.
你能帮我么

scala bigdata apache-spark

1
推荐指数
1
解决办法
618
查看次数

使用和缩放Titan Graph数据库

我正在计算我存储分层数据的选项(父子关系).

由于树是图形而森林(树木)在技术上也是图形,因此图形数据库似乎比RDBMS esp更适合该法案.因为我关心优化读写操作.

  • 优化写入意味着层次结构的更改需要最少的写入.
  • 优化读取意味着实现特定节点消费者最小读取操作的完整路径.

我的用例是:

  • 每个用户一棵树.我应该在用户空间中存储和使用一个图表,还是每个用户使用一个图表?
  • 路径查询从任何节点开始并返回到用户的树根.
  • 子节点存储指向父节点的链接

由于我的所有资源都在AWS中,因此能够使用Titan DynamoDB后端似乎是理想的选择.

我真正的问题在于了解如何扩展和管理Titan.

  1. 我需要一个gremlin服务器实例吗?换句话说,为了对Titan做任何事情,我是否需要使用gremlin服务器站起EC2实例?或者我可以使用Java Titan API直接处理图形数据吗?

  2. 我是否需要明确地对数据进行分片?换句话说,随着使用量的增加以及数据量和操作量的增加,我是否需要站起来使用更多的gremlin服务器?当服务器数量向外扩展时,我是否需要从客户端跨这些服务器进行一致性哈希才能执行操作?

  3. 我是否需要设置弹性搜索集群才能从任何节点开始遍历?或者是使用顶点来表示对象和边缘以表示此时足够的父关系?我可以保证顶点ID在用户空间中是唯一的; 我也可以用唯一的用户ID装饰每个顶点.在那种情况下,我需要弹性搜索吗?我希望弹性搜索是针对自由格式或更复杂的搜索类型查询而不是针对确切的查询!

  4. 随着前端数量的增加,每个前端可以打开图形(跨用户空间的单个图形)吗?如果每个用户的图形,然后由于前端没有亲和力,可以为每个用户打开相同的图形; 这可以吗?

我无法找到任何关于此的文档.谢谢!

graph bigdata amazon-web-services titan

1
推荐指数
1
解决办法
277
查看次数

Spark-Submit 通过命令行不强制 UTF-8 编码

当我使用 Spark 的 Java API 从 IDE 运行我的 Spark 作业时,我以所需的编码格式 (UTF-8) 获得输出。但是,如果我从命令行启动 'spark-submit' 方法,输出将错过编码。

当通过命令行界面使用时,有没有一种方法可以强制编码为“spark-submit”。

我使用的是 Windows 10 操作系统和 Eclipse IDE。

您的帮助将不胜感激。

谢谢你。

java encoding utf-8 bigdata apache-spark

1
推荐指数
1
解决办法
2530
查看次数

了解 Cassandra 静态场

我通过它的文档学习 Cassandra。现在我正在学习批处理和静态字段。

在页面末尾的示例中balance,即使它是一个静态字段,他们还是设法使两个不同的值(-200、-208)。

有人可以向我解释这怎么可能吗?我已经阅读了整页,但我没有理解。

database bigdata cassandra

1
推荐指数
1
解决办法
2245
查看次数