标签: bigdata

R - data.table 行中的逆透视列表

我有一个包含多列的数据集,其中 1 列包含列表条目:

DT = data.table(
  x = c(1:5),
  y = seq(2, 10, 2),
  z = list(list("a","b","a"), list("a","c"), list("b","c"), list("a","b","c"), list("b","c","b"))
)
Run Code Online (Sandbox Code Playgroud)

基本上,我试图从 z 列中取消列出 a、b、c,并根据 x 和 y 值聚合数据。

期望的输出:

    z x sum(y)
 1: a 1  4
 2: b 1  2
 3: a 2  4
 4: c 2  4
 5: b 3  6
 6: c 3  6
 7: a 4  8
 8: b 4  8
 9: c 4  8
10: b 5 20
11: c 5 10
Run Code Online (Sandbox Code Playgroud)

我目前的方法是相当迂回的;我在与 z …

r bigdata reshape2 data.table

1
推荐指数
1
解决办法
1091
查看次数

将大量 Python 列表数据导出到文本文件的最快方法

我正在寻找将最多十个 Python 列表的元素导出[x1, x2, x3, ... xn], [y1, y2, y3, ... yn], [z1, z2, z3, ... zn], ...到结构如下的文本文件的最高效方法:

x1 y1 z1  .  .  . 
x2 y2 z2  .  .  .
x3 y3 z3  .  .  .
 .  .  .  .  .  .
 .  .  .  .  .  .
 .  .  .  .  .  .
xn yn zn  .  .  .
Run Code Online (Sandbox Code Playgroud)

具有挑战性的是每个列表可能最多有 100 万个元素(仅限浮点或整数)

任何建议都将受到高度赞赏。

python csv bigdata python-2.7

1
推荐指数
1
解决办法
1798
查看次数

无法打开/查看 Yelp 数据集

我已经Yelphttps://www.yelp.com/dataset_challenge下载了数据集。下载的文件名为yelp_dataset_challenge_round9.tar

但是,从文件中提取的文件tar没有扩展名。我已经检查了https://github.com/Yelp/dataset-examples,但是它假设该文件是一个json名为yelp_academic_dataset.

我已tar下载该文件以及tar提取的内容。我使用的是 Windows 10。我曾经Winrar提取过内容。我非常感谢有关如何打开和查看数据集的任何帮助。

python json tar bigdata yelp

1
推荐指数
1
解决办法
1960
查看次数

Spark 的reduceByKey 最佳实践

我有一个具有下一个架构的数据框:

root
 |-- id_1: long (nullable = true)
 |-- id_2: long (nullable = true)
 |-- score: double (nullable = true)
Run Code Online (Sandbox Code Playgroud)

数据如下:

+----+----+------------------+
|id_1|id_2|score             |
+----+----+------------------+
|0   |9   |0.5888888888888889|
|0   |1   |0.6166666666666667|
|0   |2   |0.496996996996997 |
|1   |9   |0.6222222222222221|
|1   |6   |0.9082996632996633|
|1   |5   |0.5927450980392157|
|2   |3   |0.665774107440774 |
|3   |8   |0.6872367465504721|
|3   |8   |0.6872367465504721|
|5   |6   |0.5365909090909091|
+----+----+------------------+
Run Code Online (Sandbox Code Playgroud)

目标是为每个 id_1 找到具有最大得分 的 id_2。也许我错了,但是......只需要创建配对的 RDD:

root
 |-- _1: long (nullable = true)
 |-- _2: struct (nullable = true)
 | …
Run Code Online (Sandbox Code Playgroud)

python bigdata apache-spark apache-spark-sql pyspark

1
推荐指数
1
解决办法
1695
查看次数

在python中使用服务器端游标和条件读取海量数据

我有一个巨大的表(约 8 亿),我需要根据某些段条件获取数据。

数据:

d_id    month_id    sec     average Class
89      201701      S       5.98    A
73      201703      N       7.63    B
31      201708      F       6.38    P
11      201709      K       6.38    P
Run Code Online (Sandbox Code Playgroud)

我有两个清单:

monthList = [201701,201702,201703]
Run Code Online (Sandbox Code Playgroud)

所以sql查询是:

sql_query = str("""select * from dbo.table_name where month_id IN monthList;""") 
Run Code Online (Sandbox Code Playgroud)

现在我想将这些数据保存在服务器端游标中,并从中获取基于 classList 的子集

curs = cnxn.cursor('Class')
classList = ['A','B','P']

while True:
    records = curs.fetchmany(int(1e3))
    if not records:
      break
    for record in records:
      # here I want to use the classList to subset the data , something …
Run Code Online (Sandbox Code Playgroud)

python postgresql psycopg2 cursor bigdata

1
推荐指数
1
解决办法
2324
查看次数

fusioni 错误 - 文件初始化异常

我在 Ubuntu 16.04 上运行 jena-fuseki 服务器。我正在尝试加载数据集,如下所示:

./fuseki-server --loc="/home/dataset.json.bz2" /ds
Run Code Online (Sandbox Code Playgroud)

不断弹出的错误如下:

[2018-05-21 23:37:07] Server     INFO  Running in read-only mode for /ds
[2018-05-21 23:37:08] Server     INFO  Apache Jena Fuseki 3.7.0
[2018-05-21 23:37:08] Config     INFO  FUSEKI_HOME=/home/apache-jena-fuseki-3.7.0
[2018-05-21 23:37:08] Config     INFO  FUSEKI_BASE=/home/apache-jena-fuseki-3.7.0/run
[2018-05-21 23:37:08] Config     INFO  Shiro file: file:///home/apache-jena-fuseki-3.7.0/run/shiro.ini
[2018-05-21 23:37:08] Config     INFO  Template file: templates/config-tdb-dir
[2018-05-21 23:37:08] Config     INFO  TDB dataset: directory=/home/dataset.json.bz2
[2018-05-21 23:37:08] Server     ERROR Exception in initialization: caught: Existing file: /home/dataset.json.bz2
[2018-05-21 23:37:08] WebAppContext WARN  Failed startup of context o.e.j.w.WebAppContext@74cf8b28{/,file:///home/apache-jena-fuseki-3.7.0/webapp/,UNAVAILABLE}
org.apache.jena.assembler.exceptions.AssemblerException: …
Run Code Online (Sandbox Code Playgroud)

java jena bigdata fuseki

1
推荐指数
1
解决办法
1928
查看次数

Hadoop 3:如何配置/启用纠删码?

我正在尝试设置 Hadoop 3 集群。

关于纠删码功能的两个问题:

  1. 如何确保启用纠删码?
  2. 我还需要将复制因子设置为 3 吗?

请指出与纠删码/复制相关的配置属性,以获得与 Hadoop 2 相同的数据安全性(复制因子 3),但具有 Hadoop 3 纠删码的磁盘空间优势(仅 50% 开销,而不是 200%) 。

hadoop bigdata hdfs erasure-code hadoop3

1
推荐指数
1
解决办法
2250
查看次数

保存到 firestore 对象超过 1MB

您好,我读到 Firestore 最大文档大小的限制为 1MiB。

我想存储心率和其他“活动”数据,我当前的模型与此类似

-activity
  - HR points stream (1 point per second up to 86400 points)
  - Lat points stream (same as above)
  - Long points stream (same as above)
Run Code Online (Sandbox Code Playgroud)

例如,上面的数字(86400)是24小时的存储时间。

总的来说,我正在尝试存储并获得某人所做的24小时跑步。

然而,由于 Firestore 的大小限制,这是可以预测的。

您能否建议或指导人们如何存储此类“大”数据的正确方向?

我尝试将上述流分离到它们自己的文档中,但运气不佳,因为心率流甚至可以获得太多数据供火风暴存储。

那么简而言之,对于仅使用 Firestore 存储大数据流而不使用云存储等方式的建议是什么?

modeling bigdata firebase google-cloud-firestore

1
推荐指数
1
解决办法
2168
查看次数

合并数百万个具有不同标题的 csv 文件

我有数百万个具有不同标题的 csv 文件,我想将它们合并到一个大数据框中。

我的问题是我尝试过的解决方案有效,但速度太慢!顺便问一下,我可以在实验室中使用 Sparklyr 来处理多节点集群,这个大数据工具有帮助吗?

这些文件看起来像这样:

文件1

标头1,标头3,标头5

甲、乙、丙

文件2

标头4,标头2

e,f

文件3

标头2,标头6

一个,c

我想将它们合并为:

标头1、标头2、标头3、标头4、标头5、标头6

a,,b,,c,,f,,e,,,a,,,,c

我尝试将它们直接与 R 绑定,但程序在服务器中运行几天后崩溃了。代码如下所示:

library(plyr)
library(dplyr)
library(readr)


csvfiles <- list.files(pattern = "file\\d+.csv") 

for (i in 1:length(csvfiles)) {
  assign(paste0("files", i),read_csv(csvfiles[[i]]))
}

csvlist <- mget(ls(pattern = "files\\d"))

result <- data.frame()

for (i in 1:length(csvlist)){
  my_list <- list(result,csvlist[[i]])
  result <- rbindlist(my_list,use.names=TRUE, fill=TRUE)
 }

Run Code Online (Sandbox Code Playgroud)

然后我尝试首先使用命令行工具(例如sedawk和 )提取标头csvtk。我使用的代码如下所示

for file in $(ls file*.csv); do cat $file | sed "2 d" | csvtk …
Run Code Online (Sandbox Code Playgroud)

csv awk r bigdata

1
推荐指数
1
解决办法
1347
查看次数

Apache Ignite:数据区域内存不足 [name=Default_Region、initSize=256.0 MiB、maxSize=68.0 GiB、persistenceEnabled=false]

我们的 Apache Ignite 生产环境中的数据区域内存不足,并且 Ignite 进程被终止。我们配置了 68 GB 的堆外内存。并且没有启用驱逐策略,因为我们不想丢失 Ignite 的任何数据。此外,我们没有启用持久性,因为我们只想将整个数据存储在 Ignite 中。

class org.apache.ignite.internal.mem.IgniteOutOfMemoryException: Out of memory in data region [name=Default_Region, initSize=256.0 MiB, maxSize=68.0 GiB, persistenceEnabled=false] Try the following:
  ^-- Increase maximum off-heap memory size (DataRegionConfiguration.maxSize)
  ^-- Enable Ignite persistence (DataRegionConfiguration.persistenceEnabled)
  ^-- Enable eviction or expiration policies
    at org.apache.ignite.internal.pagemem.impl.PageMemoryNoStoreImpl.allocatePage(PageMemoryNoStoreImpl.java:304)
    at org.apache.ignite.internal.processors.cache.persistence.freelist.AbstractFreeList.allocateDataPage(AbstractFreeList.java:463)
    at org.apache.ignite.internal.processors.cache.persistence.freelist.AbstractFreeList.insertDataRow(AbstractFreeList.java:501)
    at org.apache.ignite.internal.processors.cache.persistence.RowStore.addRow(RowStore.java:97)
Run Code Online (Sandbox Code Playgroud)

此错误的原因是占用整个数据区域(68 GB)?如果是的话,我们可以通过停止 Ignite 服务来处理这个问题吗?

in-memory bigdata in-memory-database ignite

1
推荐指数
1
解决办法
1055
查看次数