我有一个包含多列的数据集,其中 1 列包含列表条目:
DT = data.table(
x = c(1:5),
y = seq(2, 10, 2),
z = list(list("a","b","a"), list("a","c"), list("b","c"), list("a","b","c"), list("b","c","b"))
)
Run Code Online (Sandbox Code Playgroud)
基本上,我试图从 z 列中取消列出 a、b、c,并根据 x 和 y 值聚合数据。
期望的输出:
z x sum(y)
1: a 1 4
2: b 1 2
3: a 2 4
4: c 2 4
5: b 3 6
6: c 3 6
7: a 4 8
8: b 4 8
9: c 4 8
10: b 5 20
11: c 5 10
Run Code Online (Sandbox Code Playgroud)
我目前的方法是相当迂回的;我在与 z …
我正在寻找将最多十个 Python 列表的元素导出[x1, x2, x3, ... xn], [y1, y2, y3, ... yn], [z1, z2, z3, ... zn], ...到结构如下的文本文件的最高效方法:
x1 y1 z1 . . .
x2 y2 z2 . . .
x3 y3 z3 . . .
. . . . . .
. . . . . .
. . . . . .
xn yn zn . . .
Run Code Online (Sandbox Code Playgroud)
具有挑战性的是每个列表可能最多有 100 万个元素(仅限浮点或整数)
任何建议都将受到高度赞赏。
我已经Yelp从https://www.yelp.com/dataset_challenge下载了数据集。下载的文件名为yelp_dataset_challenge_round9.tar
但是,从文件中提取的文件tar没有扩展名。我已经检查了https://github.com/Yelp/dataset-examples,但是它假设该文件是一个json名为yelp_academic_dataset.
我已tar下载该文件以及tar提取的内容。我使用的是 Windows 10。我曾经Winrar提取过内容。我非常感谢有关如何打开和查看数据集的任何帮助。
我有一个具有下一个架构的数据框:
root
|-- id_1: long (nullable = true)
|-- id_2: long (nullable = true)
|-- score: double (nullable = true)
Run Code Online (Sandbox Code Playgroud)
数据如下:
+----+----+------------------+
|id_1|id_2|score |
+----+----+------------------+
|0 |9 |0.5888888888888889|
|0 |1 |0.6166666666666667|
|0 |2 |0.496996996996997 |
|1 |9 |0.6222222222222221|
|1 |6 |0.9082996632996633|
|1 |5 |0.5927450980392157|
|2 |3 |0.665774107440774 |
|3 |8 |0.6872367465504721|
|3 |8 |0.6872367465504721|
|5 |6 |0.5365909090909091|
+----+----+------------------+
Run Code Online (Sandbox Code Playgroud)
目标是为每个 id_1 找到具有最大得分 的 id_2。也许我错了,但是......只需要创建配对的 RDD:
root
|-- _1: long (nullable = true)
|-- _2: struct (nullable = true)
| …Run Code Online (Sandbox Code Playgroud) 我有一个巨大的表(约 8 亿),我需要根据某些段条件获取数据。
数据:
d_id month_id sec average Class
89 201701 S 5.98 A
73 201703 N 7.63 B
31 201708 F 6.38 P
11 201709 K 6.38 P
Run Code Online (Sandbox Code Playgroud)
我有两个清单:
monthList = [201701,201702,201703]
Run Code Online (Sandbox Code Playgroud)
所以sql查询是:
sql_query = str("""select * from dbo.table_name where month_id IN monthList;""")
Run Code Online (Sandbox Code Playgroud)
现在我想将这些数据保存在服务器端游标中,并从中获取基于 classList 的子集
curs = cnxn.cursor('Class')
classList = ['A','B','P']
while True:
records = curs.fetchmany(int(1e3))
if not records:
break
for record in records:
# here I want to use the classList to subset the data , something …Run Code Online (Sandbox Code Playgroud) 我在 Ubuntu 16.04 上运行 jena-fuseki 服务器。我正在尝试加载数据集,如下所示:
./fuseki-server --loc="/home/dataset.json.bz2" /ds
Run Code Online (Sandbox Code Playgroud)
不断弹出的错误如下:
[2018-05-21 23:37:07] Server INFO Running in read-only mode for /ds
[2018-05-21 23:37:08] Server INFO Apache Jena Fuseki 3.7.0
[2018-05-21 23:37:08] Config INFO FUSEKI_HOME=/home/apache-jena-fuseki-3.7.0
[2018-05-21 23:37:08] Config INFO FUSEKI_BASE=/home/apache-jena-fuseki-3.7.0/run
[2018-05-21 23:37:08] Config INFO Shiro file: file:///home/apache-jena-fuseki-3.7.0/run/shiro.ini
[2018-05-21 23:37:08] Config INFO Template file: templates/config-tdb-dir
[2018-05-21 23:37:08] Config INFO TDB dataset: directory=/home/dataset.json.bz2
[2018-05-21 23:37:08] Server ERROR Exception in initialization: caught: Existing file: /home/dataset.json.bz2
[2018-05-21 23:37:08] WebAppContext WARN Failed startup of context o.e.j.w.WebAppContext@74cf8b28{/,file:///home/apache-jena-fuseki-3.7.0/webapp/,UNAVAILABLE}
org.apache.jena.assembler.exceptions.AssemblerException: …Run Code Online (Sandbox Code Playgroud) 我正在尝试设置 Hadoop 3 集群。
关于纠删码功能的两个问题:
请指出与纠删码/复制相关的配置属性,以获得与 Hadoop 2 相同的数据安全性(复制因子 3),但具有 Hadoop 3 纠删码的磁盘空间优势(仅 50% 开销,而不是 200%) 。
您好,我读到 Firestore 最大文档大小的限制为 1MiB。
我想存储心率和其他“活动”数据,我当前的模型与此类似
-activity
- HR points stream (1 point per second up to 86400 points)
- Lat points stream (same as above)
- Long points stream (same as above)
Run Code Online (Sandbox Code Playgroud)
例如,上面的数字(86400)是24小时的存储时间。
总的来说,我正在尝试存储并获得某人所做的24小时跑步。
然而,由于 Firestore 的大小限制,这是可以预测的。
您能否建议或指导人们如何存储此类“大”数据的正确方向?
我尝试将上述流分离到它们自己的文档中,但运气不佳,因为心率流甚至可以获得太多数据供火风暴存储。
那么简而言之,对于仅使用 Firestore 存储大数据流而不使用云存储等方式的建议是什么?
我有数百万个具有不同标题的 csv 文件,我想将它们合并到一个大数据框中。
我的问题是我尝试过的解决方案有效,但速度太慢!顺便问一下,我可以在实验室中使用 Sparklyr 来处理多节点集群,这个大数据工具有帮助吗?
这些文件看起来像这样:
文件1
标头1,标头3,标头5
甲、乙、丙
文件2
标头4,标头2
e,f
文件3
标头2,标头6
一个,c
我想将它们合并为:
标头1、标头2、标头3、标头4、标头5、标头6
a,,b,,c,,f,,e,,,a,,,,c
我尝试将它们直接与 R 绑定,但程序在服务器中运行几天后崩溃了。代码如下所示:
library(plyr)
library(dplyr)
library(readr)
csvfiles <- list.files(pattern = "file\\d+.csv")
for (i in 1:length(csvfiles)) {
assign(paste0("files", i),read_csv(csvfiles[[i]]))
}
csvlist <- mget(ls(pattern = "files\\d"))
result <- data.frame()
for (i in 1:length(csvlist)){
my_list <- list(result,csvlist[[i]])
result <- rbindlist(my_list,use.names=TRUE, fill=TRUE)
}
Run Code Online (Sandbox Code Playgroud)
然后我尝试首先使用命令行工具(例如sed、awk和 )提取标头csvtk。我使用的代码如下所示
for file in $(ls file*.csv); do cat $file | sed "2 d" | csvtk …Run Code Online (Sandbox Code Playgroud) 我们的 Apache Ignite 生产环境中的数据区域内存不足,并且 Ignite 进程被终止。我们配置了 68 GB 的堆外内存。并且没有启用驱逐策略,因为我们不想丢失 Ignite 的任何数据。此外,我们没有启用持久性,因为我们只想将整个数据存储在 Ignite 中。
class org.apache.ignite.internal.mem.IgniteOutOfMemoryException: Out of memory in data region [name=Default_Region, initSize=256.0 MiB, maxSize=68.0 GiB, persistenceEnabled=false] Try the following:
^-- Increase maximum off-heap memory size (DataRegionConfiguration.maxSize)
^-- Enable Ignite persistence (DataRegionConfiguration.persistenceEnabled)
^-- Enable eviction or expiration policies
at org.apache.ignite.internal.pagemem.impl.PageMemoryNoStoreImpl.allocatePage(PageMemoryNoStoreImpl.java:304)
at org.apache.ignite.internal.processors.cache.persistence.freelist.AbstractFreeList.allocateDataPage(AbstractFreeList.java:463)
at org.apache.ignite.internal.processors.cache.persistence.freelist.AbstractFreeList.insertDataRow(AbstractFreeList.java:501)
at org.apache.ignite.internal.processors.cache.persistence.RowStore.addRow(RowStore.java:97)
Run Code Online (Sandbox Code Playgroud)
此错误的原因是占用整个数据区域(68 GB)?如果是的话,我们可以通过停止 Ignite 服务来处理这个问题吗?