标签: bigdata

mongoDB 中的点赞数

这是我的问题:我想创建一个网络,允许用户上传帖子并喜欢它们。

我想我可以将每个帖子存储在一个名为“帖子”的集合中,并且这样做没有问题。

但是我可以在哪里存储每个帖子的点赞以及相关数据(时间、用户来源等)?我无法在帖子文档中执行此操作,因为文档的最大大小为 16MB,想象一下我必须为每个帖子记录数千个点赞以及相关数据,我无法做到这一点。

我可以将每个帖子与一个集合相关联,其中包含文档,并且每个文档都是相似的。但老实说,如果可能的话,我不想创建数以百万计的收藏。

邮寄文件示例:

{_id: blabla, userfrom: {}, txt: "i am the post", time: {}, geo: {}, likes: {here i have to add as many likes as users clicks, and it can exceed 16MB}}

现在在“喜欢”中我可以引用一个集合,但这是我不想做的。

我读到了 mongodb 中的 gridstore 但我没有明白这一点。我可以将其用作大小趋于无限的文档吗?这样我就可以添加任意数量的记录?因此,使用网格商店我可以做类似的事情:

{_id: blabla, userfrom: {}, txt: "i am the post", time: {}, geo: {}, likes: {infinite records}}

有人可以帮我处理吗?谢谢

database bigdata mongodb node.js

1
推荐指数
1
解决办法
1732
查看次数

Postgres:具有(延迟)读写访问权限的巨大表

我有一个巨大的表(目前约有 300 万行,预计将增加 1000 倍),每秒都会有大量插入。该表永远不会更新。

现在我必须在该表上运行查询,该查询非常慢(如预期)。这些查询不必 100% 准确,如果结果是一天前的(但不是更早的)就可以了。

目前两个整数列上有两个索引,我必须再添加两个索引(整数和时间戳列)以加快查询速度。

到目前为止我的想法:

  1. 将两个缺失的索引添加到表中
  2. 大表上根本没有索引,并将内容(作为日常任务)复制到第二个表(只是重要的行),然后在第二个表上创建索引并在该表上运行查询?
  3. 对大表进行分区
  4. 主/从设置(写入主机并从从机读取)。

就性能而言,什么选项是最好的?你有什么其他的建议?

编辑:

这是表格(我已经标记了外键并稍微美化了查询):

CREATE TABLE client_log
(
   id                 serial          NOT NULL,
   logid              integer         NOT NULL,
   client_id          integer         NOT NULL,  (FOREIGN KEY)
   client_version     varchar(16),
   sessionid          varchar(100)    NOT NULL,
   created            timestamptz     NOT NULL,
   filename           varchar(256),
   funcname           varchar(256),
   linenum            integer,
   comment            text,
   domain             varchar(128),
   code               integer,
   latitude           float8,
   longitude          float8,
   created_on_server  timestamptz     NOT NULL,
   message_id         integer,                   (FOREIGN KEY)
   app_id             integer         NOT NULL,  (FOREIGN KEY)
   result             integer
);

CREATE INDEX …
Run Code Online (Sandbox Code Playgroud)

sql postgresql indexing bigdata

1
推荐指数
1
解决办法
1299
查看次数

JSON 格式的公共数据集

在哪里可以找到 Json 格式的公共数据集?我正在寻找 10-20GB 范围内的一款。目前我得到的大数据集是 XML 格式

json public dataset bigdata

1
推荐指数
1
解决办法
2976
查看次数

我如何根据多个参数推荐内容(比如电影)

我是 Spark ML 的新手。我想向使用 Apache Spark ML 的用户推荐电影。我在这里了解到我们可以根据用户的评分推荐电影。

我的问题是我们是否可以包括其他推荐功能,比如他的年龄、国家、电影类型、喜欢等。例如,我们有用户“U1”、“U2”、“U3”和“U4”。看电影'M'。生活在美国的22岁的U1也看了电影M1、M2和M3,生活在澳大利亚的50岁的U2看了电影M1、M4和M5。现在,我想推荐24岁的U3住在美国电影M1,M2和M3。也推荐电影M1、M4和M5到居住在澳大利亚的21岁的U4。

基本上,我想为年龄和国家提供一些权重。我们如何使用 Spark ml(比如使用 ALS)实现这一目标?

recommendation-engine bigdata apache-spark-mllib

1
推荐指数
1
解决办法
850
查看次数

您如何将 Spring Boot 日志直接摄取到弹性中

我正在研究将 Spring Boot 应用程序日志直接发送到弹性搜索的可行性。不使用 filebeats 或 logstash。我相信 Ingest 插件可能会对此有所帮助。

我最初的想法是使用 TCP 上的 logback 来做到这一点。

https://github.com/logstash/logstash-logback-encoder

<?xml version="1.0" encoding="UTF-8"?>
<configuration>
  <appender name="stash" class="net.logstash.logback.appender.LogstashTcpSocketAppender">
      <destination>127.0.0.1:4560</destination>
      <encoder class="net.logstash.logback.encoder.LogstashEncoder" />
  </appender>

  <root level="DEBUG">
      <appender-ref ref="stash" />
  </root>
</configuration>
Run Code Online (Sandbox Code Playgroud)

所以看上面的你可以将日志直接发送到logstash。我只是想知道是否可以使用较新的摄取功能并使用 logstash 跳过?通过使用摄取方法通过网络将 json 编码的日志直接发送到弹性中?

https://www.elastic.co/blog/new-way-to-ingest-part-1

我的问题

我想知道这是否可能?如果是这样,你能解释一下你将如何做到这一点。还有什么可能是陷阱等。

logging spring bigdata elasticsearch data-ingestion

1
推荐指数
1
解决办法
7645
查看次数

HBase 真的是一个列式数据库吗?

我正在阅读有关 HBase 的内容,对它的常见描述是“列式数据库”。这实际上意味着什么?与传统的 RDBMS 相比,HBase 的结构是否相反?

提前致谢!

hbase bigdata

1
推荐指数
1
解决办法
597
查看次数

Python 中 re.compile(r"[\w']+") 的含义

我是 python 新手,正在尝试处理大数据代码,但无法理解表达式re.compile(r"[\w']+") 的含义。有人对此有任何想法吗?

这是我使用的代码。

from mrjob.job import MRJob
import re

WORD_REGEXP = re.compile(r"[\w']+")

class MRWordFrequencyCount(MRJob):

    def mapper(self, _, line):
        words = WORD_REGEXP.findall(line)
        for word in words:
            yield word.lower(), 1

    def reducer(self, key, values):
        yield key, sum(values)


if __name__ == '__main__':
    MRWordFrequencyCount.run()
Run Code Online (Sandbox Code Playgroud)

python mapreduce bigdata python-2.7

1
推荐指数
1
解决办法
2万
查看次数

从 networkx 中的巨大图形中采样

我将从一个巨大的 Graph(大约 1.5M 边和 0.5M 节点)中采样。有什么原因networkx要实现它(我的意思是一个书面功能)?我将统一从节点中采样。(我只需要 networkx 中的一个工具)

如果您能提供任何帮助,我将不胜感激。

graph bigdata networkx python-2.7

1
推荐指数
2
解决办法
2941
查看次数

如何在将数据插入存储桶时合并hive创建的小文件?

我有一个包含呼叫数据记录(CDR)的配置单元表。我在电话号码上对表进行了分区,并在 call_date 上进行了存储。现在,当我将数据插入配置单元时,过时的 call_date 正在我的存储桶中创建小文件,这导致名称节点元数据增加和性能下降。有没有办法将这些小文件合并成一个。

hadoop hive mapreduce bigdata hdfs

1
推荐指数
1
解决办法
6801
查看次数

我们可以在将记录摄取到 Kusto 表之前更改记录的 Kusto 列的值吗?

我创建了一个 Azure 数据资源管理器(ADX)集群和一个表(称之为 ABC)。数据通过 ADX 中的内置管道摄取到 Kusto 表中 -(通过事件网格从 azure blob 摄取数据)。我还创建了一个 JSON 摄取映射,用于摄取数据。我在传入数据中有一个字段,它采用缩写格式。有没有一种方法(可能是 Kusto 函数或 Kusto 摄取映射中的某些属性)允许我参考 - 也许 Kusto 中的另一个表具有相应的缩写和完整形式,并将完整的单词而不是缩写词摄取到表中?传入的数据很快,所以我猜大量计算是不可行的。

database bigdata kql azure-data-explorer

1
推荐指数
1
解决办法
48
查看次数