标签: bigdata

如何在hadoop中按值对字数进行排序?

嗨,我想学习如何在hadoop.i中按值排序单词计数.知道hadoop对排序键的排序,而不是值.

我知道要对值进行排序,我们必须有一个分区器,分组比较器和一个排序比较器

但我有点困惑在于将这些概念应用于一起按值排序单词计数.

我们是否需要另一个地图减少作业以实现相同或者组合器来计算出现次数然后在这里排序并将它们发送到减速器?

任何人都可以解释如何按值排序单词计数示例?

hadoop mapreduce bigdata partitioner

12
推荐指数
2
解决办法
2万
查看次数

Mongo配置服务器可以在每个配置服务器中具有不同的用户权限吗?

我最近发现用户拥有的权限集在所有3个配置服务器中都不相同.有些用户甚至不存在于其中一个配置服务器中.创建用户时,他们是否都为3个配置服务器设置了相同的副本集?

我怎样才能解决这个问题?

bigdata mongodb

12
推荐指数
1
解决办法
113
查看次数

如何将多个pandas数据帧连接到一个大于内存的dask数据帧?

我正在解析制表符分隔的数据以创建表格数据,我想将其存储在HDF5中.

我的问题是我必须将数据聚合成一种格式,然后转储到HDF5.这是大约1 TB大小的数据,所以我自然无法将其放入RAM中.Dask可能是完成此任务的最佳方式.

如果我使用解析我的数据来适应一个pandas数据帧,我会这样做:

import pandas as pd
import csv   

csv_columns = ["COL1", "COL2", "COL3", "COL4",..., "COL55"]
readcsvfile = csv.reader(csvfile)

total_df = pd.DataFrame()    # create empty pandas DataFrame
for i, line in readcsvfile:
    # parse create dictionary of key:value pairs by table field:value, "dictionary_line"
    # save dictionary as pandas dataframe
    df = pd.DataFrame(dictionary_line, index=[i])  # one line tabular data 
    total_df = pd.concat([total_df, df])   # creates one big dataframe
Run Code Online (Sandbox Code Playgroud)

使用dask执行相同的任务,用户应该尝试这样的事情:

import pandas as pd
import csv 
import dask.dataframe as dd
import …
Run Code Online (Sandbox Code Playgroud)

hdf5 bigdata pytables pandas dask

12
推荐指数
1
解决办法
2412
查看次数

如何将RDD保存到HDFS中以后再读回?

我有一个RDD,其元素是类型(长,字符串).出于某种原因,我想将整个RDD保存到HDFS中,稍后还会在Spark程序中读取该RDD.有可能吗?如果是这样,怎么样?

scala bigdata hdfs apache-spark rdd

12
推荐指数
2
解决办法
2万
查看次数

"Bigdata"有多大的数据?

有多少数据有资格被归类为Bigdata?

有多大的数据可以决定是时候采用Hadoop等技术并利用分布式计算的强大功能?

我相信这些技术有一定的优势,那么如何确保使用Bigdata方法将利用当前的系统呢?

hadoop mapreduce bigdata

11
推荐指数
2
解决办法
8368
查看次数

Django + Postgres +大型时间序列

我正在寻找一个包含大量,大部分不可压缩的时间序列数据的项目,并想知道带有原始SQL的Django + Postgres是否是正确的调用.

我有时间序列数据,每小时约2K对象/小时.这是我每年存储的大约200万行,我想1)能够通过连接切片数据进行分析,2)能够在网上进行基本的概述工作,由Django提供服务.我认为最好的想法是将Django用于对象本身,但是使用原始SQL来处理与之关联的大型时间序列数据.我认为这是一种混合方式; 这可能是一个红旗,但使用完整的ORM进行一系列的数据样本感觉就像是过度杀伤.有没有更好的办法?

python django postgresql heroku bigdata

11
推荐指数
3
解决办法
5527
查看次数

[schema.xml] fieldType"pint"的SolrException插件初始化失败:加载类'solr.IntField'时出错

我收到了这个错误

collection1:org.apache.solr.common.SolrException:org.apache.solr.common.SolrException:无法为core collection1加载conf:[schema.xml] fieldType"pint"的插件初始化失败:加载类'solr时出错. IntField".

当我试图导入集合1(solr 4.5)架构到solr 5.1.

我只从不同的机器上复制集合1,其中solr 4.5运行并粘贴在这里/ solr/server/solr/collection1其中solr 5.1运行并重新启动solr.对不起,我是初学者,不太了解solr,只需按照一些教程.

日志

org.apache.solr.common.SolrException: Could not load conf for core collection1: Plugin init failure for [schema.xml] fieldType "pint": Error loading class 'solr.IntField'. Schema file is /home/jackson/Downloads/solr/server/solr/collection1/conf/schema.xml
    at org.apache.solr.core.ConfigSetService.getConfig(ConfigSetService.java:78)
    at org.apache.solr.core.CoreContainer.create(CoreContainer.java:516)
    at org.apache.solr.core.CoreContainer$1.call(CoreContainer.java:283)
    at org.apache.solr.core.CoreContainer$1.call(CoreContainer.java:277)
    at java.util.concurrent.FutureTask.run(FutureTask.java:262)
    at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1145)
    at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:615)
    at java.lang.Thread.run(Thread.java:745)
Caused by: org.apache.solr.common.SolrException: Plugin init failure for [schema.xml] fieldType "pint": Error loading class 'solr.IntField'. Schema file is /home/jackson/Downloads/solr/server/solr/collection1/conf/schema.xml
    at org.apache.solr.schema.IndexSchema.readSchema(IndexSchema.java:596)
    at org.apache.solr.schema.IndexSchema.<init>(IndexSchema.java:175)
    at org.apache.solr.schema.IndexSchemaFactory.create(IndexSchemaFactory.java:55)
    at org.apache.solr.schema.IndexSchemaFactory.buildIndexSchema(IndexSchemaFactory.java:69)
    at org.apache.solr.core.ConfigSetService.createIndexSchema(ConfigSetService.java:102) …
Run Code Online (Sandbox Code Playgroud)

apache solr bigdata tomcat7 solr-schema

11
推荐指数
2
解决办法
1万
查看次数

Google Freebase Search API替代方案?

Google弃用了他们的Freebase Search API,并将内容转移到了Wikidata,但似乎没有替代他们的Freebase Search API(https://developers.google.com/freebase/v1/search-overview):

  • 自动提供实体(例如Freebase Suggest Widget)
  • 获取具有给定名称的最值得注意的实体的排名列表.
  • 使用Search Metaschema查找实体.

此外,它还会采用格式错误的字符串并更正它们,并返回详细的相关性排名,以及相关的freebase主题ID.我在他们的自定义搜索API中找不到任何返回与其相关的任何信息或任何其他知识图的内容.

理想情况下,我想查询与此类似的东西并返回一个像以前一样的结果:

例如,Freebase Search API中的"Nirvana"查询将返回:

{
  "status":"200 OK",
  "result":[
    {
      "mid":"/m/0b1zz",
      "name":"Nirvana",
      "notable":{"name":"Record Producer","id":"/music/producer"},
      "score":55.227268
    },{
      "mid":"/m/05b3c",
      "name":"Nirvana",
      "notable":{"name":"Belief","id":"/religion/belief"},
      "score":44.248726
    },{
      "mid":"/m/01h89tx",
      "name":"Nirvana",
      "notable":{"name":"Musical Album","id":"/music/album"},
      "score":30.371510
    },{
      "mid":"/m/01rn9fm",
      "name":"Nirvana",
      "notable":{"name":"Musical Group","id":"/music/musical_group"},
      "score":30.092449
    },{
      "mid":"/m/02_6qh",
      "name":"Nirvana",
      "notable":{"name":"Film","id":"/film/film"},
      "score":29.003593
    },{
      "mid":"/m/01rkx5",
      "name":"Nirvana Sutra",
      "score":21.344824
    }
  ],
  "cost":10,
  "hits":0
}
Run Code Online (Sandbox Code Playgroud)

请注意相关性,以及Freebase mid.

基本上有没有任何替代品,无论是开源还是商业,取代了这些急需的功能?

search full-text-search freebase bigdata

11
推荐指数
1
解决办法
4889
查看次数

什么是apache zeppelin?

正如我们经常听到的apache zeppelin那样,我们脑海中浮现的问题很少:

  1. 什么是Apache zeppelin?
  2. 它为Big数据生态系统增加了什么新的和/或额外的?
  3. 它是否取代了大数据生态系统中已存在的一些框架/工具?

bigdata apache-spark apache-zeppelin

11
推荐指数
2
解决办法
6616
查看次数

scala.reflect.internal.MissingRequirementError:找不到编译器镜像中的对象java.lang.Object

我试图使用sbt包构建spark流应用程序,我无法发现这个错误的原因是什么.

这是错误的一部分

scala.reflect.internal.MissingRequirementError:找不到编译器镜像中的对象java.lang.Object.在scala.reflect.internal.MissingRequirementError $.信号(MissingRequirementError.scala:16)在scala.reflect.internal.MissingRequirementError $ .notFound(MissingRequirementError.scala:17)在scala.reflect.internal.Mirrors $ RootsBase.getModuleOrClass(镜像.scala:48)在scala.reflect.internal.Mirrors $ RootsBase.getModuleOrClass(Mirrors.scala:40)在scala.reflect.internal.Mirrors $ RootsBase.getModuleOrClass(Mirrors.scala:40)

这是代码

import org.apache.spark.SparkContext
import org.apache.spark._
import org.apache.spark.streaming._
import org.apache.spark.streaming.twitter._
import twitter4j.Status
object TrendingHashTags {
def main(args: Array[String]): Unit = {
val Array(consumerKey, consumerSecret, accessToken, accessTokenSecret,
lang, batchInterval, minThreshold, showCount ) = args.take(8)
val filters = args.takeRight(args.length - 8)
System.setProperty("twitter4j.oauth.consumerKey", consumerKey)
System.setProperty("twitter4j.oauth.consumerSecret", consumerSecret)
System.setProperty("twitter4j.oauth.accessToken", accessToken)
System.setProperty("twitter4j.oauth.accessTokenSecret", accessTokenSecret)
val conf = new SparkConf().setAppName("TrendingHashTags")
val ssc = new StreamingContext(conf, Seconds(batchInterval.toInt))
val tweets = TwitterUtils.createStream(ssc, None, filters)
val tweetsFilteredByLang = tweets.filter{tweet => …
Run Code Online (Sandbox Code Playgroud)

scala bigdata apache-spark

11
推荐指数
2
解决办法
7712
查看次数