标签: bigdata

处理大数据和数据可视化的最佳工具

我目前正在(开始)我的大数据和数据可视化项目.所以请告诉我是否有最好的软件来处理大数据和数据可视化,即用于数据分析.

data-visualization data-analysis bigdata

0
推荐指数
1
解决办法
610
查看次数

在Perl中,访问1.6百万行键/值对的最快方法是什么?

我有一个1.6百万行的列表,如下所示:

N123HN  /var/foo/bar/baz/A/Alpha.file.1234.bin
N123HN  /var/foo/bar/baz/A/Alpha.file.1235.bin
N123KL  /var/foo/bar/baz/A/Alpha.file.1236.bin
Run Code Online (Sandbox Code Playgroud)

我有一个Perl脚本,它基本上只是在第二列上查看这些数据,作为在第一列中查找值的一种方式(然后它使用"N123HN"值进行其他魔术等).就像现在一样,我的应用程序花费大约4分钟摄取文件并将其加载到一个巨大的哈希(键/值数组)中.虽然由于显而易见的原因,类似grep的函数本身很慢,但运行此脚本的最慢部分是每次运行时都会大量获取数据.

任何人都有任何聪明的想法如何更快地访问这些数据?由于它只是两列的列表,因此对于此用例,关系数据库似乎非常重要.

我在这里重新编辑原始问题,因为将源代码粘贴到评论框中非常难看.

我用来摄取巨大文件的算法是这样的:

while(<HUGEFILE>)
    {
      # hugefile format:
      # nln N123HN ---- 1 0 1c44f5.4a6ee12 17671854355 /var/foo/bar/baz/A/Alpha.file.1234.bin 0

      next if /^(\s)*$/;      # skip blank lines
      chomp;                  # remove trailing newline characters
      @auditrows = split;     # an array of entire rows, split on whitespace
      my $file_url = $auditrows[7];              # /var/foo/bar/baz/A/Alpha.file.1234.bin 
      my $tapenum  = "$auditrows[1] ";          # N123HN
      $tapenumbers{ $file_url } = $tapenum;      # key   = "/var/foo/bar/baz/A/Alpha.file.1234.bin" 
    }                                           # value = "N123HN"
Run Code Online (Sandbox Code Playgroud)

database perl performance-testing bigdata

0
推荐指数
1
解决办法
418
查看次数

如何将ffdf应用于非原子数据帧?

很多帖子(比如这个)都声称这个ff软件包优于,bigmemory因为它可以处理具有原子和非原子组件的对象,但是如何?例如:

UNIT <- c(100,100, 200, 200, 200, 200, 200, 300, 300, 300,300)
STATUS <- c('ACTIVE','INACTIVE','ACTIVE','ACTIVE','INACTIVE','ACTIVE','INACTIVE','ACTIVE',
        'ACTIVE','ACTIVE','INACTIVE') 
TERMINATED <- as.Date(c('1999-07-06','2008-12-05','2000-08-18','2000-08-18','2000-08-18',
                    '2008-08-18','2008-08-18','2006-09-19','2006-09-19','2006-09-19',
                    '1999-03-15')) 
START <- as.Date(c('2007-04-23','2008-12-06','2004-06-01','2007-02-01','2008-04-19',
               '2010-11-29','2010-12-30','2007-10-29','2008-02-05','2008-06-30',
               '2009-02-07'))
STOP <- as.Date(c('2008-12-05','2012-12-31','2007-01-31','2008-04-18','2010-11-28',
              '2010-12-29','2012-12-31','2008-02-04','2008-06-29','2009-02-06',
              '2012-12-31'))
TEST <- data.frame(UNIT,STATUS,TERMINATED,START,STOP)
TEST                   

#install.packages('ff')            
library('ff')            
TEST2 <- ffdf(TEST)            
Error in ffdf(TEST) : ffdf components must be atomic ff objects
Run Code Online (Sandbox Code Playgroud)

我能做些什么来完成这项工作?

r bigdata dataframe

0
推荐指数
1
解决办法
1499
查看次数

如何打印整个JSON输出?

请查看以下代码

package com.example.jsontest;

import java.io.BufferedReader;
import java.io.IOException;
import java.io.InputStream;
import java.io.InputStreamReader;

import org.apache.http.HttpEntity;
import org.apache.http.HttpResponse;
import org.apache.http.StatusLine;
import org.apache.http.client.ClientProtocolException;
import org.apache.http.client.HttpClient;
import org.apache.http.client.methods.HttpGet;
import org.apache.http.client.methods.HttpPost;
import org.apache.http.impl.client.DefaultHttpClient;
import org.json.JSONArray;
import org.json.JSONException;
import org.json.JSONObject;

import android.app.Activity;
import android.os.Bundle;
import android.os.StrictMode;
import android.util.Log;
import android.widget.EditText;
import android.widget.Toast;

public class MainActivity extends Activity {

    private EditText editText;

/** Called when the activity is first created. */

  @Override
  public void onCreate(Bundle savedInstanceState) {
    super.onCreate(savedInstanceState);

    StrictMode.ThreadPolicy policy = new StrictMode.
    ThreadPolicy.Builder().permitAll().build();
    StrictMode.setThreadPolicy(policy); 

    setContentView(R.layout.activity_main);

    editText = …
Run Code Online (Sandbox Code Playgroud)

android json get bigdata

0
推荐指数
1
解决办法
3891
查看次数

了解HIVE数据库中的映射器和reducer

我正在学习班上的大数据,现在我们正在学习HIVE.我们今天了解了地图绘制器和减速器,但老实说它已经超越了我的脑海.有人可以向我解释映射器和减速器在每一步中的作用吗?或者至少指出一些好的读数?提前致谢

database hadoop hive bigdata

0
推荐指数
1
解决办法
4274
查看次数

在localhost上的oozie中获取错误500

http:// localhost:11000/oozie /上浏览oozie

它在网页上显示以下错误 -

org.apache.jasper.JasperException: Unable to compile class for JSP: 

An error occurred at line: 25 in the generated java file
The method getJspApplicationContext(ServletContext) is undefined for the type JspFactory

Stacktrace:
    org.apache.jasper.compiler.DefaultErrorHandler.javacError(DefaultErrorHandler.java:92)
    org.apache.jasper.compiler.ErrorDispatcher.javacError(ErrorDispatcher.java:330)
    org.apache.jasper.compiler.JDTCompiler.generateClass(JDTCompiler.java:451)
    org.apache.jasper.compiler.Compiler.compile(Compiler.java:356)
    org.apache.jasper.compiler.Compiler.compile(Compiler.java:334)
    org.apache.jasper.compiler.Compiler.compile(Compiler.java:321)
    org.apache.jasper.JspCompilationContext.compile(JspCompilationContext.java:592)
    org.apache.jasper.servlet.JspServletWrapper.service(JspServletWrapper.java:328)
    org.apache.jasper.servlet.JspServlet.serviceJspFile(JspServlet.java:313)
    org.apache.jasper.servlet.JspServlet.service(JspServlet.java:260)
    javax.servlet.http.HttpServlet.service(HttpServlet.java:723)
    org.apache.oozie.servlet.AuthFilter$2.doFilter(AuthFilter.java:126)
    org.apache.hadoop.security.authentication.server.AuthenticationFilter.doFilter(AuthenticationFilter.java:585)
    org.apache.hadoop.security.authentication.server.AuthenticationFilter.doFilter(AuthenticationFilter.java:548)
    org.apache.oozie.servlet.AuthFilter.doFilter(AuthFilter.java:131)
    org.apache.oozie.servlet.HostnameFilter.doFilter(HostnameFilter.java:84)
Run Code Online (Sandbox Code Playgroud)

在此输入图像描述

java tomcat hadoop bigdata oozie

0
推荐指数
1
解决办法
845
查看次数

按R中csv中的值选择行,并将它们保存在新的csv文件中

我需要从一个大的csv文件中选择一些值并使用R将它们保存在一个新的.例如,原始表是这样的:

CODINV2   INCY  APPLID
701       BE    15831845
3103      DE    17301283 
701       BE    16428865
7802      NL    16285035
8501      IT    15725319
8502      IT    16428857
Run Code Online (Sandbox Code Playgroud)

我想只选择INCY值为"BE"和"IT"的行.新文件csv应该是这样的:

CODINV2   INCY  APPLID
701       BE    15831845
701       BE    16428865
8501      IT    15725319
8502      IT    16428857
Run Code Online (Sandbox Code Playgroud)

csv select r bigdata libreoffice-calc

0
推荐指数
1
解决办法
109
查看次数

使用PyTables索引500 GB HDF5文件

我想将一个带键的500GB-800GB表转储到HDF5中,然后检索与特定键匹配的行.

对于HDF5文件,像所有数据访问这样的项使用整数"行"数字,所以我似乎必须在HDF5之外实现"行号键映射".

这会有用吗?我是否需要访问内存(RAM)中的整个HDF5?

任何人都可以告诉我HDF5在这种情况下的表现有多糟糕吗?如果有合适的索引,这只是一本庞大的字典,对吧?

我应该使用其他东西吗?

python hdf5 bigdata pytables h5py

0
推荐指数
1
解决办法
846
查看次数

如何使用spark比较两个文件?

我想比较两个文件,如果不匹配的额外记录加载到具有不匹配记录的另一个文件.比较文件和记录计数中的每个字段.

scala bigdata hadoop-streaming apache-spark hadoop2

0
推荐指数
1
解决办法
5963
查看次数

Apache Spark-如何将时区设置为UTC?当前默认为祖鲁语

在Spark的WebUI(端口8080)中和环境选项卡上,存在以下设置:

user.timezone祖鲁语

您知道如何/在哪里可以将其覆盖到UTC吗?

信封详细信息:

  • 火花2.1.1
  • jre-1.8.0-openjdk.x86_64
  • 没有jdk
  • EC2 Amazon Linux

编辑(有人回答以下内容然后删除):https : //www.timeanddate.com/time/zones/z

java hadoop jvm bigdata apache-spark

0
推荐指数
4
解决办法
2491
查看次数