我目前正在(开始)我的大数据和数据可视化项目.所以请告诉我是否有最好的软件来处理大数据和数据可视化,即用于数据分析.
我有一个1.6百万行的列表,如下所示:
N123HN /var/foo/bar/baz/A/Alpha.file.1234.bin
N123HN /var/foo/bar/baz/A/Alpha.file.1235.bin
N123KL /var/foo/bar/baz/A/Alpha.file.1236.bin
Run Code Online (Sandbox Code Playgroud)
我有一个Perl脚本,它基本上只是在第二列上查看这些数据,作为在第一列中查找值的一种方式(然后它使用"N123HN"值进行其他魔术等).就像现在一样,我的应用程序花费大约4分钟摄取文件并将其加载到一个巨大的哈希(键/值数组)中.虽然由于显而易见的原因,类似grep的函数本身很慢,但运行此脚本的最慢部分是每次运行时都会大量获取数据.
任何人都有任何聪明的想法如何更快地访问这些数据?由于它只是两列的列表,因此对于此用例,关系数据库似乎非常重要.
我在这里重新编辑原始问题,因为将源代码粘贴到评论框中非常难看.
我用来摄取巨大文件的算法是这样的:
while(<HUGEFILE>)
{
# hugefile format:
# nln N123HN ---- 1 0 1c44f5.4a6ee12 17671854355 /var/foo/bar/baz/A/Alpha.file.1234.bin 0
next if /^(\s)*$/; # skip blank lines
chomp; # remove trailing newline characters
@auditrows = split; # an array of entire rows, split on whitespace
my $file_url = $auditrows[7]; # /var/foo/bar/baz/A/Alpha.file.1234.bin
my $tapenum = "$auditrows[1] "; # N123HN
$tapenumbers{ $file_url } = $tapenum; # key = "/var/foo/bar/baz/A/Alpha.file.1234.bin"
} # value = "N123HN"
Run Code Online (Sandbox Code Playgroud) 很多帖子(比如这个)都声称这个ff软件包优于,bigmemory因为它可以处理具有原子和非原子组件的对象,但是如何?例如:
UNIT <- c(100,100, 200, 200, 200, 200, 200, 300, 300, 300,300)
STATUS <- c('ACTIVE','INACTIVE','ACTIVE','ACTIVE','INACTIVE','ACTIVE','INACTIVE','ACTIVE',
'ACTIVE','ACTIVE','INACTIVE')
TERMINATED <- as.Date(c('1999-07-06','2008-12-05','2000-08-18','2000-08-18','2000-08-18',
'2008-08-18','2008-08-18','2006-09-19','2006-09-19','2006-09-19',
'1999-03-15'))
START <- as.Date(c('2007-04-23','2008-12-06','2004-06-01','2007-02-01','2008-04-19',
'2010-11-29','2010-12-30','2007-10-29','2008-02-05','2008-06-30',
'2009-02-07'))
STOP <- as.Date(c('2008-12-05','2012-12-31','2007-01-31','2008-04-18','2010-11-28',
'2010-12-29','2012-12-31','2008-02-04','2008-06-29','2009-02-06',
'2012-12-31'))
TEST <- data.frame(UNIT,STATUS,TERMINATED,START,STOP)
TEST
#install.packages('ff')
library('ff')
TEST2 <- ffdf(TEST)
Error in ffdf(TEST) : ffdf components must be atomic ff objects
Run Code Online (Sandbox Code Playgroud)
我能做些什么来完成这项工作?
请查看以下代码
package com.example.jsontest;
import java.io.BufferedReader;
import java.io.IOException;
import java.io.InputStream;
import java.io.InputStreamReader;
import org.apache.http.HttpEntity;
import org.apache.http.HttpResponse;
import org.apache.http.StatusLine;
import org.apache.http.client.ClientProtocolException;
import org.apache.http.client.HttpClient;
import org.apache.http.client.methods.HttpGet;
import org.apache.http.client.methods.HttpPost;
import org.apache.http.impl.client.DefaultHttpClient;
import org.json.JSONArray;
import org.json.JSONException;
import org.json.JSONObject;
import android.app.Activity;
import android.os.Bundle;
import android.os.StrictMode;
import android.util.Log;
import android.widget.EditText;
import android.widget.Toast;
public class MainActivity extends Activity {
private EditText editText;
/** Called when the activity is first created. */
@Override
public void onCreate(Bundle savedInstanceState) {
super.onCreate(savedInstanceState);
StrictMode.ThreadPolicy policy = new StrictMode.
ThreadPolicy.Builder().permitAll().build();
StrictMode.setThreadPolicy(policy);
setContentView(R.layout.activity_main);
editText = …Run Code Online (Sandbox Code Playgroud) 我正在学习班上的大数据,现在我们正在学习HIVE.我们今天了解了地图绘制器和减速器,但老实说它已经超越了我的脑海.有人可以向我解释映射器和减速器在每一步中的作用吗?或者至少指出一些好的读数?提前致谢
在http:// localhost:11000/oozie /上浏览oozie
它在网页上显示以下错误 -
org.apache.jasper.JasperException: Unable to compile class for JSP:
An error occurred at line: 25 in the generated java file
The method getJspApplicationContext(ServletContext) is undefined for the type JspFactory
Stacktrace:
org.apache.jasper.compiler.DefaultErrorHandler.javacError(DefaultErrorHandler.java:92)
org.apache.jasper.compiler.ErrorDispatcher.javacError(ErrorDispatcher.java:330)
org.apache.jasper.compiler.JDTCompiler.generateClass(JDTCompiler.java:451)
org.apache.jasper.compiler.Compiler.compile(Compiler.java:356)
org.apache.jasper.compiler.Compiler.compile(Compiler.java:334)
org.apache.jasper.compiler.Compiler.compile(Compiler.java:321)
org.apache.jasper.JspCompilationContext.compile(JspCompilationContext.java:592)
org.apache.jasper.servlet.JspServletWrapper.service(JspServletWrapper.java:328)
org.apache.jasper.servlet.JspServlet.serviceJspFile(JspServlet.java:313)
org.apache.jasper.servlet.JspServlet.service(JspServlet.java:260)
javax.servlet.http.HttpServlet.service(HttpServlet.java:723)
org.apache.oozie.servlet.AuthFilter$2.doFilter(AuthFilter.java:126)
org.apache.hadoop.security.authentication.server.AuthenticationFilter.doFilter(AuthenticationFilter.java:585)
org.apache.hadoop.security.authentication.server.AuthenticationFilter.doFilter(AuthenticationFilter.java:548)
org.apache.oozie.servlet.AuthFilter.doFilter(AuthFilter.java:131)
org.apache.oozie.servlet.HostnameFilter.doFilter(HostnameFilter.java:84)
Run Code Online (Sandbox Code Playgroud)

我需要从一个大的csv文件中选择一些值并使用R将它们保存在一个新的.例如,原始表是这样的:
CODINV2 INCY APPLID
701 BE 15831845
3103 DE 17301283
701 BE 16428865
7802 NL 16285035
8501 IT 15725319
8502 IT 16428857
Run Code Online (Sandbox Code Playgroud)
我想只选择INCY值为"BE"和"IT"的行.新文件csv应该是这样的:
CODINV2 INCY APPLID
701 BE 15831845
701 BE 16428865
8501 IT 15725319
8502 IT 16428857
Run Code Online (Sandbox Code Playgroud) 我想将一个带键的500GB-800GB表转储到HDF5中,然后检索与特定键匹配的行.
对于HDF5文件,像所有数据访问这样的项使用整数"行"数字,所以我似乎必须在HDF5之外实现"行号键映射".
这会有用吗?我是否需要访问内存(RAM)中的整个HDF5?
任何人都可以告诉我HDF5在这种情况下的表现有多糟糕吗?如果有合适的索引,这只是一本庞大的字典,对吧?
我应该使用其他东西吗?
我想比较两个文件,如果不匹配的额外记录加载到具有不匹配记录的另一个文件.比较文件和记录计数中的每个字段.
在Spark的WebUI(端口8080)中和环境选项卡上,存在以下设置:
user.timezone祖鲁语
您知道如何/在哪里可以将其覆盖到UTC吗?
信封详细信息:
编辑(有人回答以下内容然后删除):https : //www.timeanddate.com/time/zones/z